Lanzamiento de OpenAI GPT-3

Traducido del inglés

GPT-3 es un modelo de lenguaje grande lanzado por OpenAI en junio de 2020, con 175 mil millones de parámetros, destacado por sus capacidades de cero disparo y pocos disparos. Su lanzamiento como API permitió un acceso amplio, y Microsoft posteriormente licenció el modelo de forma exclusiva.

Generative Pre-trained Transformer 3 (GPT-3) es un modelo de lenguaje grande lanzado por OpenAI en 2020 como parte de la serie de modelos GPT de la empresa. Es un modelo Transformer (architecture) solo de decodificador de una red neuronal profunda, que utiliza un mecanismo de atención para enfocarse selectivamente en segmentos de entrada relevantes. Con 175 mil millones de parámetros, cada uno almacenado en precisión de 16 bits, GPT-3 requiere 350 GB de almacenamiento y admite una ventana de contexto de 2,048 tokens. Demostró un fuerte aprendizaje de cero disparos y de pocos disparos en muchas tareas, y su lanzamiento a través de una API se anunció el 11 de junio de 2020.

Antecedentes

Según The Economist, algoritmos mejorados, computadoras más potentes y un corpus digitalizado en crecimiento impulsaron una revolución en el Machine learning. Las nuevas técnicas de la década de 2010 llevaron a mejoras rápidas en la manipulación del lenguaje, basándose en arquitecturas neuronales vagamente inspiradas en el cerebro. La arquitectura Transformer (architecture), introducida en 2017, se volvió fundamental para los sistemas de Natural language processing. En junio de 2018, OpenAI publicó el primer transformer generativo preentrenado (GPT-1), un modelo entrenado en un gran corpus de texto y luego ajustado para tareas específicas. GPT-2 siguió en febrero de 2019, escalando parámetros y tamaño del conjunto de datos diez veces, alcanzando 1.5 mil millones de parámetros entrenados en 8 millones de páginas web. En febrero de 2020, Microsoft presentó Turing NLG, un modelo de 17 mil millones de parámetros, considerado entonces el más grande.

Entrenamiento y capacidades

El 28 de mayo de 2020, una preimpresión en arXiv de 31 ingenieros e investigadores de OpenAI describió el desarrollo de GPT-3, aumentando la capacidad del modelo en más de dos órdenes de magnitud en comparación con GPT-2, convirtiéndolo en el modelo de lenguaje no disperso más grande de ese período. Su precisión se derivó de una mayor capacidad y parámetros, siendo diez veces más grande que Turing NLG de Microsoft. Lambdalabs estimó el costo de entrenamiento en 4.6 millones de dólares y 355 años en una sola GPU en 2020. Los datos de preentrenamiento incluyeron 410 mil millones de tokens codificados por pares de bytes de Common Crawl filtrado (60% de los datos ponderados), además de WebText2, Books1, Books2 y Wikipedia (3%). GPT-3 también podía programar en Python, JSX y CSS.

GPT-3 carecía de ajuste fino específico para tareas, en su lugar manejaba instrucciones amplias. Sin embargo, los datos de entrenamiento contenían lenguaje tóxico que el modelo a veces podía reproducir. Un estudio de la Universidad de Washington encontró que la toxicidad de GPT-3 era comparable a la de GPT-2 y CTRL. OpenAI implementó estrategias de mitigación, reduciendo las salidas tóxicas en comparación con GPT-1.

Acceso a la API y evaluación

El 11 de junio de 2020, OpenAI lanzó una API de propósito general con una interfaz de texto de entrada y texto de salida, permitiendo cualquier tarea en inglés, en lugar de casos de uso únicos. Los primeros probadores describieron a GPT-3 como sorprendentemente bueno en la generación de texto coherente. En un experimento con 80 participantes estadounidenses, solo una tasa correcta del 52% distinguía los artículos de GPT-3 de los escritos por humanos, una ligera ventaja sobre el azar. El 18 de noviembre de 2021, OpenAI amplió el acceso a su API con una herramienta de moderación de contenido. El 27 de enero de 2022, InstructGPT se convirtió en el modelo predeterminado de la API, mejorando el seguimiento de instrucciones y reduciendo los hechos fabricados.

Licencia e impacto

El 22 de septiembre de 2020, Microsoft anunció una licencia exclusiva para el modelo subyacente de GPT-3. Otros podían usar la API pública, pero solo Microsoft podía acceder al código y los pesos. GPT-3 demostró potencial para generar artículos de noticias difíciles de distinguir de la escritura humana, lo que generó preocupaciones sobre desinformación y fraude. Los investigadores describieron efectos dañinos potenciales, incluidos el spam y el abuso legal.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:openai·large-language-model·generative-ai·natural-language-processing
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial