Lanzamiento de OpenAI GPT-3

Traducido del inglés

GPT-3 es un modelo de lenguaje grande lanzado por OpenAI en 2020, con 175 mil millones de parámetros y un sólido aprendizaje de pocos ejemplos, lo que permite la generación de texto y la realización de tareas a partir de indicaciones mínimas.

Generative Pre-trained Transformer 3 (GPT-3) es un modelo de lenguaje grande lanzado por OpenAI en 2020 como parte de la serie GPT de la empresa. Es un modelo transformador solo de decodificador de red neuronal profunda, que supera las arquitecturas basadas en recurrencia y convolución con un mecanismo de atención que permite un enfoque selectivo en el texto de entrada relevante. GPT-3 tiene 175 mil millones de parámetros, cada uno con precisión de 16 bits, lo que requiere 350 GB de almacenamiento, y una ventana de contexto de 2,048 tokens, demostrando fuertes capacidades de aprendizaje de cero disparos y de pocos disparos en muchas tareas.

Antecedentes

El desarrollo de GPT-3 fue parte de una revolución más amplia en el aprendizaje automático, impulsada por algoritmos mejorados, computadoras más potentes y datos digitalizados aumentados. La arquitectura transformadora, introducida en 2017, se convirtió en una base clave para los sistemas de procesamiento de lenguaje natural (PLN). Los investigadores de OpenAI publicaron un artículo el 11 de junio de 2018, presentando el primer transformador generativo preentrenado (GPT-1), un tipo de modelo de lenguaje grande generativo preentrenado en un corpus de texto extenso y ajustado para tareas específicas. GPT-2, lanzado en febrero de 2019, amplió GPT-1 con 1.5 mil millones de parámetros y se entrenó en 8 millones de páginas web. En febrero de 2020, Microsoft presentó Turing Natural Language Generation (T-NLG) con 17 mil millones de parámetros, que era entonces el modelo de lenguaje más grande.

Entrenamiento y capacidades

El 28 de mayo de 2020, una preimpresión en arXiv de 31 ingenieros e investigadores de OpenAI describió GPT-3, un modelo de lenguaje de tercera generación de última generación. La capacidad de GPT-3 se incrementó en más de dos órdenes de magnitud respecto a GPT-2, convirtiéndolo en el modelo de lenguaje no disperso más grande en ese momento. Su precisión se atribuye a su mayor capacidad y número de parámetros, siendo diez veces más grande que Turing NLG de Microsoft. Lambdalabs estimó un costo hipotético de entrenamiento de alrededor de 4.6 millones de dólares y 355 años en una sola GPU, con un tiempo real menor usando GPUs paralelas.

El conjunto de datos de preentrenamiento comprendía 60% de Common Crawl filtrado (410 mil millones de tokens codificados por pares de bytes), 22% de WebText2 (19 mil millones de tokens), 8% de Books1 (12 mil millones de tokens), 8% de Books2 (55 mil millones de tokens) y 3% de Wikipedia (3 mil millones de tokens). La deduplicación difusa utilizó MinHashLSH de Apache Spark. GPT-3 se entrenó en cientos de miles de millones de palabras y podía codificar en CSS, JSX y Python.

Dado que los datos de entrenamiento eran exhaustivos, GPT-3 no requería más entrenamiento para tareas distintas. Sin embargo, ocasionalmente generaba lenguaje tóxico debido a la imitación de sus datos de entrenamiento. Un estudio de la Universidad de Washington encontró que la toxicidad de GPT-3 era comparable a la de GPT-2 y CTRL. OpenAI implementó estrategias para limitar la salida tóxica, resultando en menos toxicidad que GPT-1 pero más que CTRL Wiki.

El 11 de junio de 2020, OpenAI anunció acceso a su API de GPT-3, un conjunto de herramientas de aprendizaje automático con una interfaz de texto de entrada y texto de salida para cualquier tarea en inglés. Los primeros usuarios lo encontraron "inquietantemente bueno" al escribir texto coherente. En un experimento, 80 sujetos estadounidenses juzgaron artículos cortos como escritos por humanos o por GPT-3, identificando correctamente solo el 52% de las veces, ligeramente mejor que el azar. El 18 de noviembre de 2021, OpenAI hizo el acceso a la API sin restricciones con herramientas de moderación de contenido. El 27 de enero de 2022, los modelos InstructGPT se convirtieron en el estándar, produciendo contenido mejor alineado con menos hechos inventados y menos toxicidad.

La capacidad de GPT-3 para generar artículos de noticias indistinguibles de los escritos por humanos tiene potencial para aplicaciones tanto beneficiosas como dañinas, incluyendo desinformación, spam, phishing y abuso de procesos legales, como se detalla en el artículo del 28 de mayo de 2020.

Licencia comercial

El 22 de septiembre de 2020, Microsoft anunció que había licenciado GPT-3 exclusivamente. Mientras que otros aún podían usar la API pública, solo Microsoft tenía acceso al modelo subyacente. Esta licencia exclusiva fue parte de la asociación más amplia de Microsoft con OpenAI, que incluía inversiones e integración en los servicios de Azure.

Impacto y legado

GPT-3 influyó significativamente en el campo de la inteligencia artificial, demostrando el poder de escalar modelos transformadores. Sus capacidades de aprendizaje de pocos disparos redujeron la necesidad de ajuste específico de tareas, inspirando modelos posteriores como InstructGPT y más tarde GPT-4. El lanzamiento también provocó discusiones sobre las implicaciones éticas de los modelos de lenguaje grandes, incluyendo sesgo, desinformación y control de acceso.

La arquitectura y el enfoque de entrenamiento de GPT-3 se convirtieron en un punto de referencia para modelos de lenguaje grandes posteriores, incluidos los de Anthropic y Google DeepMind. Su éxito comercial a través de la API y la licencia de Microsoft estableció un modelo de negocio para la investigación en IA, influyendo en el panorama más amplio de IA generativa.

Detalles técnicos

GPT-3 utiliza una arquitectura transformadora con atención de múltiples cabezas y codificación posicional. Emplea un diseño solo de decodificador, a diferencia de los modelos codificador-decodificador, y utiliza técnicas como normalización de capas y redes residuales. El entrenamiento implicó descenso de gradiente con optimizadores como Adam y programas de tasa de aprendizaje. Los parámetros del modelo se almacenan con precisión de 16 bits, reduciendo los requisitos de memoria.

La ventana de contexto de 2,048 tokens de GPT-3 limita la longitud de entrada que puede procesar, pero puede generar texto coherente en múltiples párrafos. Su aprendizaje de pocos disparos se logra mediante indicaciones, donde se proporcionan ejemplos en la entrada, sin actualizar los pesos del modelo. Esta capacidad fue una innovación clave, permitiendo una amplia aplicabilidad sin ajuste fino.

Recepción y preocupaciones

GPT-3 recibió una atención generalizada por su impresionante generación de texto, pero también planteó preocupaciones sobre un posible mal uso. Los investigadores destacaron riesgos como la generación de noticias falsas, spam y contenido de phishing. El acceso inicial restringido de OpenAI y las herramientas posteriores de moderación de contenido tenían como objetivo mitigar estos riesgos. La tendencia del modelo a producir lenguaje tóxico, a pesar de las mejoras, siguió siendo una preocupación, lo que llevó a una investigación continua en seguridad y alineación de la IA.

La licencia exclusiva a Microsoft fue controvertida, ya que limitaba el acceso al modelo subyacente para otros investigadores y empresas. Sin embargo, la API pública permitió una experimentación más amplia, contribuyendo al rápido avance de las aplicaciones de modelos de lenguaje.

El lanzamiento de GPT-3 marcó un hito en inteligencia artificial, demostrando el potencial de los modelos transformadores a gran escala y dando forma al futuro de aprendizaje automático y aprendizaje profundo. Su influencia se observa en modelos posteriores y en el creciente campo de IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·machine-learning·language-model·openai
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial