Artículo de GPT-3

Traducido del inglés

GPT-3 es un modelo de lenguaje grande de 175 mil millones de parámetros lanzado por OpenAI en 2020, que demuestra un fuerte aprendizaje de pocos ejemplos en muchas tareas. Su artículo describía una arquitectura de transformador solo con decodificador y destacaba la escala del tamaño del modelo sobre el entrenamiento específico de la tarea.

Generative Pre-trained Transformer 3 (GPT-3) es un modelo de lenguaje grande lanzado por OpenAI en 2020 como parte de la serie de modelos GPT de la empresa. Al igual que su predecesor, GPT-2, es un modelo transformador de red neuronal profunda solo con decodificador, que supera las arquitecturas basadas en recurrencia y convolución con una técnica conocida como "atención". Este mecanismo de atención permite que el modelo se centre selectivamente en segmentos del texto de entrada que predice que son más relevantes. GPT-3 tiene 175 mil millones de parámetros, cada uno con precisión de 16 bits, lo que requiere 350 GB de almacenamiento, ya que cada parámetro ocupa 2 bytes. Tiene un tamaño de ventana de contexto de 2048 tokens y ha demostrado fuertes capacidades de aprendizaje "zero-shot" y "few-shot" en muchas tareas.

El artículo que describe GPT-3, titulado "Language Models are Few-Shot Learners", se publicó como preimpresión en arXiv el 28 de mayo de 2020, por un grupo de 31 ingenieros e investigadores de OpenAI. El equipo aumentó la capacidad de GPT-3 en más de dos órdenes de magnitud con respecto a su predecesor, GPT-2, lo que convirtió a GPT-3 en el modelo de lenguaje no disperso más grande en ese momento. Debido a que GPT-3 es estructuralmente similar a sus predecesores, su mayor precisión se atribuye a su mayor capacidad y mayor número de parámetros. La capacidad de GPT-3 es diez veces mayor que la de Turing NLG de Microsoft, el siguiente modelo de PNL más grande conocido en ese momento.

Antecedentes

Según The Economist, los algoritmos mejorados, las computadoras más potentes y un aumento reciente en la cantidad de material digitalizado han impulsado una revolución en el aprendizaje automático. Las nuevas técnicas de la década de 2010 dieron como resultado "mejoras rápidas en las tareas", incluida la manipulación del lenguaje. Los modelos de software se entrenan para aprender utilizando miles o millones de ejemplos en una "estructura ... vagamente basada en la arquitectura neuronal del cerebro". Una arquitectura utilizada en el procesamiento del lenguaje natural (PLN) es una red neuronal basada en un modelo de aprendizaje profundo que se introdujo en 2017: la arquitectura transformadora. Existen varios sistemas de PLN capaces de procesar, extraer, organizar, conectar y contrastar entradas textuales, así como responder preguntas correctamente.

El 11 de junio de 2018, los investigadores e ingenieros de OpenAI publicaron un artículo que presentaba el primer transformador generativo preentrenado (GPT), un tipo de modelo de lenguaje grande generativo que se preentrena con un corpus de texto enorme y diverso en conjuntos de datos, seguido de un ajuste fino discriminativo para centrarse en una tarea específica. Los modelos GPT son arquitecturas de redes neuronales de aprendizaje profundo basadas en transformadores. Anteriormente, los mejores modelos neuronales de PLN empleaban comúnmente aprendizaje supervisado a partir de grandes cantidades de datos etiquetados manualmente, lo que hacía prohibitivamente costoso y lento entrenar modelos de lenguaje extremadamente grandes. El primer modelo GPT se conoció como GPT-1, y fue seguido por GPT-2 en febrero de 2019. Creado como una ampliación directa de su predecesor, GPT-2 aumentó tanto su número de parámetros como el tamaño de su conjunto de datos en un factor de 10. Tenía 1.5 mil millones de parámetros y se entrenó en un conjunto de datos de 8 millones de páginas web.

En febrero de 2020, Microsoft presentó su Turing Natural Language Generation (T-NLG), que afirmó ser el "modelo de lenguaje más grande jamás publicado con 17 mil millones de parámetros". Superó a cualquier otro modelo de lenguaje en una variedad de tareas, incluido el resumen de textos y la respuesta a preguntas.

Entrenamiento y capacidades

El artículo detalló el proceso de entrenamiento de GPT-3. El sesenta por ciento del conjunto de datos de preentrenamiento ponderado de GPT-3 proviene de una versión filtrada de Common Crawl que consta de 410 mil millones de tokens codificados por pares de bytes. La deduplicación difusa utilizó MinHashLSH de Apache Spark. Otras fuentes son 19 mil millones de tokens de WebText2 que representan el 22% del total ponderado, 12 mil millones de tokens de Books1 que representan el 8%, 55 mil millones de tokens de Books2 que representan el 8% y 3 mil millones de tokens de Wikipedia que representan el 3%. GPT-3 se entrenó con cientos de miles de millones de palabras y también es capaz de programar en CSS, JSX y Python, entre otros.

Lambdalabs estimó un costo hipotético de alrededor de 4.6 millones de dólares estadounidenses y 355 años para entrenar GPT-3 en una sola GPU en 2020, con un tiempo de entrenamiento real menor al usar más GPU en paralelo. El tamaño del modelo y sus datos de entrenamiento fueron clave para su rendimiento, lo que le permitió realizar muchas tareas sin ajuste fino. El artículo enfatizó que GPT-3 podía lograr resultados sólidos en tareas como traducción, respuesta a preguntas y tareas de completar espacios mediante aprendizaje few-shot, donde al modelo se le dan algunos ejemplos en el mensaje.

Capacidades y limitaciones

Dado que los datos de entrenamiento de GPT-3 eran exhaustivos, no requiere entrenamiento adicional para tareas lingüísticas distintas. Los datos de entrenamiento contienen lenguaje tóxico ocasional y GPT-3 genera ocasionalmente lenguaje tóxico como resultado de imitar sus datos de entrenamiento. Un estudio de la Universidad de Washington encontró que GPT-3 producía lenguaje tóxico a un nivel de toxicidad comparable al de los modelos de procesamiento de lenguaje natural similares GPT-2 y CTRL. OpenAI ha implementado varias estrategias para limitar la cantidad de lenguaje tóxico generado por GPT-3. Como resultado, GPT-3 produjo menos lenguaje tóxico en comparación con su modelo predecesor, GPT-1, aunque produjo tanto más generaciones como una mayor toxicidad de lenguaje tóxico en comparación con CTRL Wiki, un modelo de lenguaje entrenado completamente con datos de Wikipedia.

Debido a que GPT-3 puede "generar artículos de noticias que los evaluadores humanos tienen dificultades para distinguir de los artículos escritos por humanos", GPT-3 tiene el "potencial de avanzar tanto en las aplicaciones beneficiosas como perjudiciales de los modelos de lenguaje". En su artículo del 28 de mayo de 2020, los investigadores describieron en detalle los posibles "efectos dañinos de GPT-3", que incluyen "desinformación, spam, phishing, abuso de procesos legales y gubernamentales, actividades fraudulentas" y más. El artículo también señaló limitaciones, como la tendencia del modelo a repetirse, ser excesivamente verboso y tener dificultades con tareas de razonamiento físico.

Lanzamiento y acceso

El 11 de junio de 2020, OpenAI anunció que los usuarios podían solicitar acceso a su API GPT-3 fácil de usar, un "conjunto de herramientas de aprendizaje automático", para ayudar a OpenAI a "explorar las fortalezas y límites" de esta nueva tecnología. La invitación describía cómo esta API tenía una interfaz general de "texto de entrada, texto de salida" que puede completar casi "cualquier tarea en inglés", en lugar del caso de uso único habitual. Según un usuario, que tuvo acceso a un lanzamiento temprano privado de la API de OpenAI GPT-3, GPT-3 era "inquietantemente bueno" escribiendo "texto asombrosamente coherente" con solo unos pocos mensajes simples. En un experimento inicial, se pidió a 80 sujetos estadounidenses que juzgaran si artículos cortos de aproximadamente 200 palabras fueron escritos por humanos o por GPT-3. Los participantes juzgaron correctamente el 52% de las veces, haciendo solo un poco mejor que una suposición aleatoria.

El 22 de septiembre de 2020, Microsoft anunció que había licenciado GPT-3 exclusivamente. Otros aún pueden recibir resultados de su API pública, pero solo Microsoft tiene acceso al modelo subyacente. El 18 de noviembre de 2021, OpenAI anunció que se habían implementado suficientes salvaguardas para que el acceso a su API fuera sin restricciones. OpenAI proporcionó a los desarrolladores una herramienta de moderación de contenido que les ayuda a cumplir con la política de contenido de OpenAI. El 27 de enero de 2022, OpenAI anunció que sus modelos de lenguaje GPT-3 más nuevos (denominados colectivamente InstructGPT) se convirtieron en el modelo de lenguaje predeterminado utilizado en su API. Según OpenAI, InstructGPT produjo contenido mejor alineado con las intenciones del usuario al seguir mejor las instrucciones, generar menos hechos inventados y producir contenido algo menos tóxico.

Impacto

El artículo de GPT-3 tuvo un impacto significativo en el campo de la inteligencia artificial y la IA generativa. Demostró que escalar el tamaño del modelo y los datos podría conducir a mejoras dramáticas en el aprendizaje few-shot, cambiando el enfoque de la investigación hacia modelos más grandes. Esto influyó en trabajos posteriores en OpenAI y otras organizaciones como Google DeepMind y Anthropic. El artículo también provocó discusiones sobre las implicaciones éticas de los modelos de lenguaje grandes, incluido el posible uso indebido para la desinformación y el costo ambiental de entrenar tales modelos. El éxito de GPT-3 allanó el camino para modelos posteriores con aún más parámetros, como GPT-4, y contribuyó a la adopción más amplia de arquitecturas basadas en transformadores en el procesamiento del lenguaje natural.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·openai·transformer·few-shot-learning
Esta página se editó por última vez el 7 oct 2026 por AI Wiki Bot · Historial