Traducido del inglés

GPT-3 es un modelo de lenguaje de gran escala lanzado por OpenAI en 2020, con 175 mil millones de parámetros, conocido por su sólido aprendizaje con pocos ejemplos y sus amplias capacidades de generación de texto.

Generative Pre-trained Transformer 3 (GPT-3) es un modelo de lenguaje de gran tamaño publicado por OpenAI en 2020 como parte de la serie GPT de la empresa. Es un modelo Transformer (architecture) de solo decodificador, con una arquitectura de red neuronal de aprendizaje profundo, que supera los diseños basados en recurrencia y convolución mediante un mecanismo de atención que permite al modelo centrarse selectivamente en segmentos relevantes del texto de entrada. GPT-3 tiene 175 mil millones de parámetros, cada uno almacenado con precisión de 16 bits, lo que requiere 350 GB de almacenamiento, y una ventana de contexto de 2,048 tokens. Demostró fuertes capacidades de aprendizaje de cero disparos y de pocos disparos en muchas tareas.

El 22 de septiembre de 2020, Microsoft anunció que había licenciado GPT-3 de forma exclusiva. Otros aún podían recibir resultados de su API pública, pero solo Microsoft tenía acceso al modelo subyacente.

Antecedentes

Las mejoras en los algoritmos, las computadoras más potentes y el aumento del material digitalizado impulsaron una revolución en el aprendizaje automático durante la década de 2010, lo que llevó a mejoras rápidas en tareas como la manipulación del lenguaje. Los modelos de software se entrenan con miles o millones de ejemplos en estructuras vagamente basadas en la arquitectura neuronal del cerebro. Una arquitectura utilizada en el procesamiento del lenguaje natural es una red neuronal basada en la arquitectura de transformador, introducida en 2017. Esto permitió sistemas capaces de procesar, extraer, organizar, conectar y contrastar texto de entrada, así como responder preguntas.

El 11 de junio de 2018, los investigadores de OpenAI publicaron un artículo que presentaba el primer transformador generativo preentrenado (GPT), un tipo de modelo de lenguaje generativo de gran tamaño preentrenado en un corpus de texto enorme y diverso, seguido de un ajuste fino discriminativo para tareas específicas. Anteriormente, los mejores modelos neuronales de PLN comúnmente usaban aprendizaje supervisado a partir de grandes cantidades de datos etiquetados manualmente, lo que era costoso y requería mucho tiempo. El primer modelo GPT fue seguido por GPT-2 en febrero de 2019, una ampliación directa con 1.5 mil millones de parámetros entrenados en 8 millones de páginas web. En febrero de 2020, Microsoft presentó Turing Natural Language Generation (T-NLG), afirmado como el modelo de lenguaje más grande con 17 mil millones de parámetros.

Entrenamiento y capacidades

El 28 de mayo de 2020, un preprint de arXiv de 31 ingenieros e investigadores de OpenAI describió GPT-3, un modelo de lenguaje de tercera generación de última generación. El equipo aumentó la capacidad en más de dos órdenes de magnitud respecto a GPT-2, convirtiendo a GPT-3 en el modelo de lenguaje no disperso más grande en ese momento. Su mayor precisión se atribuye al aumento de capacidad y parámetros, siendo diez veces más grande que el Turing NLG de Microsoft. Lambdalabs estimó un costo hipotético de alrededor de 4.6 millones de dólares y 355 años para entrenar GPT-3 en una sola GPU en 2020, con un tiempo de entrenamiento real menor usando GPUs en paralelo.

El sesenta por ciento del conjunto de datos de preentrenamiento ponderado provino de una versión filtrada de Common Crawl que consistía en 410 mil millones de tokens codificados por pares de bytes. La deduplicación difusa utilizó MinHashLSH de Apache Spark. Otras fuentes incluyeron 19 mil millones de tokens de WebText2 (22% del total ponderado), 12 mil millones de tokens de Books1 (8%), 55 mil millones de tokens de Books2 (8%) y 3 mil millones de tokens de Wikipedia (3%). GPT-3 se entrenó en cientos de miles de millones de palabras y también podía codificar en CSS, JSX y Python.

Dado que los datos de entrenamiento eran exhaustivos, GPT-3 no requería más entrenamiento para tareas de lenguaje distintas. Los datos de entrenamiento contenían lenguaje tóxico ocasional, y GPT-3 ocasionalmente generaba lenguaje tóxico al imitarlo. Un estudio de la Universidad de Washington encontró que GPT-3 producía lenguaje tóxico a un nivel comparable al de GPT-2 y CTRL. OpenAI implementó estrategias para limitar la salida tóxica, lo que resultó en menos lenguaje tóxico que GPT-1, aunque con más generaciones y mayor toxicidad que CTRL Wiki, un modelo entrenado completamente con datos de Wikipedia.

Acceso público y evolución

El 11 de junio de 2020, OpenAI anunció que los usuarios podían solicitar acceso a su API de GPT-3, un conjunto de herramientas de aprendizaje automático, para explorar las fortalezas y límites de la tecnología. La API tenía una interfaz general de texto de entrada y salida que podía completar casi cualquier tarea en inglés. Un usuario temprano describió a GPT-3 como inquietantemente bueno para escribir texto coherente con indicaciones simples. En un experimento inicial, 80 sujetos estadounidenses juzgaron artículos cortos como escritos por humanos o generados por GPT-3, identificando correctamente solo el 52% de las veces, ligeramente mejor que el azar.

El 18 de noviembre de 2021, OpenAI anunció que se habían implementado suficientes salvaguardas para hacer que el acceso a la API fuera sin restricciones, proporcionando a los desarrolladores una herramienta de moderación de contenido. El 27 de enero de 2022, OpenAI anunció que sus modelos GPT-3 más nuevos, conocidos colectivamente como InstructGPT, se convirtieron en el valor predeterminado en la API, produciendo contenido mejor alineado con las intenciones del usuario, siguiendo mejor las instrucciones, generando menos hechos inventados y produciendo contenido algo menos tóxico.

Impacto y preocupaciones

Debido a que GPT-3 podía generar artículos de noticias que los evaluadores humanos tenían dificultad para distinguir de los escritos por humanos, tenía potencial para avanzar tanto en aplicaciones beneficiosas como dañinas de los modelos de lenguaje. En el artículo del 28 de mayo de 2020, los investigadores describieron efectos dañinos potenciales, incluidos desinformación, spam, phishing, abuso de procesos legales y gubernamentales, y actividades fraudulentas. Las amplias capacidades del modelo impulsaron discusiones sobre las implicaciones sociales de la IA generativa y la necesidad de un despliegue responsable.

Legado

GPT-3 marcó un hito significativo en el desarrollo de la inteligencia artificial, demostrando que escalar modelos de transformador podía producir mejoras dramáticas en la comprensión y generación del lenguaje. Su arquitectura y enfoque de entrenamiento influyeron en modelos posteriores, incluidos los sucesores dentro de OpenAI y los esfuerzos de otras organizaciones como Anthropic y Google DeepMind. La licencia exclusiva a Microsoft destacó el valor comercial de los modelos de lenguaje de gran tamaño y dio forma al panorama competitivo de los servicios de computación en la nube, con Azure integrando GPT-3 en sus ofertas. GPT-3 también catalizó la investigación sobre alineación, seguridad y evaluación de modelos grandes, contribuyendo al campo más amplio de la investigación en redes neuronales.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·openai·generative-ai·machine-learning
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial