Lanzamiento de GPT-1

Traducido del inglés

GPT-1, presentado por OpenAI en junio de 2018, fue el primer transformador generativo preentrenado, un modelo de lenguaje grande que utiliza arquitectura de transformador y preentrenamiento en texto no etiquetado, marcando un avance en el procesamiento del lenguaje natural.

GPT-1, publicado por OpenAI el 11 de junio de 2018, fue el primer transformador generativo preentrenado (GPT), un tipo de modelo de lenguaje grande basado en la arquitectura transformador. Introdujo un enfoque semisupervisado que combinaba el preentrenamiento generativo en texto no etiquetado con el ajuste fino discriminativo para tareas lingüísticas específicas, avanzando significativamente el campo del procesamiento del lenguaje natural y la inteligencia artificial.

Antecedentes

Durante la década de 2010, un auge de la IA impulsado por mejores algoritmos de aprendizaje automático, computadoras más potentes y una mayor cantidad de datos digitalizados permitió un progreso rápido en la IA. El preentrenamiento generativo, una forma de aprendizaje autosupervisado, había sido establecido durante mucho tiempo en el aprendizaje automático: un modelo se entrena primero en un gran conjunto de datos no etiquetados para aprender a generar datos, y luego se adapta a una tarea específica con datos etiquetados. La arquitectura del transformador, introducida por investigadores de Google en el artículo de 2017 "Attention Is All You Need", resolvió los problemas de rendimiento de las redes neuronales recurrentes más antiguas mediante el uso de un mecanismo de atención para procesar secuencias completas a la vez, lo que permitió modelos mucho más grandes y sofisticados.

Historia

El 11 de junio de 2018, OpenAI publicó el artículo "Improving Language Understanding by Generative Pre-Training", presentando GPT-1. Era un modelo basado en transformadores que usaba solo la parte del decodificador, preentrenado en BookCorpus, un corpus de texto diverso, para predecir el siguiente token, seguido de un ajuste fino discriminativo para tareas específicas. Este enfoque semisupervisado fue un avance, ya que los mejores modelos neuronales anteriores dependían de un aprendizaje supervisado costoso a partir de datos etiquetados manualmente. El 14 de febrero de 2019, OpenAI lanzó GPT-2, una ampliación directa con 1.5 mil millones de parámetros y un conjunto de datos de 40 gigabytes con 8 millones de páginas web, inicialmente escalonado debido a preocupaciones sobre su mal uso. El 10 de febrero de 2020, Microsoft presentó Turing Natural Language Generation con 17 mil millones de parámetros, afirmando que era el modelo de lenguaje más grande en ese momento. El 28 de mayo de 2020, OpenAI lanzó GPT-3 con 175 mil millones de parámetros, avanzando el aprendizaje de pocos ejemplos y de cero ejemplos. Después de GPT-3, OpenAI utilizó el aprendizaje por refuerzo con retroalimentación humana para crear InstructGPT, lo que llevó a ChatGPT, lanzado el 30 de noviembre de 2022, basado en GPT-3.5 y posteriormente GPT-4 (lanzado el 14 de marzo de 2023). La popularidad de ChatGPT impulsó a competidores como PaLM y Gemini de Google, Llama de Meta AI, y otros.

Modelos fundamentales

Un modelo fundamental es un modelo de IA entrenado con datos amplios a gran escala, adaptable a muchas tareas posteriores. Los GPT fundamentales pueden emplear modalidades más allá del texto, como imágenes y audio. Algunos modelos generativos basados en transformadores se utilizan para tecnologías de texto a imagen, incluida la difusión y el decodificado paralelo, sirviendo como modelos visuales fundamentales para desarrollar sistemas de procesamiento de imágenes.

Arquitecturas de transformadores eficientes

Los requisitos computacionales y de memoria de los modelos de transformadores aumentan significativamente con el tamaño y la longitud de la entrada, ya que la autoatención estándar tiene complejidad cuadrática. Los investigadores propusieron mejoras de eficiencia, como mecanismos de atención dispersa y arquitecturas eficientes en memoria, para reducir costos y admitir ventanas de contexto más largas. Modelos como BigBird, Reformer y FlashAttention demuestran patrones de atención estructurados o cómputo optimizado, ayudando a los modelos de lenguaje grandes a procesar secuencias largas de manera eficiente.

Impacto

La introducción de GPT-1 estableció la base para los modelos GPT posteriores e influyó en el desarrollo más amplio de la IA generativa. Su enfoque semisupervisado redujo la dependencia de datos etiquetados, permitiendo el entrenamiento en vastos corpus no etiquetados. El éxito de GPT-1 y sus sucesores llevó a una adopción generalizada de modelos basados en transformadores en diversas aplicaciones, desde chatbots hasta generación de contenido, y estimuló la investigación sobre escalado de modelos, alineación y eficiencia.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·machine-learning·natural-language-processing·openai
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial