GPT-2 (Generative Pre-trained Transformer 2) es un modelo de lenguaje de gran tamaño desarrollado por OpenAI, anunciado el 14 de febrero de 2019. Es el segundo modelo de la serie fundacional de GPT de OpenAI, sucediendo a GPT-1 y precediendo a GPT-3. GPT-2 fue preentrenado con un conjunto de datos de 8 millones de páginas web, y su capacidad para generar texto coherente y contextualmente relevante se consideró un avance significativo en IA generativa. El modelo fue inicialmente retenido durante su lanzamiento parcial, y la versión completa con 1.500 millones de parámetros no estuvo disponible hasta el 5 de noviembre de 2019. Debido a su capacidad para traducir idiomas, responder preguntas y resumir pasajes, investigadores y comentaristas destacaron su potencial tanto para usos beneficiosos como para usos indebidos, como la generación de spam o la creación de noticias falsas.
Arquitectura
Al igual que su predecesor GPT-1 y sus sucesores, GPT-2 utiliza una arquitectura de aprendizaje profundo basada en transformadores, un tipo de red neuronal que implementa un mecanismo de atención. Se ha demostrado que este mecanismo de atención mejora el rendimiento en tareas de predicción secuencia a secuencia. A diferencia de los modelos basados en redes recurrentes o convolucionales, el mecanismo de atención del transformador permite procesar el texto de entrada en paralelo, lo que puede aumentar considerablemente la velocidad de entrenamiento e inferencia. La arquitectura del modelo se describió como una versión a mayor escala de GPT-1, con un aumento de diez veces en el número de parámetros (1.500 millones) y en el tamaño del conjunto de datos de entrenamiento. Esta paralelización, lograda gracias a hardware especializado, permitió entrenar con un corpus más grande de lo que antes era viable, lo que contribuyó a su capacidad para manejar tareas generales de aprendizaje automático.
Entrenamiento
GPT-2 fue entrenado con WebText, un corpus de más de 100 gigabytes de texto extraído de enlaces externos en Reddit que recibieron al menos 3 puntos de karma antes de diciembre de 2017. Reddit se utilizó como indicador de contenido curado por humanos, filtrando páginas de baja calidad. El HTML se analizó para obtener texto plano, se eliminaron los enlaces duplicados y se excluyeron las páginas de Wikipedia del conjunto de entrenamiento para evitar el sobreajuste, ya que esos artículos aparecen con frecuencia en muchos otros conjuntos de datos. CommonCrawl, a pesar de su tamaño, fue rechazado debido a la gran cantidad de contenido ininteligible que contenía. La infraestructura para entrenar GPT-2 utilizó 32 chips TPU v3 durante 168 horas, con un costo de aproximadamente 43.000 dólares en computación, según declaró Andrej Karpathy, investigador asociado al proyecto en ese momento. Esta cifra era relativamente baja para un modelo de su tamaño, gracias a la eficiencia del transformador. El resultado fue un modelo capaz de producir texto que a veces resultaba indistinguible del generado por humanos, aunque podía volverse repetitivo o sin sentido en pasajes más largos, una limitación que los modelos de lenguaje posteriores intentaron mejorar.
Lanzamiento parcial
La decisión inicial de OpenAI de no publicar de inmediato el modelo completo se basó en la preocupación de que pudiera utilizarse con fines maliciosos, como generar spam o desinformación. La empresa publicó una versión parcial con 774 millones de parámetros el 20 de agosto de 2019, aproximadamente la mitad del tamaño del original (conocida como versión 774M). Este lanzamiento parcial se realizó para permitir que los investigadores comprendieran el comportamiento del modelo mientras se mitigaban posibles usos indebidos. Sin embargo, el enfoque de OpenAI generó críticas de algunos investigadores, incluida Anima Anandkumar, quien afirmó que la amenaza era exagerada. Otros, no obstante, argumentaron que el modelo podría utilizarse para inundar las redes sociales con texto indistinguible del humano, y el Allen Institute for Artificial Intelligence creó un detector de noticias falsas generadas por redes neuronales en respuesta.
Impacto ético y social
La decisión de retrasar la publicación completa de GPT-2 inició un debate público sobre los riesgos y beneficios de la tecnología de inteligencia artificial. Algunos investigadores restaron importancia a los peligros percibidos, señalando que las amenazas podían mitigarse, mientras que otros advirtieron sobre una posible avalancha de texto sintético que podría ahogar el discurso humano auténtico. También se publicó una versión parcial de un modelo ajustado para generar reseñas de productos positivas o negativas, lo que demostraba el posible uso para spam. En respuesta al revuelo y a la política de acceso limitado, un grupo de investigadores publicó una carta abierta solicitando la publicación completa, argumentando que los modelos de lenguaje no son tan amenazantes como se presentaban, citando tecnologías como Photoshop y la imprenta, que también han sido mal utilizadas pero se han integrado en la vida cotidiana.
El efecto a largo plazo de la retención del modelo fue aumentar la conciencia pública sobre los modelos de lenguaje de gran tamaño y sus capacidades. GPT-2 terminó convirtiéndose en un punto de referencia para la seguridad de la inteligencia artificial, influyendo en los modelos de código abierto posteriores. Finalmente fue superado por GPT-3 y GPT-4; en 2024, estos modelos, que ya no son de código abierto, han adquirido mayor prominencia. El episodio sirvió como un hito importante para reflexionar sobre cómo equilibrar la transparencia y la precaución al desarrollar sistemas avanzados de IA.
Legado
GPT-2 representó un avance significativo en el campo del aprendizaje profundo y se convirtió en un punto de referencia para los modelos de lenguaje posteriores. Su capacidad para servir como un aprendiz general, basándose en la predicción de la siguiente palabra en una secuencia y sin depender de datos específicos de una tarea, fue un paso fundamental para los transformadores posteriores. El tamaño de sus parámetros y de su corpus de entrenamiento estableció un camino para escalar los modelos de redes neuronales. En consecuencia, las demandas computacionales de la IA generativa han aumentado, y GPT-2 se considera un hito en la historia de la inteligencia artificial. Sus principios de entrenamiento han seguido influyendo en el desarrollo y la arquitectura de los modelos de lenguaje de gran tamaño en diversos campos, y el modelo sigue siendo un punto de referencia bien estudiado para comprender la emergencia de capacidades y el aprendizaje automático.