Traducido del inglés

GPT-2 es un modelo de lenguaje grande de OpenAI, lanzado en 2019, conocido por su avanzada generación de texto y su liberación inicial restringida debido a preocupaciones de seguridad.

GPT-2 (Generative Pre-trained Transformer 2) es un modelo de lenguaje de gran tamaño desarrollado por OpenAI, que representa la segunda iteración de su serie fundacional GPT. Fue preentrenado con un conjunto de datos de 8 millones de páginas web y demostró avances significativos en generación de texto, traducción, resumen y respuesta a preguntas. El modelo se retuvo inicialmente de su publicación pública debido a preocupaciones sobre un posible uso indebido, pero finalmente se lanzó por completo en noviembre de 2019.

GPT-2 es una ampliación directa de su predecesor, GPT-1, con un aumento de diez veces tanto en el número de parámetros como en el tamaño del conjunto de datos de entrenamiento. Emplea una arquitectura transformador, que utiliza mecanismos de atención para centrarse selectivamente en las partes relevantes del texto de entrada, lo que permite una mayor paralelización y supera a los modelos anteriores basados en RNN/CNN/LSTM. Su capacidad de aprendizaje de propósito general le permitía realizar diversas tareas prediciendo con precisión el siguiente elemento de una secuencia, aunque podía volverse repetitivo o sin sentido en pasajes más largos. GPT-2 fue superado por modelos posteriores como GPT-3 y GPT-4, que ya no son de código abierto.

Entrenamiento y Arquitectura

El entrenamiento de GPT-2 aprovechó la capacidad de paralelización masiva de la arquitectura del transformador, lo que permitió entrenarlo con corpus más grandes que los modelos anteriores de procesamiento de lenguaje natural. OpenAI consideró inicialmente CommonCrawl, un gran corpus rastreado de la web, pero lo rechazó debido a su contenido ininteligible. En su lugar, desarrollaron un nuevo corpus llamado WebText, creado al extraer páginas enlazadas desde publicaciones de Reddit con al menos 3 puntos de karma antes de diciembre de 2017. El corpus se limpió analizando el HTML para convertirlo en texto plano, eliminando duplicados y excluyendo páginas de Wikipedia para evitar el sobreajuste.

El coste de entrenamiento de GPT-2 se estima en aproximadamente 43.000 dólares, según una declaración de Andrej Karpathy, utilizando 32 chips TPU v3 durante 168 horas a unos 8 dólares por chip y hora. Otras fuentes citan un coste de unos 256 dólares por hora. En comparación, entrenar BERT y XLNet costó 6.912 y 245.000 dólares respectivamente. La arquitectura de GPT-2 es una red neuronal profunda con un transformador generativo preentrenado, que implementa atención en lugar de recurrencia o convolución.

Publicación y Restricciones Iniciales

GPT-2 se anunció el 14 de febrero de 2019. A diferencia de los modelos anteriores de OpenAI, el código fuente no se publicó de inmediato, citando riesgos de uso malintencionado. Se concedió acceso limitado a medios de comunicación seleccionados, y OpenAI demostró una versión ajustada para generar reseñas de productos, que podría utilizarse para evadir los filtros de spam. Investigadores como Jeremy Howard advirtieron del potencial de llenar la web con prosa convincente, mientras que el Instituto Allen para la Inteligencia Artificial anunció una herramienta de detección para "noticias falsas neuronales".

Las opiniones estaban divididas sobre la amenaza. Algunos, como Anima Anandkumar, calificaron las restricciones de "tonterías maliciosas", mientras que The Gradient publicó una carta abierta comparando la tecnología con la imprenta y Photoshop. A pesar de la controversia, OpenAI publicó una versión parcial con 774 millones de parámetros el 20 de agosto de 2019, y el modelo completo de 1.500 millones de parámetros el 5 de noviembre de 2019.

Variantes del Modelo y Réplicas

La serie GPT-2 incluía cuatro modelos de distintos tamaños, publicados por etapas. El modelo más pequeño se puso a disposición en febrero de 2019, y los modelos más grandes siguieron después. El modelo completo de 1.500 millones de parámetros fue la publicación final. Los métodos del modelo se describieron en publicaciones, lo que permitió a otros replicarlo como software libre. Una de esas réplicas, OpenGPT-2, se publicó en agosto de 2019 con una versión de WebText con licencia libre llamada OpenWebText, con un coste de computación de aproximadamente 50.000 dólares.

Impacto y Legado

La publicación de GPT-2 marcó un hito significativo en la IA generativa, demostrando el potencial de los transformadores a gran escala. Su capacidad para generar texto coherente fue elogiada por medios como The Verge y The Guardian, aunque se señaló que los pasajes largos podían volverse repetitivos. La retención inicial del modelo provocó debates sobre el acceso abierto y la seguridad en la investigación de la IA, influyendo en discusiones futuras sobre el desarrollo responsable de la IA. GPT-2 fue sucedido por GPT-3 y GPT-4, que continuaron avanzando en el campo pero se alejaron del código abierto.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·openai·transformer·generative-ai
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial