Lanzamiento de GPT-3

Traducido del inglés

GPT-3是OpenAI于2020年发布的大型语言模型,拥有1750亿参数和先进的少样本学习能力,对人工智能领域产生了重大影响。

GPT-3, abreviatura de Generative Pre-trained Transformer 3, es un modelo de lenguaje de gran escala lanzado por OpenAI en 2020 como parte de la serie GPT de la compañía. Es un modelo transformer de solo decodificador que utiliza un mecanismo de atención para centrarse en las partes relevantes del texto de entrada, superando las arquitecturas basadas en recurrencia y convolución. Con 175 mil millones de parámetros, GPT-3 fue el modelo de lenguaje no disperso más grande en su lanzamiento, requiriendo 350 GB de almacenamiento debido a la precisión de 16 bits por parámetro. Tiene una ventana de contexto de 2,048 tokens y demostró fuertes capacidades de aprendizaje de cero disparos y de pocos disparos en muchas tareas.

El lanzamiento de GPT-3 marcó un hito en la IA generativa, mostrando el potencial de escalar redes neuronales basadas en transformers. Sus capacidades influyeron en desarrollos posteriores en modelos de lenguaje de gran escala y provocaron debates sobre los beneficios y riesgos de tales sistemas.

Antecedentes

El desarrollo de GPT-3 se basó en avances en el aprendizaje automático durante la década de 2010, impulsados por algoritmos mejorados, computadoras más potentes y una mayor cantidad de datos digitalizados. La arquitectura transformer, introducida en 2017, se convirtió en una base clave para el procesamiento del lenguaje natural. El primer transformer generativo preentrenado de OpenAI (GPT-1) se presentó en junio de 2018, seguido de GPT-2 en febrero de 2019, que escaló los parámetros y el tamaño del conjunto de datos por un factor de 10, alcanzando 1.5 mil millones de parámetros. En febrero de 2020, Microsoft presentó Turing Natural Language Generation (T-NLG) con 17 mil millones de parámetros, que entonces era el modelo de lenguaje más grande.

Entrenamiento y Capacidades

El 28 de mayo de 2020, un preprint en arXiv de 31 investigadores de OpenAI describió GPT-3, que aumentó la capacidad en más de dos órdenes de magnitud en comparación con GPT-2. El conjunto de datos de entrenamiento comprendía un 60% de Common Crawl filtrado (410 mil millones de tokens), un 22% de WebText2, un 8% de Books1, un 8% de Books2 y un 3% de Wikipedia. GPT-3 se entrenó con cientos de miles de millones de palabras y también podía programar en lenguajes como CSS, JSX y Python. Lambda Labs estimó un costo de entrenamiento de alrededor de 4.6 millones de dólares y 355 años en una sola GPU, aunque la paralelización redujo el tiempo real.

Los datos de entrenamiento integrales de GPT-3 significaban que no requería ajuste fino para tareas distintas, pero podía generar lenguaje tóxico debido a los sesgos en los datos. Un estudio de la Universidad de Washington encontró que su toxicidad era comparable a la de GPT-2 y CTRL. OpenAI implementó salvaguardas, y para noviembre de 2021, el acceso a la API se volvió sin restricciones. En enero de 2022, los modelos InstructGPT se convirtieron en el estándar, mejor alineados con las intenciones del usuario y produciendo contenido menos tóxico.

Impacto y Recepción

La capacidad de GPT-3 para generar texto coherente que los humanos no podían distinguir fácilmente del contenido escrito por humanos planteó tanto oportunidades como preocupaciones. En un experimento, 80 sujetos estadounidenses juzgaron artículos cortos correctamente solo el 52% de las veces, cerca del azar. El potencial del modelo para desinformación, spam y phishing se señaló en el artículo original. GPT-3 también influyó en el campo más amplio de la inteligencia artificial, lo que llevó a más investigación en modelos de lenguaje de gran escala y IA generativa.

Comercialización y Licencias

El 22 de septiembre de 2020, Microsoft anunció una licencia exclusiva para GPT-3, otorgando acceso al modelo subyacente mientras otros aún podían usar la API pública. Este acuerdo destacó el valor comercial de los modelos avanzados de IA y sentó un precedente para futuras asociaciones en la industria. El acuerdo de licencia fue parte de la inversión más amplia de Microsoft en OpenAI y su integración en productos como Azure.

Legado

El lanzamiento de GPT-3 aceleró el progreso en el procesamiento del lenguaje natural e inspiró modelos posteriores de diversas organizaciones, incluidas Anthropic y Google DeepMind. Su arquitectura y enfoque de entrenamiento se convirtieron en puntos de referencia para desarrollos posteriores, como InstructGPT y otros sucesores. El modelo también impulsó discusiones sobre ética de la IA, seguridad y la necesidad de moderación de contenido, dando forma a la trayectoria de la investigación y el despliegue del aprendizaje automático.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·openai·artificial-intelligence·2020-events
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial