InstructGPT es una familia de modelos de lenguaje de gran escala desarrollados por OpenAI, presentados por primera vez en enero de 2022. Estos modelos están diseñados para seguir mejor las instrucciones de los usuarios y alinearse con las intenciones humanas en comparación con los modelos GPT-3 anteriores. Emplean una técnica de entrenamiento llamada aprendizaje por refuerzo con retroalimentación humana (RLHF), donde evaluadores humanos clasifican las salidas del modelo, y el modelo se guía para producir respuestas que sean más útiles, veraces y menos dañinas.
InstructGPT se basa en los cimientos de la arquitectura del transformador generativo preentrenado (GPT), un tipo de modelo transformador que se originó con la introducción de la arquitectura del transformador en 2017. El GPT-3 original, lanzado por OpenAI en 2020, era un transformador solo de decodificador con 175 mil millones de parámetros, pero a veces podía producir salidas que estaban fuera de tarea o desalineadas con la intención del usuario. InstructGPT buscaba corregir estos problemas refinando el modelo con retroalimentación humana.
Entrenamiento y metodología
Los modelos InstructGPT se crearon ajustando GPT-3 con aprendizaje supervisado y luego aplicando aprendizaje por refuerzo con retroalimentación humana. Se pidió a evaluadores humanos que compararan respuestas generadas por diferentes modelos, y sus preferencias se usaron para entrenar un modelo de recompensa. La política (es decir, el modelo) se actualizaba luego para maximizar esta recompensa, incorporando también una penalización por desviaciones de la distribución original de GPT-3, para evitar una deriva excesiva.
OpenAI informó que los modelos InstructGPT eran significativamente mejores que GPT-3 en seguir instrucciones, generar menos hechos inventados (un fenómeno conocido como alucinaciones) y producir contenido algo menos tóxico, al tiempo que mostraban un rendimiento mejorado en ciertas tareas como resumir y responder preguntas.
Capacidades y limitaciones
InstructGPT heredó las capacidades centrales de GPT-3, incluida la capacidad de generar texto coherente, responder preguntas, traducir idiomas y escribir código. También podía manejar indicaciones de pocos ejemplos y de cero ejemplos. Sin embargo, como sus predecesores, aún podía generar contenido dañino o sesgado cuando se le presentaban entradas tóxicas. OpenAI implementó herramientas de moderación de contenido para desarrolladores que usan la API, y a partir de enero de 2022, InstructGPT se convirtió en el modelo predeterminado para los clientes de la API de OpenAI.
Comparación con predecesores
En comparación con los modelos GPT-3 originales, InstructGPT demostró mejoras notables en la alineación con la intención del usuario, como lo evidencian las evaluaciones humanas. Por ejemplo, en estudios de aprendizaje automático, los evaluadores juzgaron las salidas de InstructGPT como más favorables que las de GPT-3 en una variedad de indicaciones, incluida la reducción de respuestas no relacionadas no intencionadas. A pesar de esto, InstructGPT conservó limitaciones comunes a los modelos de lenguaje de gran escala, como la sensibilidad a la redacción y errores fácticos ocasionales.
El desarrollo de InstructGPT refleja tendencias más amplias en inteligencia artificial generativa, donde los modelos se entrenan para estar más alineados con los estándares éticos y de seguridad humanos. Este enfoque ha influido en modelos posteriores como ChatGPT, que usan una metodología de alineación similar.
Recepción e impacto
InstructGPT contribuyó al creciente ecosistema de modelos de IA centrados en una IA útil y segura. Investigadores de otras organizaciones, como Anthropic y Google DeepMind, también exploraron técnicas de alineación similares. El modelo fue un paso hacia asistentes de IA más prácticos, pero también generó discusiones sobre los riesgos de la desinformación generada por IA y la importancia de la transparencia en los sistemas de IA. A partir de 2025, OpenAI continuó iterando sobre técnicas de alineación, basándose en los cimientos establecidos por InstructGPT.
Véase también
Se pueden hacer enlaces arbitrarios a temas relacionados como aprendizaje automático, transformador, OpenAI y inteligencia artificial generativa.