Traduit de l'anglais

InstructGPT est une série de grands modèles de langage développés par OpenAI, entraînés avec des retours humains pour suivre les instructions plus précisément et réduire les sorties nuisibles, introduits en 2022.

InstructGPT est une famille de grands modèles de langage développée par OpenAI, introduite pour la première fois en janvier 2022. Ces modèles sont conçus pour mieux suivre les instructions des utilisateurs et s'aligner sur les intentions humaines par rapport aux modèles GPT-3 antérieurs. Ils utilisent une technique d'entraînement appelée apprentissage par renforcement à partir de retours humains (RLHF), où des évaluateurs humains classent les sorties du modèle, et le modèle est guidé pour produire des réponses plus utiles, véridiques et moins nuisibles.

InstructGPT s'appuie sur les fondations de l'architecture du transformateur génératif pré-entraîné (GPT), un type de modèle transformateur qui a vu le jour avec l'introduction de l'architecture du transformateur en 2017. Le GPT-3 original, publié par OpenAI en 2020, était un transformateur à décodeur seul avec 175 milliards de paramètres, mais il pouvait parfois produire des sorties hors sujet ou mal alignées avec l'intention de l'utilisateur. InstructGPT visait à corriger ces problèmes en affinant le modèle avec des retours humains.

Formation et méthodologie

Les modèles InstructGPT ont été créés en affinant GPT-3 avec un apprentissage supervisé, puis en appliquant un apprentissage par renforcement à partir de retours humains. Des évaluateurs humains ont été invités à comparer les réponses générées par différents modèles, et leurs préférences ont été utilisées pour entraîner un modèle de récompense. La politique (c'est-à-dire le modèle) a ensuite été mise à jour pour maximiser cette récompense tout en incorporant une pénalité pour les écarts par rapport à la distribution originale de GPT-3, afin d'éviter une dérive excessive.

OpenAI a rapporté que les modèles InstructGPT étaient nettement meilleurs que GPT-3 pour suivre les instructions, générer moins de faits inventés (un phénomène connu sous le nom d'hallucinations) et produire un contenu légèrement moins toxique, tout en montrant des performances améliorées sur certaines tâches comme le résumé et les questions-réponses.

Capacités et limites

InstructGPT a hérité des capacités fondamentales de GPT-3, notamment la capacité de générer un texte cohérent, de répondre à des questions, de traduire des langues et d'écrire du code. Il pouvait également gérer des invites à quelques exemples et à zéro exemple. Cependant, comme ses prédécesseurs, il pouvait encore générer un contenu nuisible ou biaisé lorsqu'il était sollicité avec des entrées toxiques. OpenAI a mis en place des outils de modération de contenu pour les développeurs utilisant l'API, et à partir de janvier 2022, InstructGPT est devenu le modèle par défaut pour les clients de l'API OpenAI.

Comparaison avec les prédécesseurs

Par rapport aux modèles GPT-3 originaux, InstructGPT a démontré des améliorations notables dans l'alignement avec l'intention de l'utilisateur, comme en témoignent les évaluations humaines. Par exemple, dans les études de apprentissage automatique, les évaluateurs ont jugé les sorties d'InstructGPT plus favorables que celles de GPT-3 sur une variété d'invites, y compris la réduction des réponses hors sujet involontaires. Malgré cela, InstructGPT a conservé des limites communes aux grands modèles de langage, telles que la sensibilité à la formulation et des erreurs factuelles occasionnelles.

Le développement d'InstructGPT reflète des tendances plus larges dans la intelligence artificielle générative, où les modèles sont entraînés pour être plus alignés sur les normes éthiques et de sécurité humaines. Cette approche a influencé des modèles ultérieurs comme ChatGPT, qui utilisent une méthodologie d'alignement similaire.

Réception et impact

InstructGPT a contribué à l'écosystème croissant de modèles d'IA axés sur une IA utile et sûre. Des chercheurs d'autres organisations, comme Anthropic et Google DeepMind, ont également exploré des techniques d'alignement similaires. Le modèle a été un pas vers des assistants IA plus pratiques, mais il a également soulevé des discussions sur les risques de désinformation générée par l'IA et l'importance de la transparence dans les systèmes d'IA. En 2025, OpenAI a continué à itérer sur les techniques d'alignement, en s'appuyant sur les fondations établies par InstructGPT.

Voir aussi

Des liens arbitraires peuvent être faits vers des sujets connexes comme apprentissage automatique, transformateur, OpenAI et intelligence artificielle générative.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·openai·artificial-intelligence·machine-learning
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique