InstructGPT-175B est un grand modèle de langage développé par OpenAI, représentant la configuration la plus vaste de la famille InstructGPT. Il s'agit d'une variante de l'architecture GPT-3, plus précisément de la version à 175 milliards de paramètres, qui a été affinée à l'aide d'une technique appelée apprentissage par renforcement à partir de retours humains (RLHF). Le modèle a été conçu pour remédier aux limitations des modèles GPT-3 antérieurs, qui produisaient souvent des sorties non fiables, toxiques ou mal alignées avec l'intention de l'utilisateur. InstructGPT-175B a été présenté dans un article de recherche publié début 2022, démontrant des améliorations significatives dans le suivi des instructions et l'utilité par rapport à son prédécesseur, le modèle GPT-3 de base de même taille.
Le développement d'InstructGPT-175B a marqué un tournant décisif dans le domaine de l'intelligence artificielle générative, en établissant le RLHF comme un paradigme d'entraînement central pour aligner les grands modèles de langage sur les préférences humaines. Le processus d'entraînement du modèle comprenait trois étapes : un affinage supervisé sur des démonstrations rédigées par des humains, un entraînement d'un modèle de récompense sur des comparaisons humaines, et une optimisation par apprentissage par renforcement utilisant l'optimisation de politique proximale (PPO). Cette approche a permis au modèle de générer des réponses préférées par les évaluateurs humains par rapport à celles du GPT-3 original, malgré une architecture et un nombre de paramètres identiques.
Méthodologie d'entraînement
InstructGPT-175B a été entraîné à l'aide d'un ensemble de données de requêtes et de sorties souhaitées collectées auprès d'annotateurs humains. La première étape d'affinage supervisé a utilisé environ 13 000 requêtes d'entraînement, où les annotateurs ont rédigé des réponses de démonstration. Ensuite, un modèle de récompense a été entraîné sur un ensemble d'environ 33 000 comparaisons, où les annotateurs ont classé différentes sorties du modèle pour la même requête. La dernière étape d'apprentissage par renforcement a utilisé le modèle de récompense pour optimiser la politique, le modèle à 175B étant le plus grand parmi plusieurs tailles entraînées (y compris les variantes à 1,3B, 6,7B et 13B). L'entraînement a employé l'optimiseur Adam avec un calendrier de taux d'apprentissage et un écrêtage du gradient pour garantir la stabilité.
Évaluation et résultats
Les évaluateurs humains ont systématiquement préféré les sorties d'InstructGPT-175B à celles du GPT-3 175B, avec des taux de préférence dépassant 70 % pour la plupart des catégories de requêtes. Le modèle a montré des améliorations particulières dans la réduction des hallucinations, le suivi d'instructions explicites et l'évitement d'un langage toxique ou biaisé. Cependant, les évaluations ont également révélé qu'InstructGPT-175B restait sensible à certaines requêtes adverses et pouvait encore produire des informations incorrectes lorsqu'on l'interrogeait sur des sujets obscurs. Les performances du modèle sur les références standard en traitement du langage naturel étaient généralement comparables à celles de GPT-3, mais son utilité réelle était nettement supérieure grâce à un meilleur alignement avec les besoins des utilisateurs.
Impact et héritage
Le succès d'InstructGPT-175B a influencé le développement ultérieur des modèles chez OpenAI, y compris la série ChatGPT, qui a adopté des techniques RLHF similaires. Il a également inspiré d'autres organisations, telles que Anthropic et Google DeepMind, à intégrer des retours humains dans leurs propres pipelines d'entraînement. Le modèle a démontré que la mise à l'échelle seule était insuffisante pour créer des systèmes d'IA utiles, et que les techniques d'alignement étaient essentielles pour un déploiement pratique. InstructGPT-175B est souvent cité comme un travail fondateur dans le domaine de l'alignement de l'IA, et sa méthodologie est devenue une référence standard pour des modèles ultérieurs comme LLaMA et Claude.
Limitations et considérations éthiques
Malgré ses améliorations, InstructGPT-175B présentait des limitations notables. Il pouvait être excessivement verbeux, répéter parfois des informations, et échouait occasionnellement à poser des questions de clarification pour des requêtes ambiguës. Le modèle présentait également des biais présents dans ses données d'entraînement, et le RLHF n'a pas entièrement éliminé les sorties nuisibles. OpenAI a publié le modèle via son API, mais a restreint l'accès pour atténuer les abus. L'article de recherche accompagnant le modèle a discuté ouvertement de ces limitations, soulignant la nécessité de travaux continus en robustesse, interprétabilité et sécurité. Ces discussions ont contribué à des débats plus larges sur le développement responsable de l'IA et les implications éthiques du déploiement de grands modèles de langage à grande échelle.
Spécifications techniques
InstructGPT-175B utilise la même architecture de transformeur que GPT-3, avec 96 couches, 96 têtes d'attention et une taille cachée de 12 288. Il emploie l'attention multi-têtes et la normalisation de couche, avec une fenêtre de contexte de 2048 jetons. Le modèle a été entraîné sur un mélange de textes web, de livres et d'autres sources, et son processus d'affinage n'a pas modifié l'architecture de base. Le nombre de 175 milliards de paramètres en faisait l'un des plus grands modèles de son époque, nécessitant des ressources informatiques substantielles pour l'entraînement et l'inférence. OpenAI n'a pas divulgué publiquement la puissance de calcul exacte utilisée, mais les estimations suggèrent qu'elle impliquait des milliers de jours-GPU sur du matériel NVIDIA.
Conclusion
InstructGPT-175B représente une réalisation marquante dans l'alignement des grands modèles de langage avec l'intention humaine. Son développement a démontré l'efficacité du RLHF et a établi une nouvelle norme en matière d'utilité et de sécurité dans les systèmes d'IA. Bien que des modèles plus récents l'aient surpassé en capacité, son influence persiste dans la conception des modèles modernes affinés par instructions. L'héritage du modèle est évident dans l'adoption généralisée des techniques de retour humain à travers l'industrie de l'IA, ce qui en fait une pierre angulaire de la recherche et des applications contemporaines en apprentissage automatique.
Références
La source principale de cet article est l'article de recherche d'OpenAI intitulé « Training language models to follow instructions with human feedback » (2022), rédigé par Long Ouyang, Jeff Wu, Xu Jiang et leurs collègues. Des informations supplémentaires sont tirées d'analyses et de revues ultérieures dans la communauté de l'IA.
Voir aussi
Catégories
- large-language-models
- OpenAI
- Reinforcement learning
- AI Alignment