L'article GPT-1, intitulé « Improving Language Understanding by Generative Pre-Training », a été publié par des chercheurs d'OpenAI le 11 juin 2018. Il a introduit le premier transformateur génératif pré-entraîné, un modèle combinant l'architecture Transformer (architecture) avec une approche d'entraînement en deux étapes : un pré-entraînement non supervisé sur un large corpus de texte, suivi d'un ajustement fin supervisé sur des tâches spécifiques. Ces travaux ont démontré qu'un modèle unique pouvait atteindre des performances solides sur plusieurs références de traitement du langage naturel, remettant en cause la dépendance dominante aux architectures spécifiques aux tâches et aux données étiquetées.
Contexte
Au cours des années 2010, les progrès en apprentissage automatique et la disponibilité de jeux de données à grande échelle ont permis un essor de l'IA. Le paradigme dominant en traitement du langage naturel (TALN) consistait à entraîner des modèles sur de grandes quantités de données étiquetées manuellement pour chaque tâche spécifique, ce qui était coûteux et chronophage. En 2017, des chercheurs de Google ont introduit l'architecture du transformateur dans l'article « Attention Is All You Need », qui reposait sur un mécanisme d'auto-attention pour traiter les séquences en parallèle, surmontant les limites des réseaux neuronaux récurrents (RNN) qui traitaient les jetons de manière séquentielle. Cette architecture est devenue la base des travaux ultérieurs en apprentissage profond et en TALN.
Développement
Le modèle GPT-1 était un transformateur décodeur seul avec 117 millions de paramètres, entraîné sur BookCorpus, un jeu de données contenant plus de 7 000 livres non publiés de divers genres. L'objectif du pré-entraînement était la modélisation standard du langage : prédire le jeton suivant dans une séquence. Après cette phase non supervisée, le modèle était ajusté finement sur des tâches individuelles à l'aide de l'apprentissage supervisé, avec des transformations d'entrée spécifiques aux tâches pour adapter le modèle à différents formats. L'article a montré que cette approche atteignait des résultats de pointe sur neuf des douze tâches étudiées, notamment le raisonnement de sens commun, la réponse aux questions et l'implication textuelle, surpassant souvent les modèles entraînés de zéro sur des données étiquetées.
Impact
Le succès de GPT-1 a établi le paradigme de l'IA générative de pré-entraînement et d'ajustement fin, qui est devenu le modèle de référence pour les modèles ultérieurs. Il a directement conduit au développement de GPT-2 en février 2019, qui a étendu le modèle à 1,5 milliard de paramètres et démontré la capacité de générer un texte cohérent. Cela a été suivi par GPT-3 en mai 2020, avec 175 milliards de paramètres, qui a introduit l'apprentissage en quelques exemples, permettant au modèle d'effectuer des tâches avec seulement quelques exemples dans l'invite. La lignée s'est poursuivie avec InstructGPT, qui utilisait l'apprentissage par renforcement à partir de retours humains (RLHF) pour aligner les sorties sur les intentions des utilisateurs, et finalement ChatGPT, lancé en novembre 2022, qui a apporté ces modèles à un large public.
Héritage
L'article GPT-1 est largement reconnu comme une contribution fondatrice au domaine des grands modèles de langage. Il a démontré que le pré-entraînement génératif sur des textes diversifiés pouvait capturer des connaissances linguistiques générales et être efficacement transféré à des tâches en aval. Cette approche a influencé non seulement les modèles ultérieurs d'OpenAI, mais aussi le développement de systèmes concurrents tels que Gemini de Google et Llama de Meta, ainsi que des efforts open source comme DeepSeek. L'article a également souligné le potentiel des transformateurs pour les tâches génératives, ouvrant la voie à des modèles multimodaux qui traitent et génèrent du texte, des images et de l'audio, et à des améliorations d'efficacité telles que les mécanismes d'attention éparse qui réduisent les coûts de calcul pour les séquences plus longues.