GPT-1, publié par OpenAI le 11 juin 2018, a été le premier transformateur génératif pré-entraîné (GPT), un type de grand modèle de langage basé sur l'architecture transformateur. Il a introduit une approche semi-supervisée combinant un pré-entraînement génératif sur des textes non étiquetés avec un ajustement fin discriminatif pour des tâches linguistiques spécifiques, faisant progresser de manière significative le domaine du traitement du langage naturel et de l'intelligence artificielle.
Contexte
Au cours des années 2010, un essor de l'IA stimulé par des algorithmes d'apprentissage automatique améliorés, des ordinateurs plus puissants et une augmentation des données numérisées a permis des progrès rapides en IA. Le pré-entraînement génératif, une forme d'apprentissage auto-supervisé, était établi depuis longtemps dans l'apprentissage automatique : un modèle est d'abord entraîné sur un grand ensemble de données non étiquetées pour apprendre à générer des données, puis adapté à une tâche spécifique avec des données étiquetées. L'architecture du transformateur, introduite par des chercheurs de Google dans l'article de 2017 « Attention Is All You Need », a résolu les problèmes de performance des anciens réseaux de neurones récurrents en utilisant un mécanisme d'attention pour traiter des séquences entières à la fois, permettant des modèles beaucoup plus grands et plus sophistiqués.
Historique
Le 11 juin 2018, OpenAI a publié l'article « Improving Language Understanding by Generative Pre-Training », introduisant GPT-1. Il s'agissait d'un modèle basé sur le transformateur utilisant uniquement la partie décodeur, pré-entraîné sur BookCorpus, un corpus de textes diversifié, pour prédire le jeton suivant, suivi d'un ajustement fin discriminatif pour des tâches spécifiques. Cette approche semi-supervisée a été une percée, car les meilleurs modèles neuronaux précédents reposaient sur un apprentissage supervisé coûteux à partir de données étiquetées manuellement. Le 14 février 2019, OpenAI a publié GPT-2, une mise à l'échelle directe avec 1,5 milliard de paramètres et un ensemble de données de 40 gigaoctets comprenant 8 millions de pages web, initialement diffusé de manière progressive en raison de préoccupations liées à une utilisation abusive. Le 10 février 2020, Microsoft a introduit Turing Natural Language Generation avec 17 milliards de paramètres, affirmant qu'il s'agissait du plus grand modèle de langage à l'époque. Le 28 mai 2020, OpenAI a publié GPT-3 avec 175 milliards de paramètres, faisant progresser l'apprentissage en quelques essais et en zéro essai. Après GPT-3, OpenAI a utilisé l'apprentissage par renforcement à partir de retours humains pour créer InstructGPT, menant à ChatGPT, lancé le 30 novembre 2022, basé sur GPT-3.5 puis GPT-4 (publié le 14 mars 2023). La popularité de ChatGPT a stimulé des concurrents comme PaLM et Gemini de Google, Llama de Meta AI, et d'autres.
Modèles de fondation
Un modèle de fondation est un modèle d'IA entraîné sur des données vastes à grande échelle, adaptable à de nombreuses tâches en aval. Les GPT fondamentaux peuvent utiliser des modalités au-delà du texte, comme les images et l'audio. Certains modèles génératifs basés sur le transformateur sont utilisés pour des technologies de texte-à-image, y compris la diffusion et le décodage parallèle, servant de modèles de fondation visuels pour développer des systèmes de traitement d'images.
Architectures de transformateurs efficaces
Les exigences computationnelles et mémoire des modèles de transformateurs augmentent considérablement avec la taille et la longueur des entrées, car l'attention standard a une complexité quadratique. Les chercheurs ont proposé des améliorations d'efficacité comme des mécanismes d'attention éparse et des architectures économes en mémoire pour réduire les coûts et soutenir des fenêtres de contexte plus longues. Des modèles tels que BigBird, Reformer et FlashAttention démontrent des schémas d'attention structurés ou un calcul optimisé, aidant les grands modèles de langage à traiter efficacement de longues séquences.
Impact
L'introduction de GPT-1 a établi la base des modèles GPT ultérieurs et a influencé le développement plus large de l'IA générative. Son approche semi-supervisée a réduit la dépendance aux données étiquetées, permettant l'entraînement sur de vastes corpus non étiquetés. Le succès de GPT-1 et de ses successeurs a conduit à une adoption généralisée des modèles basés sur le transformateur dans diverses applications, des chatbots à la génération de contenu, et a stimulé la recherche sur la mise à l'échelle des modèles, l'alignement et l'efficacité.