Generative Pre-trained Transformer 3 (GPT-3) est un grand modèle de langage publié par OpenAI en 2020 dans le cadre de la série de modèles GPT de l'entreprise. Comme son prédécesseur, GPT-2, il s'agit d'un modèle transformeur de réseau neuronal profond uniquement décodeur, qui remplace les architectures basées sur la récurrence et la convolution par une technique appelée « attention ». Ce mécanisme d'attention permet au modèle de se concentrer sélectivement sur les segments du texte d'entrée qu'il prédit comme les plus pertinents. GPT-3 possède 175 milliards de paramètres, chacun avec une précision de 16 bits, nécessitant 350 Go de stockage car chaque paramètre occupe 2 octets. Il a une fenêtre de contexte de 2 048 jetons et a démontré de fortes capacités d'apprentissage « zero-shot » et « few-shot » sur de nombreuses tâches.
L'article décrivant GPT-3, intitulé « Language Models are Few-Shot Learners », a été publié en prépublication arXiv le 28 mai 2020 par un groupe de 31 ingénieurs et chercheurs chez OpenAI. L'équipe a augmenté la capacité de GPT-3 de plus de deux ordres de grandeur par rapport à son prédécesseur, GPT-2, faisant de GPT-3 le plus grand modèle de langage non épars à cette époque. Comme GPT-3 est structurellement similaire à ses prédécesseurs, sa plus grande précision est attribuée à sa capacité accrue et à son plus grand nombre de paramètres. La capacité de GPT-3 est dix fois supérieure à celle du Turing NLG de Microsoft, le plus grand modèle de traitement du langage naturel connu à l'époque.
Contexte
Selon The Economist, des algorithmes améliorés, des ordinateurs plus puissants et une augmentation récente de la quantité de matériel numérisé ont alimenté une révolution dans le apprentissage automatique. De nouvelles techniques dans les années 2010 ont entraîné des « améliorations rapides des tâches », y compris la manipulation du langage. Les modèles logiciels sont entraînés à apprendre en utilisant des milliers ou des millions d'exemples dans une « structure ... vaguement basée sur l'architecture neuronale du cerveau ». Une architecture utilisée dans le traitement du langage naturel (TLN) est un réseau neuronal basé sur un modèle d'apprentissage profond introduit en 2017 - l'architecture transformeur. Il existe un certain nombre de systèmes de TLN capables de traiter, d'exploiter, d'organiser, de connecter et de comparer des entrées textuelles, ainsi que de répondre correctement à des questions.
Le 11 juin 2018, des ingénieurs et chercheurs d'OpenAI ont publié un article introduisant le premier transformeur génératif pré-entraîné (GPT) - un type de grand modèle de langage génératif qui est pré-entraîné avec un corpus de texte énorme et diversifié dans des ensembles de données, suivi d'un ajustement fin discriminatif pour se concentrer sur une tâche spécifique. Les modèles GPT sont des architectures de réseaux neuronaux d'apprentissage profond basées sur des transformeurs. Auparavant, les meilleurs modèles neuronaux de TLN utilisaient couramment l'apprentissage supervisé à partir de grandes quantités de données étiquetées manuellement, ce qui rendait prohibitif en coût et en temps l'entraînement de modèles de langage extrêmement grands. Le premier modèle GPT était connu sous le nom de GPT-1, et il a été suivi par GPT-2 en février 2019. Créé comme une mise à l'échelle directe de son prédécesseur, GPT-2 avait à la fois son nombre de paramètres et la taille de son ensemble de données augmentés d'un facteur 10. Il avait 1,5 milliard de paramètres et a été entraîné sur un ensemble de données de 8 millions de pages web.
En février 2020, Microsoft a introduit son Turing Natural Language Generation (T-NLG), qu'il a affirmé être le « plus grand modèle de langage jamais publié avec 17 milliards de paramètres ». Il surpassait tous les autres modèles de langage dans une variété de tâches, y compris la synthèse de textes et la réponse à des questions.
Entraînement et capacités
L'article détaillait le processus d'entraînement de GPT-3. Soixante pour cent de l'ensemble de données pré-entraînement pondéré de GPT-3 provient d'une version filtrée de Common Crawl composée de 410 milliards de jetons encodés par paires d'octets. La déduplication floue utilisait MinHashLSH d'Apache Spark. D'autres sources comprennent 19 milliards de jetons de WebText2 représentant 22 % du total pondéré, 12 milliards de jetons de Books1 représentant 8 %, 55 milliards de jetons de Books2 représentant 8 %, et 3 milliards de jetons de Wikipédia représentant 3 %. GPT-3 a été entraîné sur des centaines de milliards de mots et est également capable de coder en CSS, JSX et Python, entre autres.
Lambdalabs a estimé un coût hypothétique d'environ 4,6 millions de dollars américains et 355 ans pour entraîner GPT-3 sur un seul GPU en 2020, avec un temps d'entraînement réel plus faible en utilisant plus de GPU en parallèle. La taille du modèle et ses données d'entraînement étaient essentielles à ses performances, lui permettant d'effectuer de nombreuses tâches sans ajustement fin. L'article a souligné que GPT-3 pouvait obtenir des résultats solides sur des tâches telles que la traduction, la réponse à des questions et les tâches de complétion de texte grâce à l'apprentissage few-shot, où le modèle reçoit quelques exemples dans l'invite.
Capacités et limites
Comme les données d'entraînement de GPT-3 étaient exhaustives, il ne nécessite pas d'entraînement supplémentaire pour des tâches linguistiques distinctes. Les données d'entraînement contiennent occasionnellement un langage toxique et GPT-3 génère parfois un langage toxique en conséquence de l'imitation de ses données d'entraînement. Une étude de l'Université de Washington a constaté que GPT-3 produisait un langage toxique à un niveau de toxicité comparable à celui des modèles de traitement du langage naturel similaires GPT-2 et CTRL. OpenAI a mis en œuvre plusieurs stratégies pour limiter la quantité de langage toxique généré par GPT-3. En conséquence, GPT-3 a produit moins de langage toxique par rapport à son modèle prédécesseur, GPT-1, bien qu'il ait produit à la fois plus de générations et une toxicité plus élevée de langage toxique par rapport à CTRL Wiki, un modèle de langage entraîné entièrement sur des données de Wikipédia.
Parce que GPT-3 peut « générer des articles de presse que les évaluateurs humains ont du mal à distinguer des articles écrits par des humains », GPT-3 a le « potentiel de faire progresser à la fois les applications bénéfiques et nuisibles des modèles de langage ». Dans leur article du 28 mai 2020, les chercheurs ont décrit en détail les « effets nuisibles potentiels de GPT-3 », qui incluent la « désinformation, le spam, le hameçonnage, l'abus des processus juridiques et gouvernementaux, les activités frauduleuses », et plus encore. L'article a également noté des limites, telles que la tendance du modèle à se répéter, à être excessivement verbeux et à avoir des difficultés avec les tâches de raisonnement physique.
Publication et accès
Le 11 juin 2020, OpenAI a annoncé que les utilisateurs pouvaient demander l'accès à son API GPT-3 conviviale - un « ensemble d'outils d'apprentissage automatique » - pour aider OpenAI à « explorer les forces et les limites » de cette nouvelle technologie. L'invitation décrivait comment cette API avait une interface générale « texte entrant, texte sortant » qui peut accomplir presque « toute tâche en anglais », au lieu de l'usage unique habituel. Selon un utilisateur, qui avait accès à une version préliminaire privée de l'API OpenAI GPT-3, GPT-3 était « étrangement bon » pour écrire « un texte étonnamment cohérent » avec seulement quelques invites simples. Dans une expérience initiale, 80 sujets américains ont été invités à juger si de courts articles d'environ 200 mots étaient écrits par des humains ou par GPT-3. Les participants ont jugé correctement 52 % du temps, ne faisant que légèrement mieux qu'un choix aléatoire.
Le 22 septembre 2020, Microsoft a annoncé avoir obtenu une licence exclusive pour GPT-3. D'autres peuvent toujours recevoir des sorties de son API publique, mais seul Microsoft a accès au modèle sous-jacent. Le 18 novembre 2021, OpenAI a annoncé que suffisamment de garde-fous avaient été mis en place pour que l'accès à son API soit sans restriction. OpenAI a fourni aux développeurs un outil de modération de contenu qui les aide à respecter la politique de contenu d'OpenAI. Le 27 janvier 2022, OpenAI a annoncé que ses plus récents modèles de langage GPT-3 (collectivement appelés InstructGPT) étaient désormais le modèle de langage par défaut utilisé sur leur API. Selon OpenAI, InstructGPT produisait un contenu mieux aligné sur les intentions des utilisateurs en suivant mieux les instructions, en générant moins de faits inventés et en produisant un contenu légèrement moins toxique.
Impact
L'article sur GPT-3 a eu un impact significatif sur le domaine de l'intelligence artificielle et de la IA générative. Il a démontré que l'augmentation de la taille du modèle et des données pouvait conduire à des améliorations spectaculaires de l'apprentissage few-shot, déplaçant la recherche vers des modèles plus grands. Cela a influencé les travaux ultérieurs chez OpenAI et d'autres organisations comme Google DeepMind et Anthropic. L'article a également suscité des discussions sur les implications éthiques des grands modèles de langage, y compris les abus potentiels pour la désinformation et le coût environnemental de l'entraînement de tels modèles. Le succès de GPT-3 a ouvert la voie à des modèles ultérieurs avec encore plus de paramètres, tels que GPT-4, et a contribué à l'adoption plus large des architectures basées sur les transformeurs dans le traitement du langage naturel.