Generative Pre-trained Transformer 3 (GPT-3) est un modèle de langage de grande taille publié par OpenAI en 2020 dans le cadre de la série GPT de l'entreprise. Il s'agit d'un modèle transformeur à décodeur seul de apprentissage profond, remplaçant les architectures basées sur la récurrence et la convolution par un mécanisme d'attention qui permet au modèle de se concentrer sélectivement sur le texte d'entrée pertinent. GPT-3 possède 175 milliards de paramètres, chacun avec une précision de 16 bits, nécessitant 350 Go de stockage. Il dispose d'une fenêtre de contexte de 2 048 jetons et a démontré de fortes capacités d'apprentissage en zero-shot et en few-shot sur de nombreuses tâches.
Contexte
Selon The Economist, l'amélioration des algorithmes, des ordinateurs plus puissants et une augmentation du matériel numérisé ont alimenté une révolution dans le apprentissage automatique. Les nouvelles techniques des années 2010 ont conduit à des améliorations rapides dans les tâches de manipulation du langage. Les modèles logiciels sont entraînés à l'aide de milliers ou de millions d'exemples dans une structure vaguement basée sur l'architecture neuronale du cerveau. Une architecture clé est le transformeur, introduit en 2017, qui est devenu central dans les systèmes de traitement du langage naturel.
Le 11 juin 2018, les chercheurs d'OpenAI ont publié un article présentant le premier transformeur génératif pré-entraîné (GPT), un type de modèle de langage génératif de grande taille pré-entraîné sur un corpus de texte diversifié, suivi d'un affinage discriminatif. GPT-1 a été suivi par GPT-2 en février 2019, qui a augmenté les paramètres et la taille du jeu de données d'un facteur 10, atteignant 1,5 milliard de paramètres entraînés sur 8 millions de pages web. En février 2020, Microsoft a introduit Turing Natural Language Generation (T-NLG) avec 17 milliards de paramètres, alors le plus grand modèle de langage publié.
Entraînement et capacités
Le 28 mai 2020, une prépublication arXiv de 31 ingénieurs et chercheurs d'OpenAI a décrit GPT-3, un modèle de langage de troisième génération à la pointe de la technologie. L'équipe a augmenté la capacité de plus de deux ordres de grandeur par rapport à GPT-2, faisant de GPT-3 le plus grand modèle de langage non épars à cette époque. Sa précision est attribuée à une capacité et à des paramètres accrus, étant dix fois plus grand que le Turing NLG de Microsoft. Lambdalabs a estimé un coût hypothétique d'environ 4,6 millions de dollars et 355 ans pour s'entraîner sur un seul GPU en 2020, avec un temps réel plus faible en utilisant des GPU parallèles.
Soixante pour cent du jeu de données pondéré de pré-entraînement provenait d'une version filtrée de Common Crawl avec 410 milliards de jetons encodés par paires d'octets, utilisant une déduplication floue avec MinHashLSH d'Apache Spark. D'autres sources comprenaient WebText2 (19 milliards de jetons, 22 %), Books1 (12 milliards de jetons, 8 %), Books2 (55 milliards de jetons, 8 %) et Wikipédia (3 milliards de jetons, 3 %). GPT-3 a été entraîné sur des centaines de milliards de mots et pouvait coder en CSS, JSX et Python.
Étant donné que les données d'entraînement étaient exhaustives, GPT-3 ne nécessite pas d'entraînement supplémentaire pour des tâches distinctes. Cependant, il génère parfois un langage toxique imitant ses données d'entraînement. Une étude de l'Université de Washington a constaté que GPT-3 produisait un langage toxique comparable à GPT-2 et CTRL. OpenAI a mis en œuvre des stratégies pour limiter la toxicité, résultant en une sortie moins toxique que GPT-1 mais plus que CTRL Wiki.
API et accès
Le 11 juin 2020, OpenAI a annoncé que les utilisateurs pouvaient demander l'accès à son API GPT-3, un ensemble d'outils d'apprentissage automatique avec une interface générale texte-entrée, texte-sortie. Un premier utilisateur l'a décrit comme étrangement bon pour écrire un texte cohérent avec des invites simples. Dans une expérience, 80 sujets américains ont jugé des articles courts comme écrits par un humain ou par GPT-3, avec seulement 52 % de bonnes réponses, légèrement mieux que le hasard.
Le 22 septembre 2020, Microsoft a annoncé avoir obtenu une licence exclusive pour GPT-3. D'autres pouvaient toujours recevoir les sorties de l'API publique, mais seul Microsoft avait accès au modèle sous-jacent. Le 18 novembre 2021, OpenAI a annoncé un accès API sans restriction avec un outil de modération de contenu. Le 27 janvier 2022, OpenAI a fait d'InstructGPT le modèle par défaut, qui suivait mieux les instructions et générait moins de faits inventés.
Impact et préoccupations
GPT-3 peut générer des articles de presse que les évaluateurs humains peinent à distinguer de ceux écrits par des humains, avec un potentiel pour des applications à la fois bénéfiques et nuisibles. L'article de mai 2020 détaillait les préjudices potentiels, notamment la désinformation, le spam, le hameçonnage et l'abus des processus juridiques et gouvernementaux. La publication du modèle a stimulé le développement ultérieur dans le IA générative et a influencé les modèles suivants de Anthropic et Google DeepMind. Son architecture et son approche d'entraînement sont devenues fondamentales pour les modèles de langage de grande taille ultérieurs, et son modèle API a influencé les services commerciaux d'IA sur Azure et Amazon Web Services.
Héritage
GPT-3 a marqué un tournant dans la sensibilisation du public aux modèles de langage de grande taille, démontrant que l'augmentation de l'échelle des modèles transformeurs pouvait produire des capacités émergentes. Son échelle de 175 milliards de paramètres a établi une référence, bien que des modèles ultérieurs l'aient dépassée. La licence exclusive accordée à Microsoft a souligné la valeur commerciale de tels modèles. Les capacités d'apprentissage en few-shot de GPT-3 ont réduit le besoin d'affinage spécifique à une tâche, influençant la recherche dans le RLHF et le suivi d'instructions. Sa publication a également soulevé des discussions sur la sécurité de l'IA, les biais et le coût environnemental de l'entraînement de grands modèles.