GPT-3, abréviation de Generative Pre-trained Transformer 3, est un grand modèle de langage publié par OpenAI en 2020 dans le cadre de la série GPT de l'entreprise. Il s'agit d'un modèle transformer à décodeur seul qui utilise un mécanisme d'attention pour se concentrer sur les parties pertinentes du texte d'entrée, remplaçant les architectures basées sur la récurrence et la convolution. Avec 175 milliards de paramètres, GPT-3 était le plus grand modèle de langage non creux à sa sortie, nécessitant 350 Go de stockage en raison d'une précision de 16 bits par paramètre. Il possède une fenêtre de contexte de 2 048 jetons et a démontré de fortes capacités d'apprentissage zero-shot et few-shot dans de nombreuses tâches.
La sortie de GPT-3 a marqué une étape importante dans l'IA générative, mettant en évidence le potentiel de la mise à l'échelle des réseaux neuronaux basés sur les transformers. Ses capacités ont influencé les développements ultérieurs dans les grands modèles de langage et ont suscité des discussions sur les avantages et les risques de tels systèmes.
Contexte
Le développement de GPT-3 s'appuyait sur les avancées en apprentissage automatique durant les années 2010, stimulées par des algorithmes améliorés, des ordinateurs plus puissants et une augmentation des données numérisées. L'architecture transformer, introduite en 2017, est devenue une base clé pour le traitement du langage naturel. Le premier transformer génératif pré-entraîné d'OpenAI (GPT-1) a été introduit en juin 2018, suivi par GPT-2 en février 2019, qui a multiplié par 10 la taille des paramètres et du jeu de données, atteignant 1,5 milliard de paramètres. En février 2020, Microsoft a introduit Turing Natural Language Generation (T-NLG) avec 17 milliards de paramètres, qui était alors le plus grand modèle de langage.
Entraînement et capacités
Le 28 mai 2020, un préprint arXiv rédigé par 31 chercheurs d'OpenAI décrivait GPT-3, qui augmentait la capacité de plus de deux ordres de grandeur par rapport à GPT-2. Le jeu de données d'entraînement comprenait 60 % de Common Crawl filtré (410 milliards de jetons), 22 % de WebText2, 8 % de Books1, 8 % de Books2 et 3 % de Wikipédia. GPT-3 a été entraîné sur des centaines de milliards de mots et pouvait également coder dans des langages comme CSS, JSX et Python. Lambda Labs a estimé un coût d'entraînement d'environ 4,6 millions de dollars et 355 ans sur un seul GPU, bien que la parallélisation ait réduit le temps réel.
Les données d'entraînement englobantes de GPT-3 signifiaient qu'il ne nécessitait pas de réglage fin pour des tâches distinctes, mais il pouvait générer un langage toxique en raison des biais présents dans les données. Une étude de l'Université de Washington a trouvé sa toxicité comparable à celle de GPT-2 et CTRL. OpenAI a mis en place des garde-fous, et en novembre 2021, l'accès à l'API est devenu sans restriction. En janvier 2022, les modèles InstructGPT sont devenus le défaut, mieux alignés sur les intentions des utilisateurs et produisant un contenu moins toxique.
Impact et réception
La capacité de GPT-3 à générer un texte cohérent que les humains ne pouvaient pas facilement distinguer d'un contenu écrit par des humains a soulevé à la fois des opportunités et des préoccupations. Dans une expérience, 80 sujets américains ont jugé correctement des articles courts seulement 52 % du temps, proche du hasard. Le potentiel du modèle pour la désinformation, le spam et le hameçonnage a été noté dans l'article original. GPT-3 a également influencé le domaine plus large de l'intelligence artificielle, conduisant à des recherches supplémentaires sur les grands modèles de langage et l'IA générative.
Commercialisation et licence
Le 22 septembre 2020, Microsoft a annoncé une licence exclusive pour GPT-3, accordant un accès au modèle sous-jacent tandis que d'autres pouvaient toujours utiliser l'API publique. Cet accord a mis en évidence la valeur commerciale des modèles d'IA avancés et a établi un précédent pour de futurs partenariats dans l'industrie. L'arrangement de licence faisait partie de l'investissement plus large de Microsoft dans OpenAI et de son intégration dans des produits comme Azure.
Héritage
La sortie de GPT-3 a accéléré les progrès dans le traitement du langage naturel et a inspiré des modèles ultérieurs de diverses organisations, notamment Anthropic et Google DeepMind. Son architecture et son approche d'entraînement sont devenues des références pour les développements ultérieurs, tels que InstructGPT et d'autres successeurs. Le modèle a également suscité des discussions sur l'éthique de l'IA, la sécurité et la nécessité d'une modération du contenu, façonnant la trajectoire de la recherche et du déploiement en apprentissage automatique.