Sortie d’OpenAI GPT-3

Traduit de l'anglais

GPT-3 est un grand modèle de langage publié par OpenAI en 2020, avec 175 milliards de paramètres et un apprentissage en quelques exemples (few-shot learning) performant, permettant la génération de texte et l'accomplissement de tâches à partir de prompts minimaux.

Generative Pre-trained Transformer 3 (GPT-3) est un grand modèle de langage publié par OpenAI en 2020 dans le cadre de la série GPT de l'entreprise. Il s'agit d'un modèle transformer à décodeur seul de réseau neuronal profond, remplaçant les architectures basées sur la récurrence et la convolution par un mécanisme d'attention permettant de se concentrer sélectivement sur le texte d'entrée pertinent. GPT-3 possède 175 milliards de paramètres, chacun avec une précision de 16 bits, nécessitant 350 Go de stockage, et une fenêtre de contexte de 2 048 jetons, démontrant de fortes capacités d'apprentissage en zero-shot et en few-shot sur de nombreuses tâches.

Contexte

Le développement de GPT-3 s'inscrivait dans une révolution plus large de l'apprentissage automatique, portée par des algorithmes améliorés, des ordinateurs plus puissants et une augmentation des données numérisées. L'architecture transformer, introduite en 2017, est devenue un fondement clé pour les systèmes de traitement du langage naturel (NLP). Les chercheurs d'OpenAI ont publié un article le 11 juin 2018, présentant le premier transformer génératif pré-entraîné (GPT-1), un type de grand modèle de langage génératif pré-entraîné sur un grand corpus de texte et affiné pour des tâches spécifiques. GPT-2, publié en février 2019, a étendu GPT-1 avec 1,5 milliard de paramètres et a été entraîné sur 8 millions de pages web. En février 2020, Microsoft a introduit Turing Natural Language Generation (T-NLG) avec 17 milliards de paramètres, qui était alors le plus grand modèle de langage.

Entraînement et capacités

Le 28 mai 2020, un préprint arXiv de 31 ingénieurs et chercheurs d'OpenAI décrivait GPT-3, un modèle de langage de troisième génération à la pointe de la technologie. La capacité de GPT-3 a été augmentée de plus de deux ordres de grandeur par rapport à GPT-2, ce qui en faisait le plus grand modèle de langage non creux à cette époque. Sa précision est attribuée à sa capacité accrue et à son nombre de paramètres, étant dix fois plus grand que le Turing NLG de Microsoft. Lambdalabs a estimé un coût d'entraînement hypothétique d'environ 4,6 millions de dollars et 355 ans sur un seul GPU, avec un temps réel plus court en utilisant des GPU en parallèle.

L'ensemble de données de pré-entraînement comprenait 60 % de Common Crawl filtré (410 milliards de jetons encodés par paires d'octets), 22 % de WebText2 (19 milliards de jetons), 8 % de Books1 (12 milliards de jetons), 8 % de Books2 (55 milliards de jetons) et 3 % de Wikipédia (3 milliards de jetons). La déduplication floue utilisait MinHashLSH d'Apache Spark. GPT-3 a été entraîné sur des centaines de milliards de mots et pouvait coder en CSS, JSX et Python.

Étant donné que les données d'entraînement étaient exhaustives, GPT-3 ne nécessitait aucun entraînement supplémentaire pour des tâches distinctes. Cependant, il générait parfois un langage toxique en imitant ses données d'entraînement. Une étude de l'Université de Washington a constaté que la toxicité de GPT-3 était comparable à celle de GPT-2 et de CTRL. OpenAI a mis en œuvre des stratégies pour limiter les sorties toxiques, ce qui a entraîné moins de toxicité que GPT-1 mais plus que CTRL Wiki.

Le 11 juin 2020, OpenAI a annoncé l'accès à son API GPT-3, un ensemble d'outils d'apprentissage automatique avec une interface texte-entrée, texte-sortie pour toute tâche en anglais. Les premiers utilisateurs l'ont trouvé « étrangement bon » pour écrire un texte cohérent. Dans une expérience, 80 sujets américains ont jugé de courts articles comme écrits par un humain ou par GPT-3, ne les identifiant correctement que 52 % du temps, légèrement mieux que le hasard. Le 18 novembre 2021, OpenAI a rendu l'accès à l'API sans restriction avec des outils de modération de contenu. Le 27 janvier 2022, les modèles InstructGPT sont devenus la valeur par défaut, produisant un contenu mieux aligné avec moins de faits inventés et moins de toxicité.

La capacité de GPT-3 à générer des articles de presse impossibles à distinguer de ceux écrits par des humains présente un potentiel pour des applications à la fois bénéfiques et nuisibles, notamment la désinformation, le spam, le hameçonnage et l'abus des processus juridiques, comme détaillé dans l'article du 28 mai 2020.

Licence commerciale

Le 22 septembre 2020, Microsoft a annoncé avoir obtenu une licence exclusive pour GPT-3. Bien que d'autres puissent toujours utiliser l'API publique, seul Microsoft avait accès au modèle sous-jacent. Cette licence exclusive faisait partie du partenariat plus large de Microsoft avec OpenAI, qui comprenait des investissements et une intégration dans les services Azure.

Impact et héritage

GPT-3 a considérablement influencé le domaine de l'intelligence artificielle, démontrant la puissance de la mise à l'échelle des modèles transformer. Ses capacités d'apprentissage en few-shot ont réduit le besoin d'affinage spécifique aux tâches, inspirant des modèles ultérieurs comme InstructGPT et plus tard GPT-4. La publication a également suscité des discussions sur les implications éthiques des grands modèles de langage, notamment les biais, la désinformation et le contrôle d'accès.

L'architecture et l'approche d'entraînement de GPT-3 sont devenues une référence pour les grands modèles de langage ultérieurs, y compris ceux de Anthropic et Google DeepMind. Son succès commercial via l'API et la licence de Microsoft a établi un modèle économique pour la recherche en IA, influençant le paysage plus large de l'IA générative.

Détails techniques

GPT-3 utilise une architecture transformer avec attention multi-têtes et encodage positionnel. Il adopte une conception à décodeur seul, contrairement aux modèles encodeur-décodeur, et utilise des techniques comme la normalisation de couche et les réseaux résiduels. L'entraînement impliquait une descente de gradient avec des optimiseurs comme Adam et des programmes de taux d'apprentissage. Les paramètres du modèle sont stockés avec une précision de 16 bits, réduisant les besoins en mémoire.

La fenêtre de contexte de 2 048 jetons de GPT-3 limite la longueur de l'entrée qu'il peut traiter, mais il peut générer un texte cohérent sur plusieurs paragraphes. Son apprentissage en few-shot est réalisé par incitation (prompting), où des exemples sont fournis dans l'entrée, sans mettre à jour les poids du modèle. Cette capacité était une innovation clé, permettant une large applicabilité sans affinage.

Réception et préoccupations

GPT-3 a reçu une attention considérable pour sa génération de texte impressionnante, mais a également soulevé des préoccupations concernant une utilisation abusive potentielle. Les chercheurs ont souligné des risques tels que la génération de fausses nouvelles, de spam et de contenu de hameçonnage. L'accès initial restreint d'OpenAI et les outils de modération de contenu ultérieurs visaient à atténuer ces risques. La tendance du modèle à produire un langage toxique, malgré des améliorations, est restée une préoccupation, conduisant à des recherches continues sur la sécurité et l'alignement de l'IA.

La licence exclusive à Microsoft a été controversée, car elle limitait l'accès au modèle sous-jacent pour d'autres chercheurs et entreprises. Cependant, l'API publique a permis une expérimentation plus large, contribuant à l'avancement rapide des applications des modèles de langage.

La publication de GPT-3 a marqué une étape importante dans l'intelligence artificielle, démontrant le potentiel des modèles transformer à grande échelle et façonnant l'avenir de l'apprentissage automatique et de l'apprentissage profond. Son influence est visible dans les modèles ultérieurs et dans le domaine croissant de l'IA générative.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·machine-learning·language-model·openai
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique