Lancement d'OpenAI GPT-3

Traduit de l'anglais

GPT-3 est un grand modèle de langage publié par OpenAI en juin 2020, avec 175 milliards de paramètres, remarqué pour ses capacités en apprentissage zero-shot et few-shot. Son lancement via une API a permis un accès large, et Microsoft a ensuite obtenu une licence exclusive sur le modèle.

Generative Pre-trained Transformer 3 (GPT-3) est un grand modèle de langage publié par OpenAI en 2020 dans le cadre de la série de modèles GPT de l'entreprise. Il s'agit d'un modèle Transformer (architecture) à décodeur seul, issu d'un réseau de neurones profond, utilisant un mécanisme d'attention pour se concentrer sélectivement sur les segments d'entrée pertinents. Avec 175 milliards de paramètres, chacun stocké en précision 16 bits, GPT-3 nécessite 350 Go de stockage et prend en charge une fenêtre de contexte de 2 048 jetons. Il a démontré de solides capacités d'apprentissage en zéro-shot et en few-shot dans de nombreuses tâches, et sa sortie via une API a été annoncée le 11 juin 2020.

Contexte

Selon The Economist, l'amélioration des algorithmes, des ordinateurs plus puissants et un corpus numérisé en croissance ont alimenté une révolution dans le Machine learning. De nouvelles techniques dans les années 2010 ont conduit à des améliorations rapides dans la manipulation du langage, reposant sur des architectures neuronales vaguement inspirées du cerveau. L'architecture Transformer (architecture), introduite en 2017, est devenue fondamentale pour les systèmes de Natural language processing. En juin 2018, OpenAI a publié le premier transformateur génératif pré-entraîné (GPT-1), un modèle entraîné sur un vaste corpus de texte puis affiné pour des tâches spécifiques. GPT-2 a suivi en février 2019, multipliant par dix les paramètres et la taille du jeu de données, atteignant 1,5 milliard de paramètres entraînés sur 8 millions de pages web. En février 2020, Microsoft a introduit Turing NLG, un modèle de 17 milliards de paramètres, alors considéré comme le plus grand.

Entraînement et capacités

Le 28 mai 2020, une prépublication arXiv rédigée par 31 ingénieurs et chercheurs d'OpenAI a décrit le développement de GPT-3, augmentant la capacité du modèle de plus de deux ordres de grandeur par rapport à GPT-2, ce qui en faisait le plus grand modèle de langage non creux de cette période. Sa précision provenait d'une capacité et de paramètres accrus, étant dix fois plus grand que Turing NLG de Microsoft. Lambdalabs a estimé le coût d'entraînement à 4,6 millions de dollars et à 355 ans sur un seul GPU en 2020. Les données de pré-entraînement comprenaient 410 milliards de jetons encodés par paires d'octets provenant de Common Crawl filtré (60 % des données pondérées), ainsi que WebText2, Books1, Books2 et Wikipédia (3 %). GPT-3 pouvait également coder en Python, JSX et CSS.

GPT-3 ne nécessitait pas d'affinage spécifique à une tâche, traitant plutôt des instructions générales. Cependant, les données d'entraînement contenaient un langage toxique que le modèle pouvait parfois reproduire. Une étude de l'Université de Washington a constaté que la toxicité de GPT-3 était comparable à celle de GPT-2 et de CTRL. OpenAI a mis en œuvre des stratégies d'atténuation, réduisant les sorties toxiques par rapport à GPT-1.

Accès à l'API et évaluation

Le 11 juin 2020, OpenAI a publié une API à usage général avec une interface texte-entrée texte-sortie, permettant toute tâche en anglais, plutôt que des cas d'usage uniques. Les premiers testeurs ont décrit GPT-3 comme étrangement bon dans la génération de texte cohérent. Dans une expérience avec 80 participants américains, seul un taux de réussite de 52 % distinguait les articles de GPT-3 de ceux rédigés par des humains, un léger avantage par rapport au hasard. Le 18 novembre 2021, OpenAI a élargi l'accès à son API avec un outil de modération de contenu. Le 27 janvier 2022, InstructGPT est devenu le modèle API par défaut, améliorant le suivi des instructions et réduisant les faits fabriqués.

Licence et impact

Le 22 septembre 2020, Microsoft a annoncé une licence exclusive pour le modèle sous-jacent de GPT-3. D'autres pouvaient utiliser l'API publique, mais seul Microsoft pouvait accéder au code et aux poids. GPT-3 a démontré un potentiel pour générer des articles de presse difficiles à distinguer de l'écriture humaine, suscitant des préoccupations concernant la désinformation et la fraude. Les chercheurs ont décrit des effets nocifs potentiels, notamment le spam et les abus juridiques.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:openai·large-language-model·generative-ai·natural-language-processing
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique