GPT-3 (Generative Pretrained Transformer 3) est un modèle de langage de grande taille développé par OpenAI et introduit dans un article de mai 2020, « Les modèles de langage sont des apprenants à quelques exemples », avec un accès plus large à l'API au cours du reste de l'année 2020. Comme son prédécesseur GPT-2, GPT-3 est construit sur l'architecture transformeur et entraîné avec un objectif autorégressif de prédiction du jeton suivant, mais mis à l'échelle de manière spectaculaire jusqu'à 175 milliards de paramètres, plus de 100 fois plus grand que le modèle complet de GPT-2, entraîné sur un mélange de Common Crawl, de livres et de texte de Wikipédia.
Apprentissage à quelques exemples
La contribution de recherche centrale de GPT-3 a été de démontrer qu'un modèle de langage suffisamment grand pouvait effectuer un large éventail de tâches, notamment la traduction, la réponse à des questions, l'arithmétique et un raisonnement simple, en se basant uniquement sur quelques exemples dans son invite, sans ajustement basé sur le gradient. Cette capacité, décrite par les chercheurs d'OpenAI, y compris l'auteur principal Tom Brown, comme apprentissage à quelques exemples et plus généralement comme apprentissage dans le contexte, suggérait que la seule échelle pouvait remplacer l'entraînement spécifique à une tâche, une conclusion qui a renforcé les croyances émergentes sur les lois de mise à l'échelle dans la modélisation du langage et façonné les priorités de recherche ultérieures dans le domaine.
Lancement commercial
Plutôt que de publier publiquement les poids de GPT-3, comme il l'avait finalement fait avec GPT-2, OpenAI a rendu GPT-3 disponible exclusivement via une API payante à partir de juin 2020, d'abord en version bêta privée. Cette décision a établi un modèle commercial, ensuite largement adopté dans l'industrie, dans lequel les modèles de langage de pointe sont accessibles en tant que service cloud comptabilisé plutôt que téléchargés et exécutés localement, une différence avec les modèles à poids ouverts publiés par des concurrents dans les années suivantes. L'API a rapidement attiré une vague de startups construisant des produits basés sur GPT-3, notamment des assistants d'écriture précoces, des chatbots et des outils de génération de code, et Microsoft a séparément obtenu une licence exclusive sur les poids sous-jacents du modèle GPT-3 en 2020 dans le cadre de son investissement plus large dans OpenAI.
Impact et limites
GPT-3 a été largement couvert par la presse grand public et technologique comme une preuve que les modèles de langage approchaient de nouvelles capacités qualitatives, et il a directement informé le développement de variantes ajustées par instructions entraînées avec des techniques incluant le RLHF, un travail qui a culminé avec la sortie de ChatGPT en novembre 2022, construit sur une variante GPT-3.5. GPT-3 a également suscité des critiques substantielles pour sa tendance à produire des sorties fluides mais factuellement incorrectes, un exemple précoce et important de ce que le domaine a ensuite appelé hallucinations, ainsi que pour la reproduction de biais présents dans ses données d'entraînement. Son successeur, GPT-4, a été publié en mars 2023 avec des capacités considérablement étendues, notamment l'entrée multimodale.