GPT-2 (Generative Pretrained Transformer 2) est un modèle de langage de grande taille développé par OpenAI et annoncé pour la première fois en février 2019. Construit sur l'architecture transformeur, GPT-2 a été entraîné sur WebText, un ensemble de données d'environ 8 millions de pages web, en utilisant un objectif de prédiction du prochain jeton purement autorégressif, suivant directement le modèle GPT original plus petit publié en 2018.
Publication par étapes
GPT-2 est devenu largement connu non pas principalement pour son architecture, mais pour la manière dont OpenAI l'a publié. Le modèle complet contenait 1,5 milliard de paramètres, une taille inhabituellement grande pour un modèle de langage public à l'époque, et générait des textes cohérents de plusieurs paragraphes à partir de courtes invites avec une fluidité qui a surpris de nombreux chercheurs. Citant des préoccupations concernant des utilisations malveillantes telles que la génération de fausses nouvelles, de spam et d'usurpation d'identité à grande échelle, OpenAI a initialement refusé de publier le modèle complet de 1,5 milliard de paramètres, ne publiant que des versions plus petites tout en étudiant les abus potentiels. Cette décision, présentée publiquement comme le modèle étant « trop dangereux pour être publié », a suscité des critiques significatives de la part d'une partie de la communauté de recherche, qui a soutenu qu'elle était soit trop prudente, soit une tactique marketing, soit qu'elle établissait un précédent gênant pour la rétention de résultats de recherche. OpenAI a inversé sa position progressivement, publiant le modèle complet de 1,5 milliard de paramètres en novembre 2019 après avoir rapporté que son étude de publication par étapes n'avait trouvé aucune preuve solide des abus qu'elle craignait à cette échelle.
Importance
GPT-2 a été l'un des premiers modèles à démontrer une forte performance en matière de tâches sans apprentissage spécifique, générant des résumés, des traductions et des réponses à des questions sans ajustement fin spécifique à la tâche, simplement en étant sollicité avec des exemples en langage naturel, une illustration précoce de ce qui serait plus tard formalisé comme apprentissage en quelques exemples et apprentissage dans le contexte dans son successeur, GPT-3. Son échelle, environ dix fois plus grande que celle du GPT original, a également servi de point de données précoce soutenant ce que les chercheurs décriraient plus tard plus formellement comme lois de mise à l'échelle : que l'augmentation de la taille du modèle et des données améliorait de manière prévisible la performance de modélisation du langage.
Héritage
La stratégie de publication de GPT-2 est devenue une étude de cas largement citée dans la gouvernance de l'IA et le débat sur la sécurité de l'IA, préfigurant des arguments plus tardifs et plus soutenus sur les publications ouvertes par rapport aux publications fermées, qui ont refait surface avec des systèmes comme LLaMA et d'autres modèles à poids ouverts. Au sein de la propre gamme de produits d'OpenAI, l'architecture et l'approche d'entraînement de GPT-2 ont constitué la base directe de GPT-3, publié l'année suivante avec plus de 100 fois le nombre de paramètres, et finalement du produit ChatGPT qui a porté la lignée GPT à l'attention du grand public en 2022. Le chercheur Alec Radford et ses collègues d'OpenAI sont crédités comme les principaux auteurs de GPT-2.