GPT-2 (Generative Pre-trained Transformer 2) est un modèle de langage de grande taille développé par OpenAI, annoncé le 14 février 2019. Il s'agit du deuxième modèle de la série GPT fondatrice d'OpenAI, succédant à GPT-1 et précédant GPT-3. GPT-2 a été pré-entraîné sur un ensemble de données de 8 millions de pages web, et sa capacité à générer un texte cohérent et contextuellement pertinent a été considérée comme une avancée significative dans le domaine de la IA générative. Le modèle a d'abord été retenu lors de sa sortie partielle, la version complète de 1,5 milliard de paramètres n'étant disponible que le 5 novembre 2019. En raison de sa capacité à traduire des langues, répondre à des questions et résumer des passages, les chercheurs et commentateurs ont souligné son potentiel à la fois pour des usages bénéfiques et pour des usages malveillants, tels que la génération de spam ou la création de fausses nouvelles.
Architecture
Comme son prédécesseur GPT-1 et ses successeurs, GPT-2 utilise une architecture d'apprentissage profond de type transformeur, qui est un type de réseau neuronal implémentant un mécanisme connu sous le nom d'attention. Ce mécanisme d'attention s'est avéré améliorer les performances pour les tâches impliquant une prédiction séquence à séquence. Contrairement aux modèles plus anciens basés sur la récurrence ou la convolution, le mécanisme d'attention du transformeur permet au modèle de traiter le texte d'entrée en parallèle, ce qui peut considérablement augmenter la vitesse d'entraînement et d'inférence. L'architecture du modèle a été décrite comme une version à plus grande échelle de GPT-1, avec un facteur de 10 d'augmentation de son nombre de paramètres (1,5 milliard) et de la taille des données d'entraînement. Cette parallélisation, réalisée sur du matériel spécialisé, a permis l'entraînement sur un corpus plus vaste que ce qui était auparavant possible, ce qui a contribué à sa capacité à traiter des tâches générales de apprentissage automatique.
Entraînement
GPT-2 a été entraîné sur WebText, un corpus de plus de 100 gigaoctets de texte extrait de liens sortants sur Reddit ayant reçu au moins 3 karma avant décembre 2017. Reddit a été utilisé comme proxy pour un contenu organisé par des humains, filtrant les pages de faible qualité. Le HTML a été analysé en texte brut, les liens en double ont été éliminés, et les pages Wikipédia ont été retirées de l'ensemble d'entraînement pour éviter le surapprentissage, car ces articles apparaissent souvent dans de nombreux autres ensembles de données. CommonCrawl, malgré sa taille, a été rejeté en raison de la grande quantité de contenu inintelligible qu'il contenait. L'infrastructure pour l'entraînement de GPT-2 utilisait 32 puces TPU v3 pendant 168 heures, coûtant environ 43 000 $ en calcul, comme l'a déclaré Andrej Karpathy, un chercheur associé au projet à l'époque. C'était relativement peu pour un modèle de cette taille, en raison de l'efficacité du transformeur. Le résultat était un modèle capable de produire un texte parfois impossible à distinguer des productions humaines, bien qu'il puisse devenir répétitif ou absurde dans les passages plus longs, une limitation que les futurs grands modèles de langage ont cherché à améliorer.
Sortie partielle
La décision initiale d'OpenAI de ne pas publier immédiatement le modèle complet était fondée sur la préoccupation que le modèle puisse être utilisé à des fins malveillantes, comme générer du spam ou de la désinformation. L'entreprise a publié une version partielle avec 774 millions de paramètres le 20 août 2019, environ la moitié de la taille de l'original (également connue sous le nom de version 774M). Cette sortie partielle visait à permettre aux chercheurs de comprendre le comportement du modèle tout en atténuant les abus, mais l'approche d'OpenAI a suscité des réactions négatives de la part de certains chercheurs, dont Anima Anandkumar, qui a affirmé que la menace était exagérée. D'autres, cependant, ont soutenu que le modèle pourrait être utilisé pour remplir les médias sociaux de prose indiscernable, et l'Allen Institute for Artificial Intelligence a construit un détecteur de fausses nouvelles neuronales en réponse.
Dans un article de février 2019 dans The Verge, James Vincent a écrit que les sorties de GPT-2 étaient souvent clairement non humaines, mais restaient « l'un des exemples les plus passionnants » d'IA de génération de langage. L'article a démontré qu'avec un titre fictif, le modèle pouvait écrire le reste de l'article avec de fausses citations et statistiques, et même écrire de la fiction à partir d'invites appropriées. Kelsey Piper de Vox a écrit que « l'un des systèmes d'IA les plus cool que j'aie jamais vus pourrait aussi être celui qui me mettra à la porte » ; cependant, elle a décrit sa sortie sous un angle neutre. The Guardian a décrit son texte comme une « prose journalistique plausible ».
Malgré la sortie partielle, OpenAI a conservé le code du modèle complet et le corpus. Cela a conduit à diverses productions de tiers. En août 2019, la réplication en logiciel libre OpenGPT-2 a été produite en utilisant OpenWebText, ce qui a coûté environ 50 000 $ pour le calcul. Cela illustre la recherche et le développement ouverts qui ont suivi la sortie initiale du modèle.
Impact éthique et sociétal
La décision de retarder la sortie complète de GPT-2 a initié un débat public sur les risques et les avantages de la technologie de l'intelligence artificielle. Certains chercheurs ont minimisé les dangers perçus, notant que les menaces pouvaient être atténuées, tandis que d'autres ont averti d'un déluge de texte synthétique à venir qui pourrait noyer la parole humaine authentique. Il y a même eu une sortie partielle d'un modèle affiné pour générer des avis de produits positifs ou négatifs, une démonstration du potentiel de spam. En réponse au battage médiatique et à la politique d'ouverture, un groupe de chercheurs a publié une lettre ouverte demandant la sortie complète, déclinant que les modèles de langage sont aussi menaçants qu'on les présente, citant des technologies comme Photoshop et la presse à imprimer, qui ont été utilisées à mauvais escient mais aussi intégrées dans la vie quotidienne.
L'effet à long terme de la sortie retenue a été d'accroître la sensibilisation du public aux modèles de langage de grande taille et à leurs capacités. GPT-2 a finalement été utilisé comme point de mire sur la sécurité de l'intelligence artificielle, influençant les modèles open source ultérieurs. Il a ensuite été supplanté par GPT-3 et GPT-4 ; en 2024, GPT-3 et GPT-4, qui ne sont plus open source, sont devenus plus importants. L'épisode a servi de point important pour les considérations sur la manière d'équilibrer transparence et précaution lors du développement de systèmes d'IA puissants.
Héritage
GPT-2 a représenté un développement significatif dans le domaine de l'apprentissage profond, devenant une référence pour les modèles de langage ultérieurs. Sa capacité à servir d'apprenant à usage général, reposant sur la prédiction de l'élément suivant dans une séquence, et non sur des données spécifiques à une tâche, a été une étape fondamentale pour les transformeurs ultérieurs. Le nombre de paramètres du modèle et la taille de son corpus d'entraînement ont établi une voie pour la mise à l'échelle des modèles de réseaux neuronaux. Par conséquent, les exigences de calcul de la IA générative ont augmenté, et GPT-2 est considéré comme un jalon dans l'histoire de l'intelligence artificielle. Ses principes d'entraînement ont continué à influencer le développement et l'architecture des grands modèles de langage dans de nombreux domaines, et le modèle reste un point de référence bien étudié pour comprendre l'émergence et l'apprentissage automatique.