Traduit de l'anglais

GPT-2 est un grand modèle de langage développé par OpenAI, publié en 2019, connu pour sa génération de texte avancée et sa sortie initialement restreinte en raison de préoccupations de sécurité.

GPT-2 (Generative Pre-trained Transformer 2) est un modèle de langage de grande taille développé par OpenAI, représentant la deuxième itération de leur série fondatrice GPT. Il a été pré-entraîné sur un ensemble de données de 8 millions de pages web et a démontré des avancées significatives dans la génération de texte, la traduction, le résumé et la réponse aux questions. Le modèle a d'abord été retenu de la publication publique en raison de préoccupations concernant une utilisation abusive potentielle, mais a finalement été entièrement publié en novembre 2019.

GPT-2 est une mise à l'échelle directe de son prédécesseur, GPT-1, avec une augmentation décuplée du nombre de paramètres et de la taille de l'ensemble de données d'entraînement. Il utilise une architecture transformeur, qui emploie des mécanismes d'attention pour se concentrer sélectivement sur les parties pertinentes du texte d'entrée, permettant une plus grande parallélisation et surpassant les modèles précédents basés sur RNN/CNN/LSTM. Sa capacité d'apprentissage général lui a permis d'effectuer diverses tâches en prédisant avec précision l'élément suivant dans une séquence, bien qu'il puisse devenir répétitif ou incohérent sur des passages plus longs. GPT-2 a été supplanté par des modèles ultérieurs comme GPT-3 et GPT-4, qui ne sont plus open source.

Entraînement et Architecture

L'entraînement de GPT-2 a tiré parti de la capacité de parallélisation massive de l'architecture transformeur, lui permettant d'être entraîné sur des corpus plus volumineux que les modèles précédents de traitement du langage naturel. OpenAI a initialement envisagé CommonCrawl, un grand corpus issu du web, mais l'a rejeté en raison de contenu inintelligible. À la place, ils ont développé un nouveau corpus appelé WebText, créé en extrayant des pages liées à partir de publications Reddit avec au moins 3 points de karma avant décembre 2017. Le corpus a été nettoyé en analysant le HTML en texte brut, en supprimant les doublons et en excluant les pages Wikipédia pour éviter le surapprentissage.

Le coût d'entraînement de GPT-2 est estimé à environ 43 000 dollars, sur la base d'une déclaration d'Andrej Karpathy, utilisant 32 puces TPU v3 pendant 168 heures à environ 8 dollars par puce et par heure. D'autres sources citent un coût d'environ 256 dollars par heure. En comparaison, l'entraînement de BERT et XLNet a coûté respectivement 6 912 et 245 000 dollars. L'architecture de GPT-2 est un réseau de neurones profond avec un transformeur génératif pré-entraîné, implémentant l'attention au lieu de la récurrence ou de la convolution.

Publication et Restrictions Initiales

GPT-2 a été annoncé le 14 février 2019. Contrairement aux modèles précédents d'OpenAI, le code source n'a pas été immédiatement publié, citant des risques d'utilisation malveillante. Un accès limité a été accordé à des organes de presse sélectionnés, et OpenAI a démontré une version affinée pour générer des avis de produits, qui pourrait être utilisée pour contourner les filtres anti-spam. Des chercheurs comme Jeremy Howard ont averti du potentiel de remplir le web de prose convaincante, tandis que l'Allen Institute for Artificial Intelligence a annoncé un outil de détection pour les « fausses nouvelles neuronales ».

Les opinions étaient partagées sur la menace. Certains, comme Anima Anandkumar, ont qualifié les restrictions de « conneries malveillantes », tandis que The Gradient a publié une lettre ouverte comparant la technologie à l'imprimerie et à Photoshop. Malgré la controverse, OpenAI a publié une version partielle avec 774 millions de paramètres le 20 août 2019, et le modèle complet de 1,5 milliard de paramètres le 5 novembre 2019.

Variantes du Modèle et Réplications

La série GPT-2 comprenait quatre modèles de tailles variées, publiés par étapes. Le plus petit modèle a été rendu disponible en février 2019, avec des modèles plus grands suivant. Le modèle complet de 1,5 milliard de paramètres a été la dernière publication. Les méthodes du modèle ont été décrites dans des publications, permettant à d'autres de le répliquer en tant que logiciel libre. Une telle réplication, OpenGPT-2, a été publiée en août 2019 avec une version sous licence libre de WebText appelée OpenWebText, à un coût de calcul d'environ 50 000 dollars.

Impact et Héritage

La publication de GPT-2 a marqué une étape importante dans la IA générative, démontrant le potentiel des transformeurs à grande échelle. Sa capacité à générer un texte cohérent a été saluée par des médias comme The Verge et The Guardian, bien qu'il ait été noté que les longs passages pouvaient devenir répétitifs. La rétention initiale du modèle a suscité des débats sur l'accès ouvert et la sécurité dans la recherche en IA, influençant les discussions futures sur le développement responsable de l'IA. GPT-2 a été succédé par GPT-3 et GPT-4, qui ont continué à faire progresser le domaine mais se sont éloignés de la disponibilité open source.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·openai·transformer·generative-ai
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique