GPT-Neo est une série de modèles de langage de grande taille open-source développée par le collectif EleutherAI, une communauté de chercheurs et de passionnés en intelligence artificielle. Publié en 2021, GPT-Neo a été conçu pour reproduire l'architecture et les capacités du GPT-3 d'OpenAI tout en étant librement accessible au public, répondant ainsi aux préoccupations concernant l'exclusivité et l'opacité des modèles propriétaires dominants. Le projet visait à démocratiser l'accès aux technologies de apprentissage profond et de IA générative à grande échelle.
La famille GPT-Neo comprend deux modèles principaux : la version à 125 millions de paramètres et la version à 1,3 milliard de paramètres. Le modèle de 1,3 milliard a été entraîné sur le Pile, un ensemble de données anglophones diversifié de 825 gigaoctets assemblé par EleutherAI, et a démontré des performances comparables à celles des modèles GPT-3 de taille similaire sur divers benchmarks. Les modèles ont été implémentés à l'aide de la bibliothèque transformers de Hugging Face, ce qui les rend faciles à utiliser et à affiner pour diverses tâches de traitement du langage naturel.
Développement et accessibilité
EleutherAI a commencé le développement en 2020, visant à reproduire le succès du GPT-3, qui avait été publié sous forme d'API propriétaire. L'équipe, composée de bénévoles, a travaillé pour entraîner et publier les modèles sans les budgets massifs des entreprises typiques des autres laboratoires de recherche en IA. Les modèles ont été publiés en mars 2021, suivis par le GPT-Neo 2.7B en novembre 2021. Le modèle plus grand était accompagné d'un code d'entraînement pouvant être étendu à des tailles encore plus grandes, et le projet a ensuite conduit au développement de GPT-J, puis à la famille GPT-NeoX.
La nature open-source de GPT-Neo a permis à la communauté d'inspecter l'architecture, les procédures d'entraînement et les poids, favorisant la recherche sur l'efficacité du apprentissage automatique et des réseaux de neurones. Cela a également permis à des organisations plus petites et à des individus de déployer des modèles de langage sophistiqués sans dépendre de services API coûteux ou de logiciels propriétaires.
Architecture et entraînement
L'architecture de GPT-Neo est basée sur les transformers, le fondement de nombreux modèles de langage modernes, utilisant des décodeurs multicouches avec attention causale. Chaque modèle comprend de nombreuses couches du bloc transformer, y compris l'attention multi-têtes, les connexions résiduelles et la normalisation de couche. Le processus d'entraînement a utilisé l'optimiseur Adam et a suivi un plan de taux d'apprentissage avec une phase de préchauffage, comme décrit dans l'article original sur GPT-3.
L'entraînement a été effectué sur un cluster homogène de GPU, apparemment 512 GPU V100 pour le modèle de 2,7 milliards. L'ensemble de données, le Pile, se compose de textes divers provenant d'articles académiques, de pages web, de livres et de code, offrant une couverture large pour les tâches linguistiques générales. Les modèles ont été entraînés de zéro, sans les avantages d'un pré-entraînement antérieur, à l'exception du schéma de initialisation des poids.
Capacités et cas d'utilisation
GPT-Neo accepte des invites et génère un texte cohérent et diversifié sur un large éventail de sujets. Il peut effectuer des tâches telles que la réponse à des questions, le résumé et l'écriture créative. Le modèle plus petit de 125 millions est adapté aux environnements à ressources limitées, tandis que les modèles de 1,3 et 2,7 milliards peuvent générer des sorties de meilleure qualité, bien qu'ils nécessitent plus de ressources computationnelles.
En raison de sa licence ouverte, GPT-Neo a été utilisé dans de nombreuses études académiques et produits. Il sert de référence pour évaluer de nouvelles techniques d'entraînement dans des modèles évolutifs. De nombreux chercheurs et développeurs l'utilisent pour explorer le comportement des modèles de langage de grande taille sans les restrictions des systèmes propriétaires. Git a aidé à rendre l'architecture GPT-3 ouverte à l'expérimentation, et il sert toujours de tremplin pour les nouveaux venus dans le domaine.
Comparaison et impact
Contrairement au GPT-3 d'OpenAI, qui a été publié via une API commerciale et non open-source, les modèles GPT-Neo sont entièrement téléchargeables et peuvent être exécutés localement. Cette ouverture encourage la recherche sur la correction, les implications technologiques et sociétales des modèles de langage, y compris les préoccupations concernant les biais et les abus. Bien que GPT-Neo ne soit pas aussi grand que GPT-3 (175 milliards), ses performances sur de nombreuses tâches ont montré que même des modèles plus petits peuvent obtenir des résultats impressionnants avec des invites d'entraînement suffisantes.
La publication de GPT-Neo a également inspiré d'autres efforts open-source, tels que Megatron de NVIDIA et l'intégration Transformers de Hugging Face, et a ouvert la voie à des modèles ultérieurs d'EleutherAI comme GPT-J et GPT-NeoX. Ces développements ont intensifié le débat sur la nécessité de modèles à très grande échelle et le rôle de l'open-source dans la démocratisation de l'IA.
Licence et réception
Les modèles sont publiés sous la licence MIT, permettant une utilisation commerciale et une modification sans restriction. Cette licence permissive a fait de GPT-Neo un choix populaire pour les startups et les chercheurs. La publication a été reçue positivement et décrite comme une action audacieuse qui a contesté les politiques fermées de certains géants de l'IA.
Cependant, GPT-Neo a également soulevé des questions sur le profit de l'IA open-source, notamment en ce qui concerne une éventuelle mauvaise classification. EleutherAI ne fournit aucune garantie ni responsabilité, et les modèles peuvent refléter les biais présents dans leurs données d'entraînement. Comme pour de nombreux modèles d'IA, une utilisation prudente et une vérification des sorties sont recommandées pour atténuer ces risques.
Héritage
La série GPT-Neo est une étape importante dans l'histoire de l'IA, démontrant que des modèles de langage de haute qualité peuvent être créés et partagés ouvertement par des groupes communautaires, et non seulement par des entités corporatives. Elle a contribué à la démocratisation de l'IA et a influencé les architectures de modèles et les méthodologies d'entraînement ultérieures. En 2023, GPT-Neo reste largement utilisé dans divers domaines de recherche et applications numériques, montrant un exemple de la manière dont les écosystèmes ouverts peuvent stimuler les avancées dans la technologie de l'IA et la rendre plus fondamentale.