GPT-NeoX est un modèle de langage de grande taille open source développé par le collectif de recherche EleutherAI. Publié en février 2022, il s'agit d'un modèle autorégressif transformeur de 20 milliards de paramètres, ce qui en fait l'un des plus grands modèles de langage entièrement open source disponibles à sa sortie. Le modèle a été conçu pour faire progresser la recherche en intelligence artificielle en offrant une alternative accessible au public aux systèmes propriétaires, avec ses poids, son code d'entraînement et ses détails d'évaluation rendus librement disponibles. GPT-NeoX s'appuie sur la série antérieure GPT-Neo, en augmentant l'architecture et les techniques d'entraînement pour améliorer les performances sur une gamme de tâches en langage naturel.
L'architecture du modèle suit la conception standard d'un transformeur décodeur seul, intégrant attention multi-têtes avec encodage positionnel et normalisation de couche. Il utilise des connexions de réseau résiduel dans sa pile de 44 couches, avec une dimension cachée de 6144 et 32 têtes d'attention. Le modèle a été entraîné sur un corpus diversifié de textes provenant de crawls web, de livres et d'articles académiques, totalisant environ 825 gigaoctets de données. L'entraînement a été réalisé sur un cluster de 96 GPU NVIDIA A100 utilisant le cadre Megatron-DeepSpeed, ce qui a permis un élagage de modèle efficace et une parallélisation sur plusieurs nœuds. Le processus d'entraînement a duré environ deux mois et a consommé environ 1,1 exaflop de calcul.
Entraînement et Optimisation
GPT-NeoX a employé plusieurs techniques avancées de apprentissage automatique pour stabiliser l'entraînement à grande échelle. Le modèle a utilisé le écrêtage de gradient pour prévenir les gradients explosifs et a adopté un programme de taux d'apprentissage avec une phase d'échauffement suivie d'un déclin cosinusoïdal. L'initialisation des poids a été réalisée avec une distribution normale à variance échelonnée, suivant les pratiques des modèles transformeurs antérieurs. L'objectif d'entraînement était la modélisation causale standard du langage, prédisant le jeton suivant à partir du contexte précédent. Pour améliorer l'efficacité, l'équipe a implémenté le séquence-à-séquence par lots et a utilisé l'optimiseur Adam avec des variantes de SGD pour les mises à jour de paramètres. Le modèle a également incorporé le abandon pour la régularisation, bien qu'à des taux plus faibles que les modèles plus petits pour préserver la capacité.
Capacités et Performances
GPT-NeoX démontre de bonnes performances sur des références telles que LAMBADA, HellaSwag et SuperGLUE, rivalisant souvent avec ou dépassant des modèles de taille similaire qui ne sont pas entièrement ouverts. Il excelle dans les tâches de apprentissage profond nécessitant des dépendances à longue portée, comme la génération d'histoires et la réponse à des questions ouvertes. Le modèle prend en charge le échantillonnage top-k, le échantillonnage top-p et le réglage de température pour une génération de texte contrôlée, permettant aux utilisateurs d'ajuster la créativité et le déterminisme. Son échelle de 20 milliards de paramètres permet des représentations nuancées de réseaux neuronaux, mais nécessite également des ressources de calcul substantielles pour l'inférence, nécessitant généralement plusieurs GPU haut de gamme. Le modèle est disponible en plusieurs tailles, y compris des variantes de 1,3B et 2,7B, bien que la version 20B soit la version phare.
Impact et Écosystème
GPT-NeoX a eu une influence significative sur la communauté open source du IA générative. Il a servi de fondation pour des modèles ultérieurs, y compris GPT-J et des dérivés de GPT-NeoX-20B, et a inspiré des efforts d'autres organisations pour publier des modèles ouverts à grande échelle. Le code d'entraînement et l'infrastructure ont été largement réutilisés, contribuant au développement d'outils comme le EleutherAI Evaluation Harness. La publication du modèle a également suscité des discussions sur le coût environnemental de l'entraînement de grands modèles et l'importance de la transparence dans la recherche en IA. Il est souvent comparé aux modèles propriétaires de OpenAI et Anthropic, bien qu'il reste plus petit que leurs offres les plus importantes.
Limitations et Considérations Éthiques
Comme beaucoup de grands modèles de langage, GPT-NeoX peut générer du contenu biaisé ou nuisible, reflétant les biais présents dans ses données d'entraînement. Il n'a pas de filtres de sécurité intégrés, et les utilisateurs sont invités à appliquer une modération supplémentaire. La taille du modèle le rend impraticable pour un déploiement sur du matériel grand public, limitant l'accès aux institutions bien financées. EleutherAI a souligné que le modèle est un artefact de recherche, pas un système de production, et encourage une utilisation responsable. Les données d'entraînement incluent du matériel protégé par le droit d'auteur, soulevant des questions juridiques sur l'usage équitable, bien que le modèle soit publié sous licence Apache 2.0, permettant une utilisation en aval étendue.
Disponibilité et Utilisation
GPT-NeoX est disponible en téléchargement sur Hugging Face et le dépôt GitHub d'EleutherAI. Le modèle peut être exécuté avec la bibliothèque Transformers ou le codebase original Megatron-DeepSpeed. Pour les développeurs, il offre un équilibre entre performance et accessibilité, avec des versions quantifiées créées par la communauté réduisant les besoins en mémoire. Le modèle a été utilisé dans la recherche académique sur l'interprétabilité, le apprentissage par curriculum et le RLHF, et sert de référence pour évaluer les architectures plus récentes. Sa nature ouverte permet un ajustement fin sur des domaines spécialisés, ce qui en fait un outil polyvalent pour les praticiens du apprentissage automatique.