Traduit de l'anglais

GPT-NeoX est un modèle de langage de grande taille, transformeur autorégressif open-source de 20 milliards de paramètres, développé par EleutherAI et publié en février 2022. Il est conçu pour la recherche et la reproductibilité en IA.

GPT-NeoX est un modèle à 20 milliards de paramètres, un grand modèle de langage développé par le collectif de recherche EleutherAI. Publié en février 2022, il s'agit d'un modèle autorégressif open-source de type Transformer (architecture), conçu pour faire progresser la recherche en apprentissage profond et en IA générative. Le modèle a été créé pour offrir une alternative accessible au public aux systèmes propriétaires, permettant aux chercheurs d'étudier des réseaux de neurones à grande échelle sans restrictions commerciales.

GPT-NeoX s'appuie sur les principes architecturaux des modèles GPT antérieurs, utilisant un transformer à décodeur seul avec attention multi-têtes et connexions résiduelles. Son entraînement a impliqué un corpus diversifié de textes web, de livres et d'autres sources, mettant l'accent sur une couverture large pour améliorer la généralisation. Les 20 milliards de paramètres du modèle le placent dans une catégorie de taille moyenne parmi les grands modèles de langage, équilibrant coût computationnel et performance.

Architecture et Conception

Le modèle utilise une architecture transformer standard avec plusieurs améliorations pour la stabilité et l'efficacité. Il applique une normalisation de couche avant chaque sous-couche, une pratique qui améliore la convergence de l'entraînement. Les encodages positionnels sont appris, permettant au modèle de capturer l'ordre des jetons. Le mécanisme d'attention est implémenté avec attention multi-têtes, répartissant les 20 milliards de paramètres sur 64 couches et 16 têtes d'attention par couche.

GPT-NeoX intègre un écrêtage de gradient pour prévenir les gradients explosifs pendant l'entraînement, et utilise Adam comme optimiseur avec un programme de taux d'apprentissage comprenant un échauffement et une décroissance en cosinus. La taille cachée du modèle est de 6144, et ses couches feed-forward s'étendent à 24 576 dimensions. Ces choix reflètent un équilibre entre capacité du modèle et empreinte mémoire, permettant l'entraînement sur des clusters Amazon Web Services.

Données et Processus d'Entraînement

EleutherAI a entraîné GPT-NeoX sur un ensemble de données organisé appelé The Pile, un corpus anglais à grande échelle assemblé à partir de 22 sources diverses. Cela inclut des articles académiques, des livres, des pages web et des dépôts de code, totalisant environ 800 gigaoctets de texte. Le processus d'entraînement a utilisé une taille de lot de 512 séquences, chacune avec 2048 jetons, et a fonctionné pendant environ 400 000 étapes. La dépense computationnelle totale a été estimée à 1,2 exaflops, exécutée sur un cluster de 96 GPU NVIDIA A100.

L'entraînement a employé des techniques de augmentation de données telles que le masquage aléatoire et l'abandon de jetons pour améliorer la robustesse. Pour gérer la grande taille du modèle, EleutherAI a utilisé le parallélisme de modèle sur les GPU, divisant les couches et les têtes d'attention pour s'adapter aux contraintes de mémoire. Le point de contrôle final a été publié sous une licence ouverte, permettant une utilisation sans restriction pour la recherche et les applications commerciales.

Performance et Évaluation

GPT-NeoX a été évalué sur une gamme de références, y compris la perplexité de modélisation du langage, la réponse à des questions et des tâches de raisonnement de sens commun. Sur l'ensemble de données LAMBADA, il a atteint une perplexité de 3,99, démontrant une forte prédiction du mot suivant. Dans des contextes zero-shot, il a performé de manière compétitive avec des modèles de taille similaire, bien qu'il ait été en retrait par rapport aux modèles propriétaires plus grands comme ceux de OpenAI et Google DeepMind.

Le modèle a montré une force particulière dans les tâches de génération de code, attribuée à l'inclusion de code GitHub dans ses données d'entraînement. Sur la référence HumanEval, il a obtenu un score pass@1 de 6,4 %, indiquant une capacité modérée à générer du code fonctionnel. Sa performance dans les références de apprentissage automatique a souligné la valeur des modèles open-source pour permettre une recherche reproductible, car les résultats pouvaient être vérifiés indépendamment par la communauté.

Impact et Héritage

GPT-NeoX a servi de modèle fondateur pour les efforts open-source ultérieurs, influençant le développement de modèles plus récents comme LLaMA et Falcon. Sa publication a démontré que des grands modèles de langage de haute qualité pouvaient être entraînés par des organisations non commerciales, remettant en question la domination des géants de la technologie. Les poids ouverts du modèle ont facilité la recherche en intelligence artificielle sur la sécurité, l'interprétabilité et le fine-tuning, de nombreuses études l'utilisant comme référence.

Le projet a également contribué à l'écosystème plus large des outils d'IA ouverts, y compris le développement du harnais d'évaluation EleutherAI, qui a standardisé les tests de référence pour les modèles ouverts. L'architecture et les recettes d'entraînement de GPT-NeoX ont été documentées en détail, fournissant un plan pour que d'autres puissent les reproduire et les étendre. Son héritage persiste dans la poussée continue pour une recherche en IA transparente et accessible, comme le montrent les publications ultérieures d'EleutherAI et d'autres groupes.

Limitations et Considérations

Malgré ses capacités, GPT-NeoX présente des limitations notables. Ses 20 milliards de paramètres sont plus petits que de nombreux modèles contemporains, entraînant une performance inférieure sur des tâches de raisonnement complexes. Le modèle peut produire des sorties biaisées ou nuisibles, reflétant les biais de ses données d'entraînement. Il lui manque également les techniques de fine-tuning et d'alignement utilisées dans les systèmes commerciaux, ce qui le rend moins adapté à un déploiement direct dans des applications orientées utilisateur sans garde-fous supplémentaires.

Les chercheurs utilisant GPT-NeoX doivent considérer ses exigences computationnelles, qui sont substantielles pour l'inférence et le fine-tuning. L'empreinte mémoire du modèle dépasse celle du matériel grand public typique, nécessitant une infrastructure cloud ou des accélérateurs spécialisés. Ces facteurs ont façonné son utilisation principale comme outil de recherche plutôt que comme système de production, bien qu'il reste une ressource précieuse pour étudier les modèles Transformer (architecture) à grande échelle.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·open-source-ai·transformer-models·eleutherai
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique