Traduit de l'anglais

Cerebras-GPT est une famille de grands modèles de langage optimisés en calcul, développée par Cerebras Systems, entraînée selon la loi d'échelle de Chinchilla sur le système à l'échelle de la galette CS-2. Publiée en 2023, elle comprend des modèles allant de 111 millions à 13 milliards de paramètres, conçus pour un entraînement efficace et une disponibilité en open source.

Cerebras-GPT est une famille de grands modèles de langage open-source développée par Cerebras Systems, une entreprise connue pour ses accélérateurs de réseaux de neurones à l'échelle d'une tranche de silicium. Les modèles ont été conçus pour atteindre une performance optimale en termes de calcul, ce qui signifie qu'ils ont été entraînés pour équilibrer la taille du modèle et le volume de données d'entraînement selon la loi de mise à l'échelle de Chinchilla, qui stipule que pour un budget de calcul donné, des modèles plus grands avec proportionnellement plus de données produisent de meilleures performances. Cerebras-GPT a été publié en mars 2023, avec pour objectif de démontrer l'efficacité du système CS-2 de Cerebras pour entraîner des modèles de pointe à grande échelle.

La famille comprend des modèles avec des nombres de paramètres allant de 111 millions à 13 milliards, spécifiquement : 111M, 256M, 590M, 1.3B, 2.7B, 6.7B et 13B. Tous les modèles ont été entraînés sur le même ensemble de données public, le Pile, qui est une collection diversifiée de textes provenant de livres, d'articles académiques et de contenu web. L'entraînement a utilisé un budget de calcul fixe par modèle, suivant le ratio optimal de Chinchilla d'environ 20 jetons par paramètre, garantissant que chaque modèle était entraîné sur la quantité appropriée de données pour maximiser ses performances pour sa taille. Les modèles ont été entraînés en utilisant l'optimiseur Adam avec un programme de taux d'apprentissage cosinus et un écrêtage de gradient pour stabiliser l'entraînement.

Architecture et entraînement

Les modèles Cerebras-GPT utilisent l'architecture Transformer standard, spécifiquement la variante décodeur uniquement, qui est courante pour les modèles de langage génératifs. Chaque modèle emploie une attention multi-têtes, une normalisation de couche et des plongements positionnels appris. Les modèles ont été entraînés sur le système CS-2, qui intègre une seule tranche de silicium avec plus de 850 000 cœurs, permettant un entraînement à haut débit sans nécessiter d'entraînement distribué sur plusieurs GPU. Cette architecture a permis à Cerebras d'entraîner les modèles en une fraction du temps et de l'énergie par rapport aux clusters GPU traditionnels, car la conception à l'échelle de la tranche réduit les frais généraux de communication.

L'entraînement a été effectué en précision bfloat16, et les modèles ont été entraînés à partir de zéro sans points de contrôle préexistants. Le processus d'entraînement a utilisé une taille de lot de 256 séquences, chacune avec une longueur de 2048 jetons, et le nombre total de jetons d'entraînement pour chaque modèle a été déterminé par la formule de Chinchilla. Par exemple, le modèle 13B a été entraîné sur environ 260 milliards de jetons, tandis que le modèle 111M a été entraîné sur environ 2,2 milliards de jetons. Les données d'entraînement ont été mélangées et traitées pour garantir la diversité, et les modèles ont été évalués sur des benchmarks standard tels que la perplexité de modélisation du langage et des tâches en aval.

Performance et benchmarks

Les modèles Cerebras-GPT ont été évalués sur plusieurs benchmarks, notamment LAMBADA, HellaSwag et Winogrande, qui testent la compréhension et le raisonnement linguistiques. Les résultats ont montré que les modèles étaient compétitifs avec d'autres modèles open-source de taille similaire, tels que ceux d'OpenAI et d'Anthropic, malgré un entraînement avec une recette plus simple. Par exemple, le modèle 13B a atteint une précision LAMBADA de 72,3 %, ce qui est comparable à d'autres modèles 13B disponibles à l'époque. Les modèles ont également démontré de bonnes performances sur l'ensemble de validation retenu du Pile, avec une perplexité diminuant à mesure que la taille du modèle augmentait, comme prévu.

Un aspect notable de Cerebras-GPT est son accent sur l'efficacité de calcul. L'entreprise a rapporté que l'entraînement du modèle 13B sur le CS-2 a pris environ 10 jours, tandis qu'un entraînement comparable sur un cluster de 512 GPU NVIDIA A100 prendrait environ 30 jours. Cette efficacité est attribuée à la conception à l'échelle de la tranche, qui élimine le besoin de parallélisme de modèle et réduit la communication inter-puces. Les modèles ont été publiés sous la licence Apache 2.0, permettant une utilisation et une modification sans restriction, ce qui était une décision délibérée pour promouvoir la recherche et le développement dans la communauté open-source.

Comparaison avec d'autres modèles

Au moment de la publication, Cerebras-GPT se distinguait parmi les modèles open-source par son adhésion à la loi de mise à l'échelle de Chinchilla. De nombreux modèles antérieurs, tels que GPT-3, ont été entraînés avec plus de données que ce qui est optimal en calcul, entraînant des inefficacités. Cerebras-GPT a été l'une des premières familles à suivre explicitement l'approche optimale en calcul, ce qui signifiait que chaque modèle était entraîné sur exactement la bonne quantité de données pour son nombre de paramètres. Cette approche a été validée par le fait que les modèles ont atteint des performances comparables ou supérieures à celles de modèles entraînés avec des ratios données-paramètres sous-optimaux.

Comparé à des modèles ultérieurs comme LLaMA (publié plus tard en 2023), Cerebras-GPT était plus petit en taille maximale mais offrait une étude plus systématique de la mise à l'échelle. Les modèles étaient également notables pour leur reproductibilité, car le code d'entraînement et les configurations ont été open-sourcés, permettant aux chercheurs de répliquer les résultats. Cependant, les modèles n'étaient pas affinés par instructions ou pour le chat, donc ils étaient principalement destinés à la recherche sur les lois de mise à l'échelle et l'entraînement efficace plutôt qu'au déploiement dans des applications.

Impact et héritage

Cerebras-GPT a contribué à la tendance plus large de démocratisation des grands modèles de langage en fournissant une famille de modèles pouvant être exécutés sur du matériel modeste. Le plus petit modèle (111M) pouvait être affiné sur un seul GPU, tandis que le plus grand (13B) nécessitait une configuration multi-GPU mais restait accessible à de nombreux laboratoires de recherche. La publication a également mis en évidence le potentiel des architectures matérielles alternatives, telles que l'intégration à l'échelle de la tranche, pour réduire le coût et l'empreinte énergétique de l'entraînement de grands modèles.

Les modèles ont été utilisés dans des recherches ultérieures sur les techniques de apprentissage curriculaire et de augmentation de données, car leur nature open-source permettait une expérimentation facile. Cerebras Systems a continué à développer des modèles plus grands, tels que les variantes Cerebras-GPT 7B et plus tard Cerebras-GPT 13B, mais la famille originale reste un point de référence pour l'entraînement optimal en calcul. L'entreprise a également utilisé l'expérience pour informer le développement de son matériel de prochaine génération, le CS-3, annoncé en 2024.

Disponibilité et utilisation

Les modèles Cerebras-GPT sont disponibles sur Hugging Face et via le Cerebras Model Zoo, qui fournit des points de contrôle pré-entraînés et des scripts d'inférence. Les modèles peuvent être utilisés avec des frameworks d'apprentissage automatique standard comme PyTorch, et le code d'entraînement est disponible sur GitHub. La licence Apache 2.0 permet une utilisation commerciale, rendant les modèles attrayants pour les startups et les entreprises cherchant à déployer des modèles de langage sans frais de licence. Cependant, les utilisateurs doivent être conscients que les modèles n'ont pas été alignés sur les préférences humaines, donc ils peuvent produire des sorties biaisées ou nuisibles, et des garde-fous appropriés sont recommandés pour le déploiement.

En résumé, Cerebras-GPT est une contribution significative au domaine de l'intelligence artificielle, démontrant que l'entraînement optimal en calcul est réalisable avec du matériel spécialisé et fournissant une ressource précieuse pour les chercheurs étudiant les lois de mise à l'échelle et l'efficacité des modèles.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·open-source-ai·scaling-laws·wafer-scale-computing
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique