Traduit de l'anglais

Chinchilla 70B est un grand modèle de langage à 70 milliards de paramètres développé par Google DeepMind, introduit en 2022 dans le cadre de la famille Chinchilla pour démontrer les lois de mise à l'échelle optimales en termes de calcul pour l'entraînement.

Chinchilla 70B est un grand modèle de langage développé par Google DeepMind, introduit en 2022. Il s'agit de la variante à 70 milliards de paramètres de la famille de modèles Chinchilla, conçue pour tester et valider les lois de mise à l'échelle pour l'entraînement de réseaux neuronaux économes en calcul. Le modèle a été un artefact central dans un article de recherche qui plaidait pour un équilibre différent entre la taille du modèle et les données d'entraînement par rapport à ce qui était courant à l'époque, influençant les travaux ultérieurs sur les grands modèles de langage et la recherche en apprentissage automatique.

Le projet Chinchilla a été motivé par l'observation que de nombreux grands modèles de langage contemporains, y compris GPT-3 d'OpenAI, étaient entraînés avec beaucoup moins de jetons que ce qui serait optimal compte tenu de leur nombre de paramètres. Les chercheurs ont proposé que, pour un budget de calcul fixe, la meilleure performance provient d'une mise à l'échelle à peu près égale de la taille du modèle et des données d'entraînement, plutôt que de favoriser l'un au détriment de l'autre. Chinchilla 70B a été entraîné avec environ 1,4 billion de jetons, un ensemble de données substantiellement plus grand par rapport à sa taille que de nombreux prédécesseurs, et il a surpassé des modèles beaucoup plus grands sur une gamme de références.

Architecture et entraînement

Chinchilla 70B utilise une architecture Transformer standard, similaire à celle d'autres grands modèles de langage de son époque. Il emploie l'attention multi-têtes et des encodages positionnels, avec une structure de type décodeur uniquement. Le modèle a été entraîné en utilisant l'optimiseur Adam avec un programme de taux d'apprentissage comprenant un échauffement et une décroissance cosinusoïdale. Un écrêtage des gradients a été appliqué pour stabiliser l'entraînement.

L'ensemble de données d'entraînement comprenait un sous-ensemble filtré et dédupliqué de textes web publics, de livres et d'autres sources, totalisant environ 1,4 billion de jetons. Ce choix était délibéré pour tester l'hypothèse selon laquelle plus de données, plutôt que plus de paramètres, pourrait produire de meilleures performances pour un budget de calcul donné. L'entraînement a utilisé un grand cluster de TPU, tirant parti de l'infrastructure Google Cloud.

Lois de mise à l'échelle et signification

La contribution principale de Chinchilla 70B a été la preuve empirique de lois de mise à l'échelle optimales en termes de calcul. L'équipe de recherche, y compris Jordan Hoffmann et d'autres, a analysé la relation entre la taille du modèle, la taille de l'ensemble de données et le budget de calcul. Ils ont constaté que, pour un budget de calcul donné, la taille optimale du modèle est beaucoup plus petite que ce qui était supposé auparavant, et le nombre optimal de jetons d'entraînement est beaucoup plus grand. Ce résultat, souvent appelé « loi de mise à l'échelle de Chinchilla », suggérait que de nombreux modèles existants étaient sur-paramétrés et sous-entraînés.

Chinchilla 70B, malgré moins de paramètres que des modèles comme GPT-3 (175B) et Gopher (280B), a obtenu des performances supérieures sur de nombreuses références en intelligence artificielle, y compris la modélisation du langage, la compréhension de lecture et les tâches de raisonnement. Cela a démontré que l'efficacité de l'entraînement pouvait être plus importante que le nombre brut de paramètres.

Performances et références

Sur une suite de références standard, Chinchilla 70B a surpassé Gopher (280B paramètres) et GPT-3 (175B paramètres) sur la plupart des tâches. Par exemple, il a obtenu une précision plus élevée sur MMLU (Massive Multitask Language Understanding) et amélioré les résultats sur les ensembles de données de réponse aux questions et de raisonnement de sens commun. Le modèle a également montré de fortes performances sur les tâches de raisonnement mathématique et scientifique, bien qu'il présentât encore des limitations courantes des modèles de langage de l'époque, telles que des erreurs factuelles et une sensibilité à la formulation des invites.

La performance du modèle a été particulièrement notable dans le contexte du développement de la IA générative, car elle a montré que des modèles plus petits et mieux entraînés pouvaient être plus pratiques et rentables. Cela a influencé le développement ultérieur de modèles chez Anthropic, OpenAI et d'autres organisations, qui ont commencé à accorder plus d'attention au volume des données d'entraînement.

Impact et héritage

Les lois de mise à l'échelle de Chinchilla ont eu un impact significatif sur le domaine du apprentissage profond. Elles ont provoqué un changement dans la manière dont les chercheurs et les entreprises allouent les ressources de calcul, en soulignant l'importance de grands ensembles de données de haute qualité. Les résultats ont également informé les décisions concernant l'architecture des modèles et les budgets d'entraînement dans les modèles ultérieurs, tels que LLaMA et d'autres, qui ont adopté des ratios données-paramètres similaires.

Chinchilla 70B lui-même n'a pas été publié en tant que modèle à poids ouverts, mais ses résultats de recherche ont été largement diffusés et ont influencé les efforts open-source ultérieurs. L'architecture et l'approche d'entraînement du modèle sont devenues un point de référence pour la recherche académique et industrielle, et l'analyse des lois de mise à l'échelle reste une référence fondamentale dans le domaine.

Réception et critiques

Bien que les résultats de Chinchilla aient été largement salués, certains chercheurs ont noté que l'analyse des lois de mise à l'échelle reposait sur un ensemble limité de tailles de modèles et de budgets de calcul, et que le ratio optimal pourrait varier avec différentes architectures ou distributions de données. Des travaux ultérieurs ont affiné ces lois, mais l'idée centrale - que le volume des données d'entraînement est aussi important que la taille du modèle - a été largement acceptée.

Certains ont également souligné que l'approche optimale en termes de calcul ne conduit pas nécessairement à la meilleure performance pour un budget d'inférence donné, car des modèles plus grands peuvent être plus efficaces à l'inférence même s'ils sont moins efficaces à entraîner. Cette nuance a conduit à une exploration continue de la mise à l'échelle des modèles dans différentes directions, y compris les architectures de mélange d'experts et d'autres techniques d'efficacité.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·google-deepmind·artificial-intelligence·machine-learning
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique