Traduit de l'anglais

Gopher est une famille de modèles de langage de grande taille basés sur l'architecture transformer, développée par Google DeepMind, dont la variante la plus grande contient 280 milliards de paramètres. Elle a été conçue pour étudier les lois de mise à l'échelle des modèles de langage et a servi de prédécesseur à la famille de modèles Chinchilla.

Gopher est une famille de grands modèles de langage développée par l'équipe de recherche de Google DeepMind. La famille se compose de six modèles basés sur l'architecture Transformer, de tailles croissantes, allant de 44 millions à 280 milliards de paramètres, le plus grand modèle étant désigné par « Gopher » par défaut. Gopher a été présenté fin 2021 et entraîné pour étudier les lois de mise à l'échelle des grands modèles de langage, constituant la base de la famille de modèles Chinchilla introduite en mars 2022.

La famille Gopher a été conçue dans le cadre d'un effort de recherche plus large visant à comprendre comment les performances des modèles évoluent avec les paramètres et les données d'entraînement. Les modèles utilisent essentiellement la même architecture que GPT-2, avec des modifications mineures, notamment l'utilisation de RMSNorm au lieu de LayerNorm et d'un encodage positionnel relatif plutôt qu'absolu. Le plus grand modèle Gopher, avec 280 milliards de paramètres, a été entraîné sur environ 300 milliards de jetons.

Lois de mise à l'échelle et entraînement

Le développement de Gopher a été motivé par la question de savoir comment allouer de manière optimale les ressources de calcul lors de l'entraînement de grands modèles de langage. Avant Gopher, de nombreux modèles, y compris GPT-3 d'OpenAI, étaient entraînés en mettant l'accent sur l'augmentation de la taille du modèle tout en maintenant les données d'entraînement relativement fixes. L'équipe de recherche de Gopher a cependant découvert, grâce à des études empiriques, que pour un budget de calcul donné, la taille optimale du modèle et le nombre de jetons d'entraînement suivent une relation spécifique : si la taille du modèle est doublée, le nombre de jetons d'entraînement doit également être doublé. Cette découverte, formalisée plus tard dans l'article sur Chinchilla, a suggéré que de nombreux modèles existants étaient sous-entraînés.

L'entraînement de Gopher a utilisé un vaste corpus de données textuelles, et le modèle a démontré de solides performances sur une gamme de références en traitement du langage naturel. Cependant, ses performances sur la référence Measuring Massive Multitask Language Understanding (MMLU) étaient de 60,5 % de précision moyenne, un chiffre qui serait plus tard dépassé par son successeur Chinchilla.

Architecture et variantes

La famille Gopher comprend six modèles avec des nombres de paramètres de 44 millions, 117 millions, 417 millions, 1,4 milliard, 7,1 milliards et 280 milliards. Tous les modèles partagent la même architecture de base basée sur le transformer, spécifiquement similaire à GPT-2 mais avec les modifications notées. L'utilisation de RMSNorm, une variante de la normalisation de couche plus efficace sur le plan computationnel, et de l'encodage positionnel relatif, qui peut améliorer la généralisation à des séquences plus longues, étaient des différences clés par rapport aux modèles Transformer antérieurs.

Le plus grand modèle Gopher a été entraîné à l'aide d'une configuration d'entraînement distribuée, exploitant des milliers d'accélérateurs. Le processus d'entraînement était gourmand en ressources, et le modèle nécessitait une puissance de calcul importante pour l'inférence et le fine-tuning, une limitation qui a motivé le développement ultérieur de Chinchilla.

Performances et évaluation

Gopher a été évalué sur une variété de références, notamment la modélisation du langage, la compréhension de lecture et la réponse aux questions. Il a montré de fortes capacités dans de nombreux domaines, mais ses performances n'étaient pas uniformément supérieures à celles de modèles plus petits sur toutes les tâches. Par exemple, sur certaines tâches de raisonnement et de connaissances, Gopher performait bien, mais il présentait également des limitations dans des domaines tels que la cohérence factuelle et le raisonnement de sens commun.

Comparé à GPT-3, Gopher a obtenu des résultats compétitifs ou meilleurs sur plusieurs références, mais les différences n'étaient pas toujours spectaculaires. L'équipe de recherche a noté que les gains de performance de Gopher étaient souvent modestes par rapport à l'augmentation importante de la taille du modèle, ce qui a souligné davantage l'importance de la mise à l'échelle des données d'entraînement.

Héritage et successeur

L'héritage principal de Gopher réside dans sa contribution à la compréhension des lois de mise à l'échelle dans les modèles de langage. Les connaissances acquises lors de l'entraînement de Gopher ont directement informé la conception de Chinchilla, une famille de modèles avec 70 milliards de paramètres entraînés sur 1,4 billion de jetons. Chinchilla, présenté en mars 2022, a atteint une précision moyenne plus élevée (67,5 % sur MMLU) que Gopher tout en utilisant un budget de calcul similaire, démontrant l'efficacité des recommandations issues des lois de mise à l'échelle.

La famille Chinchilla partage la même architecture que Gopher mais a été entraînée avec l'optimiseur AdamW au lieu d'Adam. Gopher a également servi de base à d'autres modèles, comme le modèle vision-langage Flamingo, qui a utilisé des composants de la famille Gopher. En janvier 2023, Chinchilla était encore en phase de test, tandis que Gopher avait été supplanté par son successeur plus efficace.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·google-deepmind·transformer-models·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique