Chinchilla est une famille de grands modèles de langage (LLM) développée par l'équipe de recherche de Google DeepMind, présentée en mars 2022. La famille a été conçue pour étudier les lois de mise à l'échelle des modèles de langage, en s'appuyant sur des travaux antérieurs avec la famille de modèles Gopher. Les modèles Chinchilla sont basés sur des transformeurs et ont été entraînés pour obtenir de meilleures performances sous des budgets de calcul fixes, ce qui a conduit à une recommandation largement citée pour entraîner efficacement de grands modèles.
Le nom "Chinchilla" reflète son rôle en tant que développement supplémentaire par rapport à la précédente famille de modèles Gopher. Les deux familles ont été entraînées pour explorer comment la taille du modèle et le volume de données d'entraînement interagissent. Chinchilla a prétendu surpasser GPT-3 tout en utilisant significativement moins de paramètres, simplifiant l'utilisation en aval en nécessitant moins de puissance de calcul pour l'inférence et le fine-tuning.
Lois de mise à l'échelle et entraînement
La découverte centrale de la recherche Chinchilla était que, pour un budget de calcul donné, la taille du modèle et le nombre de jetons d'entraînement devraient évoluer proportionnellement. Spécifiquement, si la taille du modèle est doublée, le nombre de jetons d'entraînement devrait également être doublé. Ce principe a été dérivé de l'analyse de l'entraînement de modèles de langage précédemment utilisés. DeepMind a utilisé cette hypothèse pour entraîner Chinchilla, qui possède 70 milliards de paramètres et a été entraîné sur 1.4 trillion de jetons, quatre fois plus de données que les 300 milliards de jetons de Gopher, à un coût de calcul global similaire. Cette approche optimale en termes de calcul contraste avec les pratiques antérieures qui privilégiaient souvent l'augmentation des paramètres du modèle seul. L'équipe Chinchilla a recommandé que l'utilisation de ensembles de données d'entraînement plus grands et de meilleure qualité peut conduire à de meilleurs résultats sur les tâches en aval, même lorsque la taille du modèle n'est pas augmentée. Ces découvertes ont influencé les méthodologies d'entraînement ultérieures à travers le domaine de la recherche en IA.
Performance et références
Chinchilla a atteint une précision moyenne de 67.5% sur le benchmark Measuring Massive Multitask Language Understanding (MMLU), ce qui est 7% plus élevé que la performance de Gopher. Cette amélioration était notable étant donné que Gopher avait 280 milliards de paramètres, quatre fois plus que Chinchilla. L'efficacité du modèle l'a rendu pratique pour une gamme plus large d'applications, car il nécessitait moins de calcul pour l'inférence et le fine-tuning. En date du 12 janvier 2023, Chinchilla était encore en phase de test, indiquant que ses capacités complètes et ses limitations étaient en cours d'évaluation. Le succès du modèle sur des benchmarks comme MMLU a démontré que l'entraînement optimal en termes de calcul pouvait produire des résultats compétitifs ou supérieurs par rapport à des modèles plus grands entraînés avec moins de données.
Architecture
Les familles Gopher et Chinchilla sont toutes deux des familles de modèles transformeurs. Elles sont essentiellement les mêmes que GPT-2, avec différentes tailles et des modifications mineures. La famille Gopher utilise RMSNorm au lieu de LayerNorm et un encodage positionnel relatif plutôt qu'un encodage positionnel absolu. La famille Chinchilla est identique à la famille Gopher mais est entraînée avec l'optimiseur AdamW au lieu de l'optimiseur Adam.
La famille Gopher contient six modèles de taille croissante, de 44 millions de paramètres à 280 milliards de paramètres, avec le plus grand désigné comme "Gopher" par défaut. Des conventions de nommage similaires s'appliquent à la famille Chinchilla, qui inclut des modèles de diverses tailles, avec la version à 70 milliards de paramètres étant la plus importante. Le tableau 1 de l'article original détaille toute la famille Gopher, tandis que le tableau 4 compare le Chinchilla à 70 milliards de paramètres avec Gopher 280B.
Applications et influence
Chinchilla a été utilisé comme base pour d'autres modèles, y compris le modèle vision-langage Flamingo, qui intègre la compréhension visuelle et textuelle. Les lois de mise à l'échelle établies par Chinchilla sont devenues une référence standard dans le domaine du apprentissage automatique, guidant les décisions concernant la taille du modèle et la taille de l'ensemble de données dans les développements ultérieurs de LLM.
La recherche a contribué à développer un paradigme d'entraînement efficace pour de grands modèles de langage autorégressifs avec des ressources de calcul limitées. En démontrant que le volume de données est aussi important que la taille du modèle, Chinchilla a déplacé l'attention vers la qualité et la curation des ensembles de données. Cela a eu un impact durable sur la façon dont des organisations comme OpenAI et Anthropic abordent l'entraînement des modèles, bien que les détails spécifiques de leurs pratiques internes ne soient pas toujours publics.
Voir aussi
- Gopher
- Lois de mise à l'échelle
- Apprentissage profond