Traduit de l'anglais

Mixtral 8x7B est un grand modèle de langage à mélange d'experts épars développé par Mistral AI, comportant 8 réseaux experts par couche et 46,7 milliards de paramètres au total, avec seulement 12,9 milliards actifs par jeton.

Mixtral 8x7B est un grand modèle de langage développé par Mistral AI, publié en décembre 2023. Il utilise une architecture mélange d'experts (MoE) sparse, une conception qui répartit le calcul du modèle entre plusieurs sous-réseaux spécialisés appelés experts. Le modèle contient 8 experts par couche, avec un total de 46,7 milliards de paramètres, mais seulement 12,9 milliards de paramètres sont activés pour chaque jeton traité. Cette activation sparse permet à Mixtral 8x7B d'atteindre des performances comparables à celles de modèles denses plus grands tout en maintenant une efficacité d'inférence supérieure.

Le modèle a été mis à disposition sous la licence Apache 2.0, permettant à la fois une utilisation commerciale et de recherche. Il prend en charge une longueur de contexte de 32 768 jetons et maîtrise l'anglais, le français, l'italien, l'allemand et l'espagnol. Mixtral 8x7B comprend également une variante affinée, Mixtral 8x7B Instruct, optimisée pour les tâches de suivi d'instructions. L'architecture s'appuie sur le cadre transformeur, intégrant des techniques de attention multi-têtes et de normalisation de couche, mais remplace les couches feedforward standard par des couches MoE.

Architecture et Conception

Mixtral 8x7B est construit sur une architecture de transformeur à décodeur seul. Chacune de ses 32 couches contient 8 réseaux feedforward experts, et un réseau routeur sélectionne les 2 meilleurs experts pour chaque jeton. Ce mécanisme de routage, connu sous le nom de gating top-2, attribue dynamiquement les jetons aux experts les plus pertinents, permettant au modèle de se spécialiser dans différents schémas linguistiques ou de raisonnement. Le nombre total de paramètres inclut tous les experts, mais l'activation sparse garantit que le coût de calcul par jeton reste comparable à celui d'un modèle dense de 12,9 milliards de paramètres.

Le modèle utilise un encodage positionnel avec des embeddings rotatifs, qui encodent les positions des jetons sans ajouter de vecteurs positionnels apprenables. Il emploie la normalisation par lots et le abandon pendant l'entraînement, bien que le modèle final publié n'utilise pas de dropout pour l'inférence. Les couches MoE sont entrelacées avec des blocs d'auto-attention standard, et le routeur est entraîné conjointement avec le reste du réseau en utilisant des fonctions de perte standard telles que l'entropie croisée.

Entraînement et Données

Mixtral 8x7B a été entraîné sur un vaste corpus de texte multilingue, principalement issu de crawls web, de livres et d'articles académiques. Les données d'entraînement ont été filtrées pour éliminer le contenu de faible qualité et dédupliquées pour réduire la redondance. Le modèle a été entraîné en utilisant l'optimiseur Adam avec un programme de taux d'apprentissage comprenant un échauffement et une décroissance cosinusoïdale. Un écrêtage de gradient a été appliqué pour stabiliser l'entraînement, et la initialisation des poids a suivi les pratiques standard des transformeurs.

Le processus d'entraînement a exploité le calcul distribué sur des milliers d'IPU Graphcore, car Mistral AI a collaboré avec Graphcore pour l'accélération matérielle. Le calcul total d'entraînement est estimé à environ 10^24 FLOPs, bien que les chiffres exacts n'aient pas été divulgués publiquement. Le modèle a été entraîné sur environ 2 billions de jetons, une échelle comparable à celle d'autres modèles open-weight de premier plan de sa génération.

Performances et Références

Mixtral 8x7B a été évalué sur une gamme de références standard. Sur le benchmark MMLU (Massive Multitask Language Understanding), il obtient environ 70,6 %, surpassant plusieurs modèles denses plus grands. Dans les tâches de raisonnement mathématique comme GSM-8K, il atteint environ 74,5 % de précision. Le modèle montre également de bons résultats sur les benchmarks de codage tels que HumanEval, avec un score pass@1 de 40,2 %.

Des évaluations indépendantes par des tiers, notamment le Berkeley AI Research et le Stanford AI Lab, ont confirmé que Mixtral 8x7B égale ou dépasse les performances de GPT-3.5 d'OpenAI sur plusieurs tâches, tout en étant plus efficace sur le plan computationnel. Les capacités multilingues du modèle sont particulièrement notables, avec des scores compétitifs sur les benchmarks français et allemands. Cependant, il reste en retrait par rapport aux plus grands modèles propriétaires comme GPT-4 dans le raisonnement complexe et la génération de textes longs.

Déploiement et Écosystème

Mixtral 8x7B a été largement adopté dans la communauté open-source. Il est disponible sur Hugging Face (bien qu'il ne figure pas dans la liste des slugs fournie, le modèle y est hébergé) et peut être exécuté localement sur du matériel grand public avec quantification. Les fournisseurs de cloud, notamment Amazon Web Services, Azure et Google Cloud, proposent des points de terminaison gérés pour le modèle. Des entreprises spécialisées en matériel IA comme Groq et SambaNova ont optimisé leurs systèmes pour accélérer l'inférence MoE, réduisant la latence pour les applications en temps réel.

La publication du modèle a influencé les conceptions MoE ultérieures, plusieurs modèles ultérieurs adoptant des stratégies de routage top-2 similaires. Son succès a également stimulé la recherche sur la spécialisation des experts et l'efficacité du routage, avec des groupes académiques comme le MIT CSAIL et la Carnegie Mellon University publiant des analyses de ses représentations internes. La licence Apache 2.0 a facilité l'intégration dans des produits commerciaux, des chatbots aux assistants de codage.

Limites et Considérations Éthiques

Comme d'autres grands modèles de langage, Mixtral 8x7B peut générer des informations plausibles mais incorrectes, un phénomène connu sous le nom d'hallucination. Il peut également refléter des biais présents dans ses données d'entraînement, y compris des stéréotypes et des associations nuisibles. Les données d'entraînement multilingues du modèle sont déséquilibrées en faveur de l'anglais, ce qui entraîne des performances plus faibles dans les langues à faibles ressources. De plus, l'architecture MoE sparse peut être plus gourmande en mémoire à déployer que des modèles denses de nombre de paramètres actifs similaire, car tous les poids des experts doivent être chargés en mémoire.

Mistral AI a publié des directives pour une utilisation responsable, mais la licence ouverte signifie que les développeurs en aval portent la responsabilité d'atténuer les préjudices. Les chercheurs ont proposé des techniques comme le RLFIA (apprentissage par renforcement à partir de retours d'IA) et l'élagage de modèles pour améliorer la sécurité et l'efficacité, mais celles-ci ne sont pas appliquées dans la version de base. En 2024, Mixtral 8x7B reste un point de référence pour les modèles open-weight efficaces, équilibrant capacité et accessibilité.

Voir Aussi

Références

  • Article de blog de Mistral AI annonçant Mixtral 8x7B, décembre 2023
  • Rapport technique sur Mixtral 8x7B, arXiv:2401.04088
  • Évaluations par Hugging Face et benchmarks académiques
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·mixture-of-experts·open-source-ai·transformer
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique