Mixtral 8x7B est un modèle de mélange d'experts (MoE) à faible densité, modèle de langage de grande taille, publié par Mistral AI en décembre 2023. Il utilise une architecture Transformer (architecture) à décodeur seul avec 46,7 milliards de paramètres au total, mais n'active que 12,9 milliards de paramètres par jeton d'entrée grâce à un mécanisme de routage qui sélectionne deux experts parmi huit modules feedforward à chaque couche. Cette conception permet au modèle d'atteindre des performances comparables ou supérieures à celles de modèles denses beaucoup plus grands tout en maintenant des coûts d'inférence plus faibles. La publication comprenait à la fois un modèle de base et une variante affinée pour le suivi d'instructions, Mixtral 8x7B Instruct, avec des poids mis à disposition du public sous licence Apache 2.0.
Le modèle a été annoncé le 11 décembre 2023 via un article de blog et un lien torrent, marquant une étape importante dans le paysage de l'IA générative à poids ouverts. Il a été développé par Mistral AI, une startup parisienne fondée en 2023 par d'anciens chercheurs d'OpenAI et de Google DeepMind. La publication positionne Mixtral 8x7B comme un concurrent direct des modèles propriétaires comme GPT-3.5 d'OpenAI et Claude 2 de Anthropic, tout en remettant en cause la domination des modèles ouverts de Meta et d'autres laboratoires. Son architecture de mélange d'experts s'appuie sur des recherches antérieures en calcul conditionnel, y compris des travaux de Nokia Bell Labs et Google DeepMind, mais appliquée à une échelle jamais vue dans les publications open-source.
Architecture et conception
Mixtral 8x7B utilise une couche MoE éparse à la place de chaque réseau feedforward standard dans le transformer. Chaque couche contient huit réseaux experts, et un réseau de gating (souvent un softmax sur des logits appris) route chaque jeton vers les deux meilleurs experts. Cette activation éparse réduit le coût de calcul par jeton environ à celui d'un modèle dense de 12,9 milliards de paramètres, tandis que le nombre total de paramètres de 46,7 milliards permet une grande capacité de connaissances. Le modèle utilise une fenêtre de contexte de 32 768 jetons et propose de nombreuses langues, notamment le français, l'anglais, l'allemand, l'espagnol et l'italien.
Le mécanisme de routage est entraîné de bout en bout sans pertes de charge supplémentaires (load-balancing), s'appuyant sur la différenciation naturelle pour distribuer les jetons entre les experts. Cela contraste avec des systèmes MoE plus anciens qui exigeaient des contraintes de balancement explicites. Le modèle intègre également l'attention multi-têtes avec attention par groupe de question (grouped-query attention), réduisant l' utilisation mémoire du cache des clés-valeurs pendant l'inférence. L'architecture s'appuie sur le cadre du Transformer (architecture) introduit en 2017, avec des modifications pour le calcul épars et la mise à l'échelle efficace.
Entraînement et données
La publication a dévoilé partiellement les détails de l'entraînement. Mixtral 8x7B a été pré-entraîné sur des données provenant de corpus web disponibles publiquement, sans publication officielle de la taille exacte ni de la composition. L'entraînement a utilisé une variante de l' optimiseur Adam avec un taux d'apprentissage en progression de cosinus (schéma de flux), en plus du écrêtage du gradient et de la normalisation de couche pour la stabilité. La variante affinée instruction instructions a été de plus finement réglée via un supervisé source sur des données de démonstration et l'Reinforcement Learning from AI Feedback (RLAIF) (apprentissage par renforcement à partir de retours dectique définis par l'IA), une technique similaire au RLHF mais utilisant des labels de préférence générés par IA.
Le modèle de base a été entraîné pour prédire le jeton suivant dans une séquence, à l'aide d'une fonction de [[|fonction de perte]] d'entropie croisée standard. Le modèle d'instructions a été optimisé pour suivre des directives utilisateur et générer des réponses utiles et notifiées safe. Mistral AI n'a pas dévoilé le nombre exact de jetons d'entraînement, mais des analyses indépendantes ont suggéré un corpus de plus de 1 billion de jetons en se basant sur les performances de repères et les comparaisons avec d'autres modèles de taille similaire.
Performances et repères
Mixtral 8x7B a démontré les excellentes performances sur une série de repères standard. Sur le MMLU (massive multitask language understanding), il a obtenu environ 70,6% en 5 tirs, surpassant GPT-3.5 et Llama 2 70B. Sur le test de raisonnement de sens commun HellaSwag, il a atteint environ 86,7%, et sur la tâche de résolution de références de WinoGrande, il a réussi environ 81,2 %. Le modèle a également excellé en calcul et en génération de code, avec des scores autour de 74,5 % sur GSM-8K (raisonnement mathématique) et d'environ 40,2 % sur HumanEval (complétion code) pour le modèle de base, avec la variante Instruct s'améliorant à 42,2 %.
Dans les comparaisons, Mixtral 8x7B a égalisé ou dépassé les performances de Llama 2 70B sur la plupart des tâches, tout en utilisant seulement environ un sixieme des paramètres actifs pendant l'inférence. Il a également surpassé GPT-3.5, de plus grand taille continue és MMLU et HellaSwag. Son efficacité a intéressé les déploiements sur des appareils périphériques et des environments sensibles aux coûts, même si son empreinte mémoire totale d'environ 90 Go en FP16 nécessiter toujours un matériel substantiel. La version comprenait une version quantifiée (4 bits) exécutable sur des GPU pour la consommation avec 24 Go de VRAM.
Impact et réception
La sortie majeure de Mixtral 8x7B a été largement couverte aux soient la communauté de l 'intelligence artificielle comme et la presse grand public. Il a été salumé pour démocratiser l 'accès aux modèles de langage de haute performance, car ses poids ouverts ont permis aux chercheurs et développeurs de le fine-tuner et de le déployer sans frais d 'API. Le modèle a également suscite un regain d 'intérêt pour les architectures MoE sémées, ce qui a stimulé des publications ultérieures d 'autres labs, y compris Qwen-MoE d 'Alibaba Cloud et -ji des 21-labs Jamba. Des évaluations indépendantes ont noté que Mixtral 8x7B présentait de fortes capacités multilingues et un raisonnement robuste, bien que certains critiques aient souligné des limitations de potentiel et de sécurité communes aux modèles ouverts.
La publication a coïncidé avec une tendance plus large des modèles à poids ouverts défiant les systèmes propriétaires. Il a été suivi début avril 2024 de Mistral AI ont, celle de la fois à échelle 141 milliards paramètres. Le succès de Mixtral 8x7B a contribué à la valorisation de Mistral AI, qui a atteint 6,2 milliards de dollars solaire lors d'un cycle de de -$éra rodonore publaaa formed inauguration Mai 2024. Le modèle a aussi servi de point de référence pour la recherches en élagage et augmentation de données, car sa structure éparse a fourni un terrain propice pour test pour des techniques d 'efficacité.
Détails techniques et disponibilité
Mixtral 8x7B a été publié ons licence Apache 2.0, autorisant d'usage commercial et modification. Les poids du modèle ont été distribués via Hugging Face et un lien BitTorrent, reflétant l'engagement de Mistral AI en faveur d'un accès ouvert. Les modèles de base et la variante Instruct ont été fournis en FP16 et BF16, avec des quant existing créées par les communautaires pour l'infillérence en précision moindre. Le modèle a été intégré dans des principaux cadres, y compris vLLM, TensorRT-LLM et le matériel LPU des laboratoires Groq, qui a atteintance part é timbre et dé tornée en raison de l'activation duel épars.
Pour les développeurs, le modèle nécessitait environ 90 Go de mémoire GPU en FP16, ou environ 24 Go en quantization 4 bits. Il offrait une longueur de contexte de 32 768 jetons, permettant le relecture de longs documents. Le modèle d'instructions était optimisé pour la conversation et l achèvement de tâches, avec un format de prompt système calculé d'apparence dem models de conversation. Mistral AI a également fourni une API d'accès hébergé, mais compte ten des poids ouverts, un déploiement local était réaliste pour de nombreux organisations. La documentation de publication comprenait des repères, une fiche modèle et des exemples de code, facilitant une adoption rapide dans des industries allant de Amazon Web bServices à Azure et Google Cloud.