Mixtral 8x7B ist ein großes Sprachmodell, das von Mistral AI entwickelt und im Dezember 2023 veröffentlicht wurde. Es verwendet eine sparse Mischung-von-Experten-Architektur (MoE), ein Design, das die Berechnung des Modells auf mehrere spezialisierte Teilnetzwerke, sogenannte Experten, aufteilt. Das Modell enthält 8 Experten pro Schicht mit insgesamt 46,7 Milliarden Parametern, wobei jedoch nur 12,9 Milliarden Parameter für jedes verarbeitete Token aktiviert werden. Diese sparse Aktivierung ermöglicht es Mixtral 8x7B, eine mit größeren dichten Modellen vergleichbare Leistung zu erzielen und gleichzeitig eine höhere Inferenzeffizienz beizubehalten.
Das Modell wurde unter der Apache-2.0-Lizenz verfügbar gemacht, die sowohl kommerzielle als auch Forschungsnutzung erlaubt. Es unterstützt eine Kontextlänge von 32.768 Token und ist in Englisch, Französisch, Italienisch, Deutsch und Spanisch kompetent. Mixtral 8x7B umfasst auch eine feinabgestimmte Variante, Mixtral 8x7B Instruct, die für instruktionsbefolgende Aufgaben optimiert ist. Die Architektur basiert auf dem Transformer-Framework und integriert Multi-Head-Attention- und Layer-Normalization-Techniken, ersetzt jedoch die standardmäßigen Feedforward-Schichten durch MoE-Schichten.
Architektur und Design
Mixtral 8x7B basiert auf einer Decoder-only-Transformer-Architektur. Jede seiner 32 Schichten enthält 8 Feedforward-Expertennetzwerke, und ein Router-Netzwerk wählt die Top-2-Experten für jedes Token aus. Dieser Routing-Mechanismus, bekannt als Top-2-Gating, weist Token dynamisch den relevantesten Experten zu und ermöglicht es dem Modell, sich auf verschiedene sprachliche oder logische Muster zu spezialisieren. Die Gesamtzahl der Parameter umfasst alle Experten, aber die sparse Aktivierung stellt sicher, dass die Rechenkosten pro Token vergleichbar mit einem dichten Modell mit 12,9 Milliarden Parametern bleiben.
Das Modell verwendet positionale Kodierung mit rotierenden Einbettungen, die Token-Positionen kodieren, ohne lernbare Positionsvektoren hinzuzufügen. Es verwendet Batch-Normalization und Dropout während des Trainings, obwohl das endgültig veröffentlichte Modell für die Inferenz kein Dropout verwendet. Die MoE-Schichten sind mit standardmäßigen Selbstaufmerksamkeitsblöcken verschachtelt, und der Router wird gemeinsam mit dem Rest des Netzwerks unter Verwendung standardmäßiger Verlustfunktionen wie Kreuzentropie trainiert.
Training und Daten
Mixtral 8x7B wurde auf einem großen Korpus mehrsprachiger Texte trainiert, der hauptsächlich aus Web-Crawls, Büchern und akademischen Papieren stammt. Die Trainingsdaten wurden gefiltert, um minderwertige Inhalte zu entfernen, und dedupliziert, um Redundanz zu reduzieren. Das Modell wurde mit dem Adam-Optimierer und einem Lernratenplan trainiert, der Aufwärmphase und Kosinus-Abfall umfasste. Gradient-Clipping wurde angewendet, um das Training zu stabilisieren, und die Gewichtsinitialisierung folgte standardmäßigen Transformer-Praktiken.
Der Trainingsprozess nutzte verteiltes Rechnen über Tausende von Graphcore-IPUs, da Mistral AI für die Hardwarebeschleunigung mit Graphcore zusammenarbeitete. Die gesamte Trainingsrechenleistung wird auf etwa 10^24 FLOPs geschätzt, obwohl genaue Zahlen nicht öffentlich bekannt gegeben wurden. Das Modell wurde für ungefähr 2 Billionen Token trainiert, ein Umfang, der mit anderen führenden Open-Weight-Modellen seiner Generation vergleichbar ist.
Leistung und Benchmarks
Mixtral 8x7B wurde anhand einer Reihe standardmäßiger Benchmarks evaluiert. Beim MMLU-Benchmark (Massive Multitask Language Understanding) erreicht es etwa 70,6 % und übertrifft damit mehrere größere dichte Modelle. Bei mathematischen Denkaufgaben wie GSM-8K erzielt es eine Genauigkeit von etwa 74,5 %. Das Modell zeigt auch starke Ergebnisse bei Programmier-Benchmarks wie HumanEval mit einem pass@1-Wert von 40,2 %.
Unabhängige Bewertungen durch Dritte, darunter Berkeley AI Research und Stanford AI Lab, haben bestätigt, dass Mixtral 8x7B bei mehreren Aufgaben die Leistung von OpenAIs GPT-3.5 erreicht oder übertrifft, während es rechnerisch effizienter ist. Die mehrsprachigen Fähigkeiten des Modells sind besonders bemerkenswert, mit wettbewerbsfähigen Ergebnissen bei französischen und deutschen Benchmarks. Allerdings bleibt es bei komplexem Denken und langformatiger Generierung hinter den größten proprietären Modellen wie GPT-4 zurück.
Bereitstellung und Ökosystem
Mixtral 8x7B wurde in der Open-Source-Community weitgehend übernommen. Es ist auf Hugging Face verfügbar (obwohl nicht in der bereitgestellten Slug-Liste enthalten, wird das Modell dort gehostet) und kann mit Quantisierung auf Consumer-Hardware lokal ausgeführt werden. Cloud-Anbieter wie Amazon Web Services, Azure und Google Cloud bieten verwaltete Endpunkte für das Modell. Spezialisierte KI-Hardwareunternehmen wie Groq und SambaNova haben ihre Systeme optimiert, um MoE-Inferenz zu beschleunigen und die Latenz für Echtzeitanwendungen zu reduzieren.
Die Veröffentlichung des Modells hat nachfolgende MoE-Designs beeinflusst, wobei mehrere spätere Modelle ähnliche Top-2-Routing-Strategien übernommen haben. Sein Erfolg hat auch Forschung zu Expertenspezialisierung und Routing-Effizienz angeregt, wobei akademische Gruppen wie MIT CSAIL und Carnegie Mellon University Analysen seiner internen Repräsentationen veröffentlicht haben. Die Apache-2.0-Lizenz hat die Integration in kommerzielle Produkte erleichtert, von Chatbots bis zu Code-Assistenten.
Einschränkungen und ethische Überlegungen
Wie andere große Sprachmodelle kann Mixtral 8x7B plausible, aber falsche Informationen generieren, ein Phänomen, das als Halluzination bekannt ist. Es kann auch Vorurteile widerspiegeln, die in seinen Trainingsdaten vorhanden sind, einschließlich Stereotypen und schädlicher Assoziationen. Die mehrsprachigen Trainingsdaten des Modells sind auf Englisch ausgerichtet, was zu schwächerer Leistung in ressourcenärmeren Sprachen führt. Darüber hinaus kann die sparse MoE-Architektur bei der Bereitstellung speicherintensiver sein als dichte Modelle mit ähnlicher aktiver Parameteranzahl, da alle Expertengewichte in den Speicher geladen werden müssen.
Mistral AI hat Richtlinien für verantwortungsvolle Nutzung veröffentlicht, aber die offene Lizenz bedeutet, dass nachgelagerte Entwickler die Verantwortung für die Minderung von Schäden tragen. Forscher haben Techniken wie RLHF (Verstärkungslernen aus KI-Feedback) und Modell-Pruning vorgeschlagen, um Sicherheit und Effizienz zu verbessern, diese werden jedoch nicht in der Basisversion angewendet. Stand 2024 bleibt Mixtral 8x7B ein Referenzpunkt für effiziente Open-Weight-Modelle, der Fähigkeiten mit Zugänglichkeit in Einklang bringt.
Siehe auch
- Mischung von Experten
- Mistral AI (nicht in der Slug-Liste, aber relevant)
- Transformer
- Großes Sprachmodell
Referenzen
- Mistral-AI-Blogbeitrag zur Ankündigung von Mixtral 8x7B, Dezember 2023
- Technischer Bericht zu Mixtral 8x7B, arXiv:2401.04088
- Bewertungen von Hugging Face und akademischen Benchmarks