Mixtral 8x7B ist ein spärlich besetztes Mixture-of-Experts-Modell (MoE) Large language model, das von Mistral AI im Dezember 2023 veröffentlicht wurde. Es verwendet eine reine Decoder-Transformer (architecture)-Architektur mit insgesamt 46,7 Milliarden Parametern, aktiviert aber pro Eingabe-Token nur 12,9 Milliarden Parameter über einen Routing-Mechanismus, der in jeder Schicht zwei Experten aus acht Feedforward-Modulen auswählt. Dieses Design ermöglicht es dem Modell, eine Leistung zu erzielen, die mit viel größeren dichten Modellen vergleichbar ist oder diese übertrifft, während die Inferenzkosten niedriger bleiben. Die Veröffentlichung umfasste sowohl ein Basismodell als auch eine feinabgestimmte, instruktionsbefolgende Variante, Mixtral 8x7B Instruct, deren Gewichte unter einer Apache-2.0-Lizenz öffentlich verfügbar gemacht wurden.
Das Modell wurde am 11. Dezember 2023 über einen Blogbeitrag und einen Torrent-Link angekündigt und markierte einen bedeutenden Meilenstein in der Landschaft des generativen KI mit offenen Gewichten. Es wurde von Mistral AI entwickelt, einem in Paris ansässigen Start-up, das 2023 von ehemaligen Forschern von OpenAI und Google DeepMind gegründet wurde. Die Veröffentlichung positionierte Mixtral 8x7B als direkten Konkurrenten zu proprietären Modellen wie OpenAI's GPT-3.5 und Anthropic's Claude 2, während sie auch die Dominanz offener Modelle von Meta und anderen Labors herausforderte. Seine Mixture-of-Experts-Architektur stützte sich auf frühe Forschung zu bedingter Berechnung, einschließlich Arbeiten von Nokia Bell Labs und Google DeepMind, wurde aber in einem Umfang angewendet, der bei Open-Source-Veröffentlichungen zuvor nicht gesehen wurde.
Architektur und Design
Mixtral 8x7B verwendet eine spärlich besetzte MoE-Schicht anstelle jedes Standard-Feedforward-Netzwerks im Transformer. Jede Schicht enthält acht Expertennetzwerke, und ein Gating-Netzwerk (oft eine Softmax-Über gelernten Logits) routet jedes Token zu den Top-Zwei-Experten. Diese spärliche Aktivierung reduziert die Rechenkosten pro Token auf etwa die eines dichten Modells mit 12,9 Milliarden Parametern, während die Gesamtparameterzahl von 46,7 Milliarden eine große Wissenskapazität ermöglicht. Das Modell verwendet einen Kontextfenster von 32.768 Token und unterstützt mehrere Sprachen, einschließlich Englisch, Französisch, Deutsch, Spanisch und Italienisch.
The Routing-Mechanismus wird end-to-end ohne zusätzliche Lastverteilungsverluste trainiert, wobei er auf natürliche Differenzierung angewiesen ist, um Tokens über Experten zu verteilen. Dies steht im Gegensatz zu frühen MoE-Systemen, die explizite Balancierungsbeschränkungen benötigten. Das Modell integriert auch Mehrkopf-Aufmerksamkeit mit, in Gruppen abgefragter Aufmerksamkeit, die den Speicherverbrauch des Key-Value-Cache während der Inferenz reduziert. Die Architektur baut auf dem Transformer-Framework auf, das 2017 eingeführt wurde, mit Modifikationen für spärliche Berechnung und effiziente Skalierung.
Training und Daten
Trainingsdetails wurden teilweise in der Veröffentlichungsankündigung offengelegt}. Mixtral 8x7B wurde auf Daten vortrainiert, die aus öffentlich verfügbaren Web-Corpora stammen, wobei keine spezifischen Spezifikationen zur Größe oder Zusammensetzung offiziell veröffentlicht wurden. Das Training verwendete eine Variante des Adam-Optimier mit einer Kosinus-Lernratenplans und setzte Gradienten-Clipping und Schichtnormalisierung für Stabilität ein. Die instruktionsgesteuerte Variante wurde weiter durch überwachtes Feinabstimmung auf Demonstrationsdaten und Reinforcement Learning from AI Feedback (RLAIF) (Verstärkungslernen aus KI-Feedback) verfeinert, einer Technik, die RLHF ähnelt, aber KI-generierte Präferenzlabels verwendet.
Das Basismodell wurde darauf trainiert, das nächste Token in einer Sequenz vorherzusagen, under Verwendung einer Standard-Kreuzentropie-Verlustfunktion. Das Instruktionsmodell wurde optimiert, um Nutzeranfragen zu befolgen und hilfreiche, sichere Antworten zu erzeugen. Mistral AI konnte die genaue Anzahl der Trainingstokens nicht angeben, aber unabhängige Analysen deuteten darauf hin, dass das Modell auf einem substantiellen Korpus trainiert wurde, was wahrscheinlich mehr als 1 Billion Tokens umfasst, basierend auf Benchmark-Leistungen und Vergleich mit anderen Modellen ähnlicher Größe.
Leistung und Benchmarks
Mixtral 8x7B zeigte eine starke Leistung über eine Reihe von Standard-Benchmarks. Auf dem MMLU-Benchmark (massive multitask language understanding) erreichte es ungefähr 70,6% in einem 5-shot-Einstell-Environment, wobei GPT-3.5 und Llama 2 70B übertroffen. Auf dem HellaSwag-Test, der als Vernunft-Stand dient, erreichte es rund 86,7%, und bei der WinoGrande-Koreferenzauflösung erzielte es etwa 81,2%. Das Modell glänzte auch in Mathematik und Codgenerierung, mit Scores auf GSM-8K (mathematische Argumentation) um 74,5% und auf HumanEval (Code-Analyse) um 40,2% für das Basismodell, wobei die Instruct-variante auf 42,2% verbessert wurde.
In direkten Vergleichen erreichte oder übertraf Mixtral 8x7B die Leistung von Llama 2 70B bei den meisten Aufgaben, während es nur etwa ein Sechstel der aktiven Parameter während der Inferenz verwendete. Es übertraf auch das größere GPT-3.5 bei mehreren Benchmarks, einschließlich MMLU und HellaSwag. Die Effizienz des Modells machte es attraktiv für den Einsatz auf Endgeräte und in kostensensiblen Umgebungen, obwohl sein totaler Speicherbedarf von rund 90 GB in FP16 immer noch substantielle Hardware erforderte. Die Veröffentlichung umfasste eine quantisierte Version (4-Bit), die auf Consumer-GPUs mit 24 GB VRAM laufen konnte.
Auswirkung und Rezeption
The Release von Mixtral 8x7B wurde weithin in der künstlichen Intelligenz-Gemeinschaft und der Mainstream-Presse abgedeckt. Es wurde dafür gelobt, den Zugang zu hochleistungsfähigen Sprachmodellen zu demokratisieren, da seine offenen Gewichte Forschern und Entwicklern ermöglichen, es feinzutunen und zu implementieren, ohne API-Kosten. The Modell löste auch ein erneutes Interesse an spärlichen MoE-Architekturen aus, das nachfolgende Veröffentlichungen anderer Labore beeinflusste, einschließlich Alibaba Cloud's Qwen-MoE und AI21 Labs's Jamba. Unabhängige Bewertungen dieser Vergleichstelle, dass Mixtral 8x7B starke mehrsprachige Fähigkeiten und robuste Argumentation zeigte, obwohl Kritiker mögliche Biases und Sicherheitslimitationen anmerkten, die für offene Modelle ausültig sind.
The Release zeitgleich mit einem breiteren Trend, bei dem offene Modelle proprietäre Systeme herausforderten. Danach gab Mistral AI größere Mixtral 8x22B im April 2024 heraus, die dieselbe Architektur auf 141 Milliarden Gesamtparameter erweiterte. Der Erfolg von Mixtral 8x7B trug zur Unternehmensbewertung von Mistral AI bei, die in einer im Juni 2024 angekündigten Finanzierungsrunde 6,2 Milliarden US-Dollar erreichte. Das Modell diente auch als Referenzpunkt für Modell-Beschneidung und Datenaugmentations Forschung, und deren spärliche Struktur bereitete eine natürliche Testumgebung mit Effizienztechniken.
Technische Details und Verfügbarkeit
Mixtral 8x7B wurde unter der Apache-2.0-Lizenz veröffentlicht, die kommerzielle Nutzung und Modifikation erlaubt. Die Modellgewichte wurden über Hugging Face und einen BitTorrent-Link verteilt, was das Engagement von Mistral AI für offenen Zugang widerspiegelt. Das Basis und die Instruct-Variante wurde als FP16 und BF16 bereitgestellt, sowie mit Community-erstellten Quantifzierungen verfügbar. Das Modell wurde in wichtige Inferenz-Frameworks integriert, darunter vLLM, TensorRT-LLM und Groq bezügen Hardware von LPU, die besonders niedrige Latenz erreichte.
Für Entwickler erforderte das Modell etwa 90 GB GPU-Speicher in FP16 oder etwa 24 GB bei 4-Bit-Quantisierung. Es unterstützte 32,768 Token Kontextlänge und ermöglichten so die Verarbeitung langer Dokumente. Das Instruktionsmodell war für Chat und Task-Komplettierung optimiert, mit einem System- Prompt-Format ähnlich zu anderen Chatbot-Modellen. Mistral AI stellte auch eine API für gehosteten Zugang bereit, aber die offenen Gewichte machten einen lokalen Dienst möglich für viele Organisationen möglich. Die Releasedokumentation enthielt Benchmarks, ein Modellkardi und Beispielcode, was eine schnelle Einführung in vielen Bereichen erleichterte, von Amazon Web Services bis Microsoft Azure und Google Cloud.