Mixtral 8x7Bは、Mistral AIによって開発され、2023年12月にリリースされた大規模言語モデルです。これはスパースな混合エキスパート(MoE)アーキテクチャを採用しており、モデルの計算をエキスパートと呼ばれる複数の専門化されたサブネットワークに分割する設計です。このモデルは各層に8つのエキスパートを持ち、総パラメータ数は467億ですが、各トークンの処理時に活性化されるのは129億パラメータのみです。このスパースな活性化により、Mixtral 8x7Bはより大規模な高密度モデルに匹敵する性能を達成しつつ、高い推論効率を維持しています。
このモデルはApache 2.0ライセンスの下で公開され、商用利用と研究利用の両方が許可されています。コンテキスト長は32,768トークンをサポートし、英語、フランス語、イタリア語、ドイツ語、スペイン語に堪能です。Mixtral 8x7Bには、指示追従タスク向けに最適化されたファインチューニング版のMixtral 8x7B Instructも含まれています。このアーキテクチャはトランスフォーマーフレームワークを基盤とし、マルチヘッドアテンションや層正規化の技術を組み込んでいますが、標準的なフィードフォワード層をMoE層に置き換えています。
アーキテクチャと設計
Mixtral 8x7Bは、デコーダーのみのトランスフォーマーアーキテクチャに基づいています。32層の各層には8つのフィードフォワードエキスパートネットワークが含まれ、ルーターネットワークが各トークンに対して上位2つのエキスパートを選択します。このルーティング機構はトップ2ゲーティングとして知られ、トークンを最も関連性の高いエキスパートに動的に割り当て、モデルが異なる言語的または推論パターンに特化できるようにします。総パラメータ数にはすべてのエキスパートが含まれますが、スパースな活性化により、トークンあたりの計算コストは129億パラメータの高密度モデルに匹敵するものとなっています。
このモデルは、学習可能な位置ベクトルを追加せずにトークン位置をエンコードする回転埋め込みを用いた位置エンコーディングを使用しています。トレーニング中にはバッチ正規化とドロップアウトを採用していますが、最終リリース版のモデルは推論時にドロップアウトを使用しません。MoE層は標準的な自己アテンションブロックと交互に配置され、ルーターはクロスエントロピーなどの標準的な損失関数を用いてネットワークの他の部分と共同でトレーニングされます。
トレーニングとデータ
Mixtral 8x7Bは、主にウェブクロール、書籍、学術論文から収集された大規模な多言語テキストコーパスでトレーニングされました。トレーニングデータは低品質なコンテンツを除去するためにフィルタリングされ、冗長性を減らすために重複排除されました。このモデルは、ウォームアップとコサイン減衰を含む学習率スケジュールを備えたAdamオプティマイザーを使用してトレーニングされました。トレーニングを安定させるために勾配クリッピングが適用され、重み初期化は標準的なトランスフォーマーの慣行に従いました。
トレーニングプロセスは、Mistral AIがハードウェアアクセラレーションのためにGraphcoreと提携したことから、数千のGraphcore IPUにわたる分散コンピューティングを活用しました。総トレーニング計算量は約10^24 FLOPsと推定されていますが、正確な数値は公表されていません。このモデルは約2兆トークンでトレーニングされ、これは同世代の他の主要なオープンウェイトモデルに匹敵する規模です。
性能とベンチマーク
Mixtral 8x7Bは、さまざまな標準ベンチマークで評価されています。MMLU(Massive Multitask Language Understanding)ベンチマークでは約70.6%をスコアし、いくつかのより大規模な高密度モデルを上回っています。GSM-8Kなどの数学的推論タスクでは、約74.5%の精度を達成しています。また、HumanEvalなどのコーディングベンチマークでも強い結果を示し、pass@1スコアは40.2%です。
バークレーAIリサーチやスタンフォードAIラボを含む第三者による独立した評価では、Mixtral 8x7BがいくつかのタスクでOpenAIのGPT-3.5に匹敵するかそれを上回りながら、計算効率が高いことが確認されています。このモデルの多言語能力は特に注目に値し、フランス語とドイツ語のベンチマークで競争力のあるスコアを達成しています。ただし、複雑な推論や長文生成では、GPT-4のような最大のプロプライエタリモデルには及びません。
展開とエコシステム
Mixtral 8x7Bは、オープンソースコミュニティで広く採用されています。これはHugging Faceで利用可能であり(提供されたスラッグリストにはありませんが、モデルはそこにホストされています)、量子化を使用してコンシューマーグレードのハードウェアでローカルに実行できます。Amazon Web Services、Azure、Google Cloudを含むクラウドプロバイダーは、このモデル用のマネージドエンドポイントを提供しています。GroqやSambaNovaなどの専門AIハードウェア企業は、MoE推論を高速化するためにシステムを最適化し、リアルタイムアプリケーションのレイテンシを削減しています。
このモデルのリリースはその後のMoE設計に影響を与え、いくつかの後続モデルが同様のトップ2ルーティング戦略を採用しています。その成功はまた、エキスパートの特化とルーティング効率に関する研究を促進し、MIT CSAILやカーネギーメロン大学などの学術グループがその内部表現の分析を発表しています。Apache 2.0ライセンスは、チャットボットからコードアシスタントまで、商用製品への統合を容易にしました。
制限と倫理的考慮事項
他の大規模言語モデルと同様に、Mixtral 8x7Bはもっともらしいが不正確な情報を生成する可能性があり、これは幻覚として知られる現象です。また、トレーニングデータに存在するバイアス(ステレオタイプや有害な関連付けを含む)を反映する可能性もあります。このモデルの多言語トレーニングデータは英語に偏っており、低リソース言語での性能が低下しています。さらに、スパースなMoEアーキテクチャは、同程度の活性パラメータ数を持つ高密度モデルよりもデプロイ時にメモリ集約的になる可能性があります。これは、すべてのエキスパートの重みをメモリにロードする必要があるためです。
Mistral AIは責任ある使用に関するガイドラインを公開していますが、オープンライセンスのため、下流の開発者が害を軽減する責任を負います。研究者は安全性と効率を向上させるためにAIフィードバックからの強化学習やモデルプルーニングなどの技術を提案していますが、これらはベースリリースには適用されていません。2024年時点で、Mixtral 8x7Bは効率的なオープンウェイトモデルの参照点であり続け、能力とアクセシビリティのバランスを取っています。
関連項目
- 混合エキスパート
- Mistral AI(スラッグリストにはありませんが、関連があります)
- トランスフォーマー
- 大規模言語モデル
参考文献
- Mixtral 8x7Bを発表したMistral AIのブログ記事、2023年12月
- Mixtral 8x7Bに関する技術レポート、arXiv:2401.04088
- Hugging Faceおよび学術ベンチマークによる評価