Mixtralは、フランスの人工知能企業であるMistral AIによって開発された大規模言語モデルのファミリーである。これらのモデルは、疎な混合エキスパート(MoE)アーキテクチャに基づいており、各入力に対してモデルのパラメータの一部のみを活性化することで、同規模の高密度モデルと比較して低い計算コストで高い性能を実現している。最初のMixtralモデルであるMixtral 8x7Bは2023年12月にリリースされ、続いてMixtral 8x22Bが2024年4月にリリースされた。
Mixtralファミリーは、OpenAIやAnthropicなどの組織によるプロプライエタリなモデルと競合するように設計されており、オープンウェイトであり、研究と商用利用の両方で利用可能である。これらのモデルは、現代の深層学習における基礎的な設計であるTransformerアーキテクチャに基づいて構築され、大規模なテキストデータで訓練されている。Mixtralモデルは複数の言語をサポートし、テキスト生成、コード補完、指示追従などのタスクが可能である。
アーキテクチャと設計
Mixtralモデルは混合エキスパート層を採用しており、各フィードフォワードネットワークは複数のエキスパートサブネットワークで構成されている。ゲーティング機構は各トークンに対して上位k個のエキスパート(通常は2つ)を選択し、推論中にモデルが総パラメータの一部のみを使用できるようにする。例えば、Mixtral 8x7Bは総パラメータ数が470億であるが、トークンあたり約130億のみを活性化し、一部のシナリオでは高密度の7Bモデルよりも効率的である。
疎なMoE設計は、条件付き計算に関する初期の研究に着想を得ており、最近の大規模モデルで普及している。このアプローチにより、Mixtralは計算コストの比例的な増加なしに高い容量を達成できる。モデルは、他の生成AIシステムと同様に、標準的な次トークン予測目的で訓練されている。
リリースとバージョン
Mistral AIは2023年12月11日にMixtral 8x7BをApache 2.0ライセンスのもとでリリースし、商用利用を自由に可能にした。このモデルには、チャットおよび指示追従タスク向けに最適化されたファインチューニング版であるMixtral 8x7B Instructが付随していた。2024年4月、同社は総パラメータ数1410億、活性化パラメータ数390億のより大規模なバージョンであるMixtral 8x22Bを、これもApache 2.0のもとでリリースした。
両モデルはMistral AIのAPIおよびオープンウェイトのダウンロードとして利用可能になった。これらは、Amazon Web Services(AWS)、Microsoft Azure、Google Cloudなどのさまざまなプラットフォームに統合され、高速推論のためのGroqやSambaNovaを通じても提供された。モデルは、量子化技術により限られたメモリのシステムでの動作が可能となり、コンシューマ向けハードウェアでのローカル展開でもアクセス可能である。
性能とベンチマーク
Mixtral 8x7Bは、LLaMA 2 70BやGPT-3.5などの確立されたモデルとベンチマークで比較され、自然言語理解、数学、コード生成などのタスクで競争力のある性能を示した。多くのベンチマークで、より大規模な高密度モデルと同等かそれ以上の性能を、より少ない活性化パラメータで達成した。Mixtral 8x22Bはこれらの結果をさらに改善し、推論や多言語タスクなどの分野でフロンティアモデルの能力に近づいた。
モデルは、MMLU(Massive Multitask Language Understanding)、HellaSwag、HumanEvalなどの標準データセットで評価された。スタンフォードAIラボや他の研究グループによる独立したテストにより、ゼロショットおよび少数ショット設定でのモデルの強力な性能が確認された。しかし、すべての大規模言語モデルと同様に、Mixtralはバイアスや不正確さを示す可能性があり、その出力は注意して使用すべきである。
影響と評価
Mixtralのリリースは、オープンウェイトモデルがプロプライエタリなシステムと性能で競合できることを実証した点で注目に値し、オープンソースの人工知能へのより広範な動きに貢献した。混合エキスパートアーキテクチャはその後、他のモデルリリースに影響を与え、Mixtralは機械学習における効率的なスケーリングの主要な例としてしばしば引用される。
2023年にGoogle DeepMindとMeta AIの元研究者によって設立されたMistral AIは、Mixtralを中核製品として位置づけている。同社は、Azureでのモデル配布に関するマイクロソフトとの提携を含む、重要な資金調達とパートナーシップを受けた。Mixtralのオープンライセンスは、研究、スタートアップ、エンタープライズアプリケーションでの広範な採用を可能にし、生成AIや自然言語処理などの分野での革新を促進した。
制限と今後の方向性
その利点にもかかわらず、Mixtralモデルは、フル精度展開のための高いメモリ要件や、エキスパートの専門化に関する潜在的な問題などの課題に直面している。疎なアーキテクチャはエキスパートの不均等な利用につながる可能性があり、モデルは最適な性能のために慎重なチューニングが必要となる場合がある。2024年現在、Mistral AIは新しいアーキテクチャと訓練方法の開発を続けており、将来のリリースはMoEアプローチに基づく可能性が高い。
Mixtralの成功は、AMDやIntelなどの企業が疎なモデルの効率的な推論に取り組むなど、ハードウェア最適化への関心も引き起こした。このモデルファミリーは依然として活発な研究分野であり、その大規模言語モデルの状況への影響は今後も続くと予想される。