Mixtral 8x7Bのリリース

英語からの翻訳

Mixtral 8x7Bは、2023年12月にMistral AIが公開したスパース混合専門家(sparse mixture-of-experts)大規模言語モデルであり、総パラメータ数467億、トークンあたりのアクティブパラメータ数129億を特徴とし、多くのベンチマークでより大規模なモデルを上回る性能を示す。

Mixtral 8x7Bは、2023年12月にMistral AIによって公開されたスパース混合エキスパート(MoE)大規模言語モデルである。デコーダーのみのトランスフォーマーアーキテクチャを採用し、総パラメータ数は467億であるが、各入力トークンに対しては、各層の8つのフィードフォワードモジュールから2つのエキスパートを選択するルーティング機構を通じて、129億パラメータのみを活性化する。この設計により、モデルははるかに大規模な高密度モデルに匹敵する、またはそれを上回る性能を達成しつつ、より低い推論コストを維持することができる。公開にはベースモデルと、命令追従用に微調整されたバリアントであるMixtral 8x7B Instructの両方が含まれ、重みはApache 2.0ライセンスの下で公開された。

このモデルは、2023年12月11日にブログ投稿とトレントリンクを通じて発表され、オープンウェイトの生成AI分野における重要な節目となった。これは、2023年にOpenAIGoogle DeepMindの元研究者によって設立されたパリを拠点とするスタートアップ、Mistral AIによって開発された。この公開により、Mixtral 8x7Bは、OpenAIのGPT-3.5やAnthropicのClaude 2などのプロプライエタリモデルに対する直接の競合として位置づけられた。また、Metaや他のラボのオープンモデルの優位性にも挑戦した。その混合エキスパートアーキテクチャは、条件付き計算に関する初期の研究(Nokia Bell LabsGoogle DeepMindの研究を含む)に基づいているが、オープンソースリリースではこれまでにない規模で適用された。

アーキテクチャと設計

Mixtral 8x7Bは、トランスフォーマー内の各標準フィードフォワードネットワークの代わりにスパースMoE層を使用する。各層には8つのエキスパートネットワークが含まれ、ゲーティングネットワーク(学習されたロジット上のソフトマックスであることが多い)が各トークンを上位2つのエキスパートにルーティングする。このスパース活性化により、トークンあたりの計算コストは約129億パラメータの高密度モデルと同等に削減され、総パラメータ数467億は大きな知識容量を可能にする。モデルは32,768トークンのコンテキストウィンドウを使用し、英語、フランス語、ドイツ語、スペイン語、イタリア語を含む複数の言語をサポートする。

ルーティング機構は、補助的な負荷分散損失なしにエンドツーエンドで訓練され、トークンをエキスパート間で分配する際に自然な分化に依存している。これは、明示的なバランス制約を必要とした初期のMoEシステムとは対照的である。モデルはまた、グループ化クエリアテンションを備えたマルチヘッドアテンションを組み込んでおり、推論中のキー値キャッシュメモリ使用量を削減している。アーキテクチャは、2017年に導入されたトランスフォーマーフレームワークに基づいており、スパース計算と効率的なスケーリングのための変更が加えられている。

トレーニングとデータ

トレーニングの詳細は公開発表で部分的に開示された。Mixtral 8x7Bは、公開されているウェブコーパスから取得したデータで事前学習されており、公式には具体的な規模は公表されていない。トレーニングでは、Adamオプティマイザの変種とコサイン学習率スケジュールを使用し、勾配クリッピングレイヤー正規化を安定性のために採用した。命令チューニングされたバリアントは、デモンストレーションデータを使用した教師あり微調整と、RLAIF(AIフィードバックからの強化学習)と呼ばれる、RLHFに似ているがAI生成の嗜好ラベルを使用する技術を用いてさらに改良された。

ベースモデルは、標準的なクロスエントロピー損失関数を使用して、シーケンス内の次のトークンを予測するようにトレーニングされた。命令モデルは、ユーザーのプロンプトに従い、役立つ安全な応答を生成するように最適化された。Mistral AIは正確なトレーニングトークン数を開示しなかったが、独立した分析によれば、このモデルは1兆トークンを超える可能性のある相当なコーパスでトレーニングされたと示唆されており、これはベンチマーク性能と同規模の他のモデルとの比較に基づいている。

性能とベンチマーク

Mixtral 8x7Bは、さまざまな標準ベンチマークで強い性能を示した。MMLU(大規模マルチタスク言語理解)ベンチマークでは、5ショット設定で約70.6%を記録し、GPT-3.5とLlama 2 70Bを上回った。HellaSwag常識推論テストでは約86.7%、WinoGrande共参照解決タスクでは約81.2%を達成した。このモデルは数学とコード生成にも優れており、GSM-8K(数学的推論)で約74.5%、HumanEval(コード補完)でベースモデルが約40.2%、Instructバリアントが42.2%に向上した。

直接比較では、Mixtral 8x7Bは、推論中にアクティブなパラメータの約6分の1しか使用しないにもかかわらず、ほとんどのタスクでLlama 2 70Bの性能に匹敵するか、それを上回った。また、MMLUやHellaSwagを含むいくつかのベンチマークで、より大規模なGPT-3.5を上回った。このモデルの効率性は、エッジデバイスやコスト重視の環境での導入を魅力的なものにしたが、FP16で約90 GBの総メモリフットプリントは、依然としてかなりのハードウェアを必要とした。リリースには、24 GBのVRAMを備えたコンシューマーGPUで実行できる量子化バージョン(4ビット)が含まれていた。

性能とベンチマーク

Mixtral 8x7Bは、さまざまな標準ベンチマークで高い性能を発揮した。MMLUベンチマークでは、5ショット設定で約70.6%を達成し、GPT-3.5やLlama 2 70Bを上回った。HellaSwag常識推論テストでは約86.7%、WinoGrande共参照解決タスクでは約81.2%を達成した。このモデルは数学とコード生成でも優れており、GSM-8K(数学的推論)で約74.5%、HumanEval(コード補完)でベースモデルが約40.2%、Instructバリアントが42.2%に改善した。

直接比較では、Mixtral 8x7Bは、推論中に使用するアクティブパラメータが約6分の1であるにもかかわらず、ほとんどのタスクでLlama 2 70Bの性能に匹敵するか、それを上回った。また、MMLUやHellaSwagを含むいくつかのベンチマークで、より大規模なGPT-3.5をも上回った。このモデルの効率性は、エッジデバイスやコスト重視の環境への展開を魅力的にしたが、FP16での総メモリフットプリントが約90 GBであるため、依然としてかなりのハードウェアが必要であった。リリースには、24 GBのVRAMを備えたコンシューマーGPUで動作可能な量子化バージョン(4ビット)が含まれていた。

影響と評価

Mixtral 8x7Bの公開は、人工知能コミュニティと主要メディアで広く取り上げられた。オープンな重みにより、APIコストなしで微調整やデプロイが可能となり、高性能言語モデルへのアクセスを民主化したと賞賛された。このモデルはまた、スパースMoEアーキテクチャへの関心を再燃させ、Alibaba CloudのQwen-MoEやAI21 Labsのその後のリリースに影響を与えた。独立した評価では、Mixtral 8x7Bが強力な多言語能力と堅牢な推論力を示したが、オープンモデルに共通する安全性の制限も指摘された。

この公開は、オープンウェイトモデルがプロプライエタリシステムに挑戦するという、より広範なトレンドの節目となった。Mixtral 8x7Bは、2024年4月にMistral AIが発表した、同じアーキテクチャをより大規模にスケールしたMixtral 8x22Bの先駆けとなった。Mixtral 8x7Bの成功は、Mistral AIが2024年6月に発表した資金調達ラウンドで62億ドルの評価額を達成し、その後の注目を集めることに貢献した。このモデルは、効率的な推論とオープンアクセスの重要性を強調し、AIコミュニティでの議論に影響を与え、スパース活性化と条件付き計算に関するさらなる研究を促進した。

技術的詳細と使用法

Mixtral 8x7Bは、Apache 2.0ライセンスの下で公開されており、商用利用と修正が許可されている。ベースモデルとInstructバリアントは、Hugging FaceとBitTorrentリンクを通じて配布され、オープンアクセスへのコミットメントを示した。このモデルは、vLLM、TensorRT-LLM、GroqのLPU(Language Processing Unit)など、さまざまな推論フレームワークでサポートされており、Groqのハードウェアはスパース活性化により特に低レイテンシを達成した。

開発者にとって、モデルはFP16で約90 GBのGPUメモリ、または4ビット量子化で約24 GBを必要とした。32,768トークンのコンテキストウィンドウにより、長文ドキュメントの処理が可能となった。インストラクションモデルはチャット用に最適化され、他のチャットモデルと同様のシステムプロンプト形式を採用した。Mistral AIはホスト型APIも提供したが、オープンウェイトにより、多くの組織がローカルデプロイを選択できた。リリースにはベンチマーク、モデルカード、サンプルコードが含まれており、Amazon Web Services、Microsoft Azure、Google Cloud Platformなど、さまざまな業界での迅速な採用を促進した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·mixture-of-experts·open-source-ai·machine-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴