Mixture of experts(一般にMoEと略される)は、ニューラルネットワークのアーキテクチャの一つであり、モデルが専門化された多数のサブネットワーク(エキスパートと呼ばれる)を含むが、任意の入力に対して活性化されるのはそのうちのごく一部のみである。ルーティング機構(通常はそれ自体が小さな学習済みネットワーク)が、Transformer (architecture)層内のトークンなどの各入力を検査し、どのエキスパートがそれを処理すべきかを決定する。このスパースな活性化パターンにより、モデル内の総パラメータ数を非常に大きくできる一方で、各トークンの処理に必要な計算量ははるかに小さく抑えられる。なぜなら、特定の入力に対してはモデルのパラメータの大部分がアイドル状態にあるためである。
この核となるアイデアは、1990年代初頭の局所エキスパートの適応的混合に関する初期の研究に遡るが、これは深層学習時代よりはるか前のことである。しかし、大規模なTransformer (architecture)ベースのモデルの台頭とともに、この手法は復活し、大幅にスケールアップされた。Googleの研究者らは、2010年代後半に大規模言語モデルに統合されたスパースゲート型mixture-of-experts層を実証し、このアプローチは2020年代初頭にかけてLarge language modelの容量をスケールする方法として広く採用された。Mistral AIのMixtralモデル(2023年12月リリース)は、最大手の研究所以外でのオープンな実証として最も顕著なものの一つであり、MoEアーキテクチャは、主要な研究所による最大級のフロンティアモデルの一部(GPT-4の設計の報告された側面を含む)の基盤となっていると広く信じられていたが、必ずしも公式に確認されてはいなかった。
仕組み
典型的なMoE transformerでは、各transformerブロックにある標準的な高密度フィードフォワード層が、並列のエキスパートサブネットワークのセット(多くの場合8つから数百の数)と、ゲーティングまたはルーターネットワークに置き換えられる。層を通過する各トークンについて、ルーターは各エキスパートのスコアを計算し、そのトークンを実際に処理する上位の少数(通常は1つまたは2つ)のみを選択する。選択されたエキスパートの出力は、多くの場合ルーターの信頼度で重み付けされ、層の出力を生成するために結合される。トークンごとに使用されるエキスパートは一部のみであるため、単一のフォワードパスにおけるアクティブ(または「活性化」)パラメータ数は、モデルの総パラメータ数よりもはるかに小さくなり、総パラメータ数が数千億のモデルでも、Inference (AI)においてははるかに小さな高密度モデルとほぼ同等の計算コストで実行できる。
利点とトレードオフ
MoEの主な利点は、モデルの総容量とトークンあたりの計算コストを切り離すことであり、モデルが多数のエキスパートにわたってより多くの知識と専門的な能力を保存できる一方で、使用コストが比例して増加しないようにすることである。これにより、MoEはトレーニング効率(固定の計算予算の下でより大きな実効容量に到達できるため)と、サービング時のInference (AI)効率の両方にとって魅力的なものとなっている。しかし、トレードオフは現実のものである。MoEモデルは、トークンごとに使用されるのは一部のみであっても、すべてのエキスパートを保持するためにかなり多くの総メモリを必要とし、コスト負担が生の計算ではなくメモリとストレージに移行する。ルーティングはトレーニング中に不安定または不均衡になる可能性があり、特定の負荷分散技術を使用しない限り、一部のエキスパートが他のエキスパートよりもはるかに多くのトラフィックを受け取ることになる。また、MoEモデルは歴史的に、同等の能力を持つ高密度モデルよりも、複数のアクセラレータにわたって効率的にトレーニングおよびサービングするのが複雑である。
採用状況
2024年から2025年にかけて、mixture-of-expertsはオープンウェイトモデルとクローズドフロンティアモデルの両方で一般的なアーキテクチャの選択肢となり、DeepSeek-R1、いくつかのQwenバリアント、Grokなどのシステムに登場し、一般的には、総パラメータ数を非常に大きく(多くの場合数千億)しながら、トークンあたりのアクティブな計算をはるかに控えめでサービス可能な範囲に保つ方法として使用されている。この技術は、QuantizationやKnowledge distillationと並んで、ラボが大規模言語モデルのサービングコストを管理するために使用する主要なレバーの一つとして頻繁に議論されている。