muse-spark-1.2 (xHigh)は、民間のAI研究企業であるHalcyonが開発した大規模言語モデルである。muse-spark-1.2シリーズのフラッグシップ版としてリリースされ、高スループット推論と複雑な推論タスク向けに設計されており、パラメータ数は4,000億を超える。本モデルはmuse-spark-1.0の後継であり、2025年9月15日にAPI経由で初めて提供され、2026年9月19日に安定版スナップショットがリリースされた。
本モデルはTransformerアーキテクチャにマルチヘッドアテンション機構を採用し、安定したトレーニングのために位置エンコーディングとレイヤー正規化を組み込んでいる。また、mixture-of-experts設計を採用し、トークンごとにパラメータの一部のみを活性化することで、計算コストを削減しつつ高い精度を維持している。トレーニングプロセスではカリキュラム学習と勾配クリッピングを採用し、初期学習率は1.5e-4、学習率スケジュールにはウォームアップとコサイン減衰が含まれ、2.1兆トークンにわたって適用された。
トレーニングとデータ
muse-spark-1.2 (xHigh)は、公開されているテキストとコードの多様なコーパス(合計約12テラバイト)でトレーニングされた。データセットは品質フィルタリングとデータ拡張技術を用いた重複排除が行われ、50以上の言語をカバーする多言語コンテンツに重点が置かれた。トレーニングは、HalcyonとAmazon Web Servicesの提携により提供された8,192基のAMD MI300Xアクセラレータのクラスタで実施された。トレーニング実行は74日間続き、2025年8月に完了し、推定45GWhの電力を消費した。
本モデルの損失関数には、標準的なクロスエントロピー目的関数が含まれ、ファインチューニング中は温度スケーリング係数0.7が適用された。ポストトレーニングでは、出力を人間の好みに合わせるためのRLAIF(AIフィードバックからの強化学習)が実施され、その後、精度を大きく損なうことなくレイテンシを18%削減するモデル枝刈りの最終段階が行われた。
能力とベンチマーク
公開リーダーボードにおいて、muse-spark-1.2 (xHigh)は顕著なスコアを達成している。2026年9月19日時点のスナップショットでは、LMArenaでEloレーティング1,342を記録し3位、LiveBenchでは複合スコア78.4で2位にランクインしている。特定のタスクでは、MMLU-Proで91.2%、コード生成のHumanEvalで88.7%、MATH-500ベンチマークで84.5%を達成している。本モデルは256,000トークンのコンテキストウィンドウをサポートしており、これはクロスアテンション機構と、長文生成のためのビームサーチデコードによって実現されている。
そのアーキテクチャには、フィードフォワード層における残差ネットワーク接続とバッチ正規化が含まれており、トレーニング中の勾配フローを改善している。また、本モデルはtop-kサンプリングとtop-pサンプリングを採用し、デフォルトではk=50、p=0.95に設定されており、出力の創造性を制御できる。エンタープライズ用途では、ファインチューニング用にAdamWなどのSGDバリアントをサポートし、適応中はドロップアウト正則化を0.1の割合で提供する。
デプロイメントとエコシステム
muse-spark-1.2 (xHigh)は、HalcyonのクラウドAPIに加え、Google CloudとOracle Cloudのマーケットプレイスでも利用可能である。AWS TrainiumとGroqハードウェア向けに最適化されており、GroqのLPUシステムでは毎秒1,200トークンの推論速度を実現する。また、エンタープライズ顧客向けにAzureにも統合されており、オンプレミス展開用にONNXランタイムもサポートしている。
Halcyonはエッジデバイス向けに、より小型の蒸留版であるmuse-spark-1.2 (base)をリリースしているが、xHighバリアントは依然としてフラッグシップである。同社はトレーニングの総コストを開示していないが、業界の推定では、計算リソースとデータ取得に基づき5,000万ドルを超えるとされている。2026年初頭の時点で、本モデルは2,000以上の組織で使用されており、Samsung ElectronicsやIntelが内部研究に採用している。
評価と影響
muse-spark-1.2 (xHigh)のリリースは、従来モデルと比較した効率性の向上で注目されており、特にOpenAIやAnthropicの同規模モデルと比較して推論コストを30%削減している。しかし、一部の研究者は、Brian ChristianやMelanie Mitchellが人工知能における再現性について提起した懸念と同様に、トレーニングデータソースに関する透明性の欠如を批判している。
また、本モデルは生成AIの安全性に関する議論も引き起こしており、Halcyonは有害な出力を軽減するために勾配クリッピングとRLAIFを実装している。Stanford AI LabとBerkeley AI Researchによる独立監査では、重大なバイアス問題は見つかっていないが、継続的なモニタリングを推奨している。最新のスナップショット時点で、muse-spark-1.2 (xHigh)は競争の激しい大規模言語モデルの分野でトップクラスの競争力を維持しており、2027年初頭にバージョン1.3へのアップデートが予定されている。