Muse-Spark 1.1は、生成AIシステムを専門とする企業であるHalcyonによって開発された大規模言語モデルです。2026年9月にリリースされ、元のMuse-Sparkモデルの後継であり、テキスト生成、要約、会話型AIなど、さまざまな自然言語処理タスク向けに設計されています。このモデルは、LMArenaやLiveBenchなどの公開ベンチマークリーダーボードで評価されており、同サイズクラスのモデルの中で常にトップクラスの性能を誇っています。
このモデルのアーキテクチャはTransformer (architecture)フレームワークに基づいており、他の現代的な大規模言語モデルと同様のデコーダーのみの設計を採用しています。テキスト内の長距離依存関係を処理するために、マルチヘッドアテンションや位置エンコーディングなどの高度な技術を組み込んでいます。トレーニングプロセスでは、教師あり微調整と人間のフィードバックからの強化学習(RLHF)を組み合わせて使用し、モデルの出力を人間の好みに合わせるのに役立てました。
開発とリリース
Muse-Spark 1.1は、Halcyonの主任AI研究者であるエレナ・バスケス博士が率いるチームによって開発され、サンフランシスコとバンガロールのオフィスにわたるエンジニアや研究者からの貢献がありました。プロジェクトは2025年初頭に始まり、初期バージョン(Muse-Spark 1.0)は2026年3月にリリースされました。2026年9月18日にリリースされた1.1アップデートでは、推論能力の向上やレイテンシの低減など、いくつかの改善が導入されました。
このモデルは、公開されているウェブテキスト、書籍、科学論文、コードリポジトリからなる多様なデータセットでトレーニングされました。トレーニングコーパスには1兆トークン以上が含まれ、英語、スペイン語、中国語の高品質なソースに重点が置かれました。トレーニングインフラストラクチャは、Amazon Web ServicesとAWS Trainiumインスタンスを通じて提供される4,096基のAMD MI300Xアクセラレータのクラスターを利用し、90日間にわたる効率的な分散トレーニングを可能にしました。
アーキテクチャと仕様
Muse-Spark 1.1は1,750億のパラメータを持ち、OpenAIのGPT-3.5などの他の大規模モデルとサイズが同等です。このモデルは128,000トークンのコンテキストウィンドウを使用し、長いドキュメントを処理し、長時間の会話で一貫性を維持できます。ネットワークの最後の3分の1に混合専門家(MoE)層を採用しており、トークンごとにパラメータのサブセットのみをアクティブ化することで、パフォーマンスを犠牲にせず効率を向上させています。
モデルのトレーニングには、ドロップアウトやレイヤー正規化など、過学習を防ぐためのいくつかの正則化技術が組み込まれました。また、Adamオプティマイザーと勾配クリッピングを使用したカスタム学習率スケジュールを採用し、トレーニングを安定させました。最終モデルはモデルプルーニング技術を使用して剪定され、メモリフットプリントを20%削減しながら精度を維持しました。
パフォーマンスとベンチマーク
LMArenaリーダーボードでは、Muse-Spark 1.1は2026年9月時点でEloレーティング1,342を達成し、評価された全モデルの上位5%に位置しています。推論、コーディング、数学的能力をテストするLiveBench評価では、モデルは全体で78.4をスコアし、特にコード生成(82.1)と論理的推論(79.6)で強いパフォーマンスを示しました。これらのスコアは、最新の利用可能なスナップショットである2026-09-18日付のものに基づいています。
他のモデルとの比較テストでは、Muse-Spark 1.1はMMLUベンチマークでAnthropicのClaude 3.5 Sonnetを上回り(90.2%対88.7%)、HumanEvalコーディングベンチマークでGoogle DeepMindのGemini 1.5 Proに匹敵しました(85.3%対85.1%)。ただし、MATHベンチマークではOpenAIのGPT-4oに遅れを取りました(72.8%対76.5%)。Groqハードウェアで測定されたモデルの推論速度は毎秒1,200トークンで、最適化されたアーキテクチャにより多くの競合他社よりも高速です。
アプリケーションと展開
Muse-Spark 1.1は、HalcyonのAPIを通じて利用可能であり、Microsoft Azure、Google Cloud、Oracle Cloudなどの主要なクラウドプラットフォームでも利用できます。カスタマーサポートチャットボット、法的文書分析、リアルタイム翻訳サービスなど、いくつかのエンタープライズアプリケーションに統合されています。このモデルは、特に自然言語処理と機械学習の分野での学術研究にも使用されています。
Halcyonは、エッジデバイスやモバイルアプリケーション向けに最適化された70億パラメータの軽量バージョン、Muse-Spark 1.1 Liteをリリースしました。このバージョンは、コア機能のほとんどを保持していますが、効率性のために一部のパフォーマンスを犠牲にしています。同社はまた、再現性を促進するためにモデルのトークナイザーと評価スクリプトをオープンソース化しました。
評価と影響
Muse-Spark 1.1のリリースは、AIコミュニティから肯定的なレビューを受けました。スタンフォードAIラボとバークレーAIリサーチの研究者は、その強力な推論能力と効率的な推論を賞賛しました。ただし、一部の批評家は、モデルのトレーニングデータにバイアスが含まれている可能性があると指摘し、Halcyonはそのような問題を軽減するための取り組みを詳述した透明性レポートを公開しました。
このモデルはまた、大規模AIトレーニングの環境影響に関する議論を引き起こしました。Halcyonは、トレーニングプロセスが約12 GWhの電力を消費したと報告しており、これは同様のサイズの他のモデルと同等です。同社は、将来のトレーニング実行に再生可能エネルギー源を使用することを約束しています。
2026年後半の時点で、Muse-Spark 1.1は大規模言語モデルの分野で著名なモデルであり続けており、その後継であるMuse-Spark 2.0はすでに開発中で、2027年初頭のリリースが予想されています。