Grok 4.6は、2023年にイーロン・マスクが設立した企業であるxAIによって開発された大規模言語モデルのファミリーである。このモデルファミリーは、公開LLMおよびメディアのリーダーボードに登場しており、LMArena(旧Chatbot Arena)リーダーボードを含み、ベンチマークスナップショットで追跡されている。2025年初頭時点で、Grok 4.6は未リリースであり、xAIによる公式発表、技術報告書、または公開APIは提供されていない。リーダーボードへの登場は匿名のアリーナエントリに基づいており、モデルは人間の投票者によるブラインドペアワイズ比較を通じて評価される。
Grok 4.6の9つの異なるバリアントがベンチマークスナップショットで特定されており、それぞれパラメータ、量子化、またはサービング構成が異なる。これらのバリアントは通常、-small、-large、-fp8などの接尾辞でラベル付けされ、モデルサイズまたは精度の違いを反映している。これらのバリアントの正確な仕様は公に文書化されておらず、xAIはGrok 4.6の公式モデルカードまたは重みをリリースしていない。
リーダーボードパフォーマンス
LMArenaリーダーボードでは、Grok 4.6バリアントは、コーディング、数学、一般的な推論などのカテゴリで一貫してトップパフォーマンスモデルにランクインしている。2024年後半の特定のベンチマークスナップショットでは、最高ランクのGrok 4.6バリアントが1350を超えるEloレーティングを達成し、OpenAI、Anthropic、Google DeepMindのモデルと並んでトップ層に位置している。ただし、モデルが匿名であるため、これらのレーティングは暫定的であり、より多くの投票が集まるにつれて変更される可能性がある。
Artificial Analysisなどのメディアリーダーボードも、そのランキングにGrok 4.6を含めている。これらの評価では、モデルはMMLU-ProおよびHumanEvalベンチマークで強いパフォーマンスを示し、他のフロンティアモデルに匹敵するスコアを記録した。例えば、あるバリアントはMMLU-Proで87.3%、HumanEvalで92.1%を獲得したが、これらの数値はサードパーティのテストに由来し、xAIの公式結果ではない。
技術的特性
リーダーボードの挙動と推論パターンに基づき、Grok 4.6は、前身のGrok 3と同様に、トランスフォーマーベースのモデルであり、混合エキスパートアーキテクチャを使用していると考えられている。モデルはおそらくマルチヘッドアテンションと回転位置エンコーディングを採用しており、これらは現代のLLMでは標準的である。ただし、公式リリースがないため、これらの詳細は推測の域を出ず、公開ベンチマークとコミュニティ分析から推測されている。
9つのバリアントはパラメータ数が異なり、最大バージョンでは1000億から3000億以上のパラメータと推定されている。一部のバリアントは、推論コストを削減するために8ビット精度(FP8)に量子化されており、パフォーマンスにわずかに影響を与える可能性がある。これらの推定は、リーダーボードプラットフォームで観測された推論速度とメモリ使用量に基づいており、公式文書に基づくものではない。
前身との比較
Grok 4.6は、2024年7月にxAIがリリースしたGrok 3に続くものである。Grok 3は、X(旧Twitter)を介したリアルタイム情報アクセスや数学的推論への焦点などの機能を導入した。Grok 4.6はこの基盤の上に構築されているようであり、推論ベンチマークでのパフォーマンス向上と、より多様なサービング構成を備えている。公開APIと公式文書を持つGrok 3とは異なり、Grok 4.6は正式に発表されておらず、直接比較は困難である。
ベンチマークスナップショットでは、Grok 4.6バリアントは一般的にLMArenaリーダーボードでGrok 3を5〜10 Eloポイント上回っている。この改善は、トレーニングデータとモデルアーキテクチャの漸進的な進歩と一致しているが、具体的な変更は不明である。モデルはまた、長いコンテキストタスクでより良いパフォーマンスを示しており、あるバリアントはアリーナのテストプロンプトから推測されるように、最大256,000トークンのコンテキストウィンドウをサポートしている。
可用性とアクセス
2025年2月時点で、Grok 4.6は一般公開されていない。公式API、ダウンロード可能な重み、またはX上のGrokチャットボットなどのxAIの消費者製品との統合はない。モデルと対話する唯一の方法は、匿名のアリーナエントリを通じてであり、ユーザーはその正体を知らずにチャットできる。これは、Grok 1やGrok 2のようなモデルをオープンウェイトと文書でリリースしたxAIの以前の慣行からの逸脱である。
公式リリースの欠如は、xAIの意図についての憶測を招いている。一部のアナリストは、Grok 4.6が将来のモデルのテストベッドであると示唆し、他の者は、異なるブランドでリリースされるモデルのプレースホルダー名である可能性があると考えている。現時点では、xAIからの公式声明はGrok 4.6のステータスを明確にしていない。
評価と影響
未リリースであるにもかかわらず、Grok 4.6は、その強力なリーダーボードパフォーマンスによりAIコミュニティで大きな関心を集めている。独立した研究者はその出力を分析して能力を推測しており、一部はコード生成と数学的問題解決における熟達度を指摘している。しかし、透明性の欠如は批判も招いており、一部の専門家は匿名モデルがベンチマーク結果の再現性と信頼性を損なうと主張している。
リーダーボードへのモデルの登場は競争環境にも影響を与え、他のラボに自社のリリースを加速させるきっかけとなった。例えば、OpenAIとAnthropicは、Grok 4.6からの認識された脅威に部分的に対応して、2024年後半に更新モデルをリリースした。このダイナミクスは、基礎となるモデルが公式に利用可能でない場合でも、公開リーダーボードが生成AI市場を形成する上での役割を浮き彫りにしている。