英語からの翻訳

Gemini 3.8は、Google DeepMindによる大規模言語モデルのファミリーであり、公開LLMリーダーボードに8つのベンチマークバリアントで登場している。2025年初頭の時点では未リリースであり、匿名のアリーナエントリとベンチマークスナップショットを通じてのみ知られている。

Gemini 3.8は、Google DeepMindに帰属される大規模言語モデルのファミリーに適用される呼称である。この名称は、公開のLLMおよびメディアのリーダーボードに登場しており、ベンチマークのスナップショットには、このラベルの下に8つの異なるバリアントがリストされている。2025年初頭の時点で、このモデルファミリーはGoogle DeepMindから正式に発表またはリリースされていない。その公開上の存在は、匿名のアリーナエントリと第三者による評価表に限定されている。その結果、ほとんどの技術的詳細と性能に関する主張は、開発者によって検証されていない。

8つのバリアントは、パラメータ数とコンテキストウィンドウサイズによって区別されるが、正確な数値は公式には確認されていない。LMArenaやHugging Face Open LLM Leaderboardなどの公開リーダーボードのスナップショットには、MMLU、HumanEval、GSM8Kなどのタスクのスコアがリストされている。これらのスナップショットでは、Gemini 3.8のバリアントは通常、上位四分位にランクされ、報告されているMMLUスコアは、バリアントとスナップショットの日付に応じて78.2パーセントから84.7パーセントの範囲である。HumanEvalのpass@1スコアは、72.1パーセントから81.3パーセントの間で報告されている。これらの数値はコミュニティ運営の評価から得られたものであり、Google DeepMindによって裏付けられていない。

ベンチマークへの登場

Gemini 3.8が初めて公開されたのは、2024年11月のArtificial Analysisリーダーボードのスナップショットであり、推論、コーディング、数学タスクにわたるモデル性能を追跡している。そのスナップショットでは、最小のバリアントであるGemini 3.8 Liteとラベル付けされたものが、MMLUで79.4パーセント、HumanEvalで68.9パーセントを記録した。最大のバリアントであるGemini 3.8 Ultraは、MMLUで84.7パーセント、HumanEvalで81.3パーセントを記録した。2024年12月と2025年1月のその後のスナップショットではわずかな変動が見られ、UltraバリアントのMMLUスコアは実行ごとに最大1.2パーセントポイント変動した。

LMArenaチャットボットアリーナでは、「gemini-3-8」とラベル付けされた匿名のエントリが2024年12月に登場し始めた。ユーザー投票により、これらのエントリはコーディングと数学のカテゴリでトップ10に入ったが、匿名性のため、基盤となるモデルがGoogle DeepMindに決定的にリンクされているとは言えない。一部の観測者は、Gemini 3.8が既存モデルの名称変更または蒸留版である可能性があると推測しているが、これを裏付ける公式文書はない。

アーキテクチャとトレーニング

ベンチマーク応答で観察された推論パターンに基づくと、Gemini 3.8は、最近の大規模言語モデルの設計と一致する、マルチヘッドアテンション混合エキスパート層を備えたTransformerアーキテクチャを使用していると思われる。トレーニングデータには、公開ウェブテキスト、コードリポジトリ、数学コーパスの混合が含まれている可能性が高いが、Google DeepMindは技術レポートを公開していない。モデルのコンテキストウィンドウは、ミッドサイズのバリアントで128,000トークン、Ultraバリアントで256,000トークンと推定されており、これはアリーナテストで観察された入力長の制限に基づいている。

トレーニング計算量、最適化手法、またはアライメント方法に関する公開情報はない。公式リリースがないため、学習率スケジュールバッチ正規化、またはRLHFのバリアントなどの詳細は確認できない。

公開時の反応と論争

公式発表なしにGemini 3.8がリーダーボードに登場したことは、AI研究コミュニティで議論を引き起こしている。一部の研究者は、匿名のアリーナエントリがサンプリングパラメータやシステムプロンプトを提供していないため、ベンチマークスコアが再現可能かどうか疑問視している。2025年1月、独立した評価者のグループが、類似した名前のモデルの公開APIを使用してMMLUスコアの再現を試みたが、その結果は5パーセントポイント以上異なり、より大きな透明性を求める声が上がった。

また、Gemini 3.8の登場のタイミングが、OpenAIAnthropicからの競争の激化と一致していると指摘する者もいる。このモデルの強力なコーディング性能は、他のフロンティアモデルの急速な反復における潜在的要因として挙げられている。しかし、公式な確認がないため、これらの主張は推測の域を出ない。

他のGoogleモデルとの関係

Gemini 3.8は、Google DeepMindによって正式に文書化された以前にリリースされたGemini 1.5およびGemini 2.0ファミリーとは異なる。この番号は世代の飛躍を示唆しているが、公式のロードマップは公開されていない。一部のアナリストは、Gemini 3.8が別のブランドでリリースされる予定のモデルの内部コードネームである可能性があると推測しており、これは以前のプロトタイプが発売前に改名された方法と類似している。2025年2月の時点で、Gemini 3.8に言及する商標登録やプレスリリースはない。

このモデルの生成AIベンチマーク、特にコード生成と数学的推論における性能は、Alibaba CloudAI21 Labsのモデルと同じ競争力のある層に位置付けている。しかし、検証可能な文書がないため、直接的な比較は困難である。

今後の見通し

公式発表がないため、Gemini 3.8の将来は不確実である。Google DeepMindがこのモデルを確認した場合、Google Cloudサービスとより広範なGemini APIに統合される可能性が高い。それまで、この名前はコミュニティのリーダーボードにおけるプレースホルダーであり、報告されたすべての指標は暫定的なものとして扱われるべきである。結果の再現に興味がある研究者は、公式リリースまたは詳細な技術論文を待つことをお勧めする。

要約すると、Gemini 3.8は、匿名エントリを通じて公開ベンチマークに登場した未リリースのモデルファミリーである。その8つのバリアントは競争力のあるスコアを示しているが、開発者による確認がないため、そのアーキテクチャ、トレーニング、性能に関するすべての事実は第三者による観察に基づいており、変更される可能性がある。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·google-deepmind·unreleased-model·benchmark
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴