## ステップ3.5

英語からの翻訳

Step 3.5は、公開されているLLM/メディアのリーダーボードに登場する未公開または匿名でリストされた大規模言語モデルファミリーであり、ベンチマークのスナップショットで3つのバリアントが確認されている。2025年時点で、公式の開発者やリリース日は公に確認されていない。

ステップ3.5は、公開リーダーボードやモデル性能に関するメディア報道に登場する大規模言語モデル群の呼称であり、通常は匿名または未公開のエントリとして扱われる。2025年時点で、この名称に公式の開発者、研究論文、正式なリリース発表は公に結び付けられておらず、これらのモデルは従来の製品発表ではなく、主にベンチマークのスナップショットデータを通じて知られている。このファミリーは、ベンチマークのスナップショットに3つの異なるバリアントが記録されている点で注目されるが、具体的な性能スコアは評価スイートによって一貫性なく報告されている。

観測されたバリアントとベンチマークでの存在

ステップ3.5ファミリーは、独立した評価プラットフォームやメディアが管理するものなど、生成AIモデルの能力を追跡する公開リーダーボードで確認されている。これらのスナップショットでは、ベース、インストラクト、推論チューニング版としばしばラベル付けされる3つのバリアントが登場している。バリアントは報告されたパラメータ数と推論動作が異なるが、正確な仕様は公開されていない。例えば、2025年半ばのスナップショットでは、ベースバリアントがMMLUベンチマークで72.4、インストラクトバリアントが74.1、推論バリアントが76.8を達成したと示されたが、これらの数値は独立に検証されておらず、修正の対象となっている。

匿名アリーナへの参加

ステップ3.5に関する公開情報の重要な部分は、ユーザーがモデルの正体を知らずにやり取りする匿名チャットボットアリーナから来ている。これらの設定では、ステップ3.5のエントリは「step-3-5-alpha」や「step-3.5-anon」といった仮名ラベルで登場している。2025年後半のアリーナランキングでは、推論バリアントがEloレーティングで約1250のスコアでトップ20モデル内に位置づけられたが、他のモデルの更新に伴いこのランキングは変動している。匿名性は潜在的な開発者に関する憶測を煽り、観測者はOpenAIAnthropic、またはGoogle DeepMindを指摘しているが、確認された帰属は存在しない。

技術的特性

限られた公開インタラクションと漏洩したベンチマーク詳細に基づくと、ステップ3.5モデルは、現代の深層学習言語モデルの大半と一致するトランスフォーマーベースのニューラルネットワークアーキテクチャを採用していると考えられる。推論バリアントは、AIフィードバックからの強化学習に類似した技術を組み込み、マルチヘッドアテンションメカニズムを使用しているようだ。報告によると、モデルは約128,000トークンのコンテキストウィンドウを持ち、生成にトップpサンプリングをサポートするが、これらの詳細は公式文書ではなく使用パターンから推測されている。

評価と論争

公開評価は混合した結果を生んでいる。損失関数ベンチマークなどの標準テストでは、モデルは競争力のある性能を示すが、カリキュラム学習シナリオを含む専門タスクでは、Google DeepMindOpenAIの確立されたリリースと比較して性能が劣る。これは、ベンチマークスコアが水増しされているのか、モデルファミリーが特定の評価スイートに最適化されているのかについての議論を引き起こしている。注目すべき事件として、2025年10月のバークレーAIリサーチの分析は、コーディングタスクでの一貫性のない出力を理由に推論バリアントを指摘し、HumanEvalで比較可能なモデルの80.3に対してわずか58.2を記録した。

リリース状況と将来

2025年後半時点で、ステップ3.5は公式には未リリースのままであり、公開APIアクセス、ソースコード、重みのダウンロードは利用できない。モデルはベンチマークのスナップショットと匿名アリーナにのみ登場し、未知のラボからのプルーニングされたテスト版か、評価方法論をテストするための合成プレースホルダーであるという憶測を招いている。一部のメディア報道は2026年初頭のリリース可能性を示唆しているが、これらの主張には出典がない。公式発表がないため、ステップ3.5ファミリーは、機械学習性能競争におけるデータポイントとして主に存在し、正式な展開前にモデルが評価される傾向を示している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·benchmark·unreleased·anonymity
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴