テスト時計算

英語からの翻訳

モデルが応答を生成する際に費やす計算量であり、トレーニング中の計算量とは対照的である。推論時にモデルがより長く思考することを可能にすることでこれを拡大することが、2024年以降の能力向上の主要な原動力となった。

テスト時計算量とは、モデルが回答を生成する際に実行する計算量のことであり、トレーニング中に費やされる計算量とは区別される。深層学習の時代の大半において、能力の向上はほぼ完全にトレーニングのスケールアップ、すなわちパラメータの増加、データの増加、トレーニング計算量の増加によるものであり、これはスケーリング則に記述されている。テスト時計算量は、推論自体を第二のレバーとして扱う。モデルにより長く考えさせたり、より多くの候補回答を探索させたり、回答を返す前に自身の作業を検証させたりすることができ、これらの各操作はトレーニング時ではなく使用時に追加の計算コストを要する。

このアプローチが主流となったのは、OpenAIが2024年9月にリリースしたOpenAI o1による。迅速に単一パスで回答するよう調整された初期のチャットボットとは異なり、o1は最終回答を生成する前に、拡張された、大部分が隠された内部推論チェーンを生成するよう訓練されており、許可される推論トークンが増えるにつれて、数学、コーディング、論理ベンチマークでの精度が測定可能な形で向上した。これにより、推論モデル大規模言語モデルの明確なカテゴリとして確立され、DeepSeek-R1やGoogleのGemini「Thinking」バリアントなどの競合他社が約1年以内に追随した。

メカニズム

テスト時計算量は、いくつかの方法で費やすことができる。最も単純なのは、より長い思考連鎖の生成である。モデルは回答を確定する前に、中間推論ステップをテキストトークンとして書き出し、より多くのトークンを許可することで、算術やコードの正確性など明確な正解があるタスクでは一般的にパフォーマンスが向上する。第二の手法群は、複数の独立した回答をサンプリングし、多数決(自己整合性)または別の検証器や報酬モデルによる候補のスコアリングによって最良のものを選択するもので、部分解のツリー探索として組織化されることもある。第三のアプローチは改訂である。モデルはドラフトを生成し、それを批評し、再生成することで、最初の出力にコミットするのではなく、エラーを捕捉するために追加のパスを費やす。

これらの手法は、以前に存在した文脈内学習やプロンプティング技術とは、追加の計算を誰が制御するかという点で主に異なる。少数ショット学習の例のようなプロンプティング技術は、モデルに既存の重みをより効果的に使用するよう求める。テスト時計算量の手法、特に検証可能な報酬を用いた強化学習で訓練されたモデルでは、モデル自身が与えられた問題に必要な内部熟考の量を決定でき、原則として簡単な質問には少ない計算を、難しい質問にははるかに多くの計算を費やす。

経済性とトレードオフ

推論モデルは標準的なチャットモデルよりも回答あたりのトークンを何倍も消費する可能性があるため、テスト時計算量は、事前学習のスケールがほとんど脇に追いやっていたコストとレイテンシのトレードオフを再導入する。研究室やユーザーは、より多くの思考に対して支払うことで、推論時に精度を直接購入できるようになった。これは製品設計に実用的な影響を与える。推論モデルに基づくコーディングエージェントやリサーチアシスタントは、難しいクエリに答えるのに数十秒から数分かかる可能性があり、これらのモデルのAPI価格は通常、出力長とトークンあたりのプレミアムの両方を反映している。

評価と未解決の疑問

研究者たちは、テスト時計算量が真の推論に関連するのか、それともより高価なパターンマッチングの形態なのかについて議論しており、ARC-AGIなどのベンチマークでの結果はその議論の両側で使用されてきた。推論モデルは以前の世代よりもスコアを大幅に向上させたが、トレーニングデータに十分に表現されていない推論パターンを必要とする問題では、パフォーマンスは依然として低下する。一部の研究室は、テスト時計算量のスケーリングを元のスケーリング則に匹敵する重要性を持つ新しい軸として説明し、さらなる進歩は純粋に長い思考チェーンではなく、より効率的な探索と検証からもたらされると期待している。他の研究者は、追加の推論計算による利得はある時点を超えると逓減し、この技術は事前学習のスケールやファインチューニングの代替ではなく、補完として理解するのが最適であると指摘する。2025年までに、テスト時計算量は汎用人工知能のタイムラインに関する競争上の主張の中心にもなった。「より長く考える」ことによる問題固有の精度向上は、研究室にパラメータ数の見出しとは異なる、マーケティングしやすい新しい能力のダイヤルを提供したからである。

カテゴリ:reasoning·inference·scaling
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴