Reasoningモデル

英語からの翻訳

推論モデルとは、強化学習を用いて訓練された言語モデルであり、回答前に内部での推論チェーンを延長して生成することで、推論時の計算量を増やす代わりに難しい問題での精度を高めるものです。

推論モデルは、大規模言語モデルの一種であり、通常は強化学習を用いて訓練され、最終的な回答を生成する前に、拡張された内部の推論ステップのシーケンスを生成するように設計されている。これは、初期世代のモデルが即座に回答していたのとは対照的である。このカテゴリは、従来の訓練済みモデルにプロンプト内の指示を通じて段階的に推論するよう求める通常の連鎖的思考プロンプティングとは区別される。なぜなら、推論モデルは自身の推論プロセスを生成し改善するために特別に訓練されており、プロンプトされたモデルよりもはるかに多くの中間テキストを生成することが多いからである。

起源

OpenAIは、2024年9月に最初の広く知られた推論モデルであるOpenAI o1を発表し、数学やプログラミングなど、最終的な正解を自動的に検証できる問題に対して強化学習を用いて「考える」ように訓練されたと説明した。OpenAIはo1の内部の推論連鎖をユーザーから大部分隠し、要約版のみを表示した。この決定は、モデルが誤った経路を探索することを含め、自由に推論する能力を維持し、その未完成な推論が最終的で承認された回答として受け取られるのを防ぐことを意図したものだと同社は述べた。このアプローチは、多段階の推論を必要とするベンチマーク、例えば競技数学やSWE-benchなどのコーディングタスクにおいて、 substantialな精度向上をもたらした。

DeepSeek-R1とオープン推論モデル

2025年1月、中国の研究所であるDeepSeekは、大規模な強化学習で訓練されたオープンウェイトの推論モデルDeepSeek-R1をリリースした。これは、報告された訓練コストの数分の一で、いくつかのベンチマークにおいてOpenAIの推論モデルの性能に匹敵するか接近し、o1とは異なり、ユーザーに完全な推論連鎖を公開した。このリリースは、DeepSeek市場ショックとして知られる事態を引き起こし、AIインフラ株の大規模な売りを促し、フロンティアレベルの推論モデルの訓練に必要な計算資源に関する前提の広範な再評価をもたらした。DeepSeekはまた、R1のより小さな蒸留版もリリースし、推論スタイルの動作を、控えめなハードウェアで実行できるほど安価なモデルで利用可能にした。

テスト時計算

推論モデルの決定的なトレードオフは、追加のテスト時計算、つまり訓練中ではなく回答時点で費やされるより多くの計算を、難しい問題の精度向上に変換できることである。これは、モデルサイズ、訓練データ、訓練計算に焦点を当てた従来のスケーリング則で説明される関係とは異なる。推論モデルは、新しいより大きなモデルを訓練することなく能力を向上できるさらなる軸を追加した。OpenAIの推論モデルプロジェクトに参加する前に推論と戦略的ゲームプレイシステムに取り組んでいたNoam Brownを含む研究者たちは、これを、考える時間を与えられた人間の専門家が即座に応答することを強いられた場合よりも良い回答を生み出すことに類似していると位置づけている。

評価と限界

推論モデルは、客観的に検証可能な回答を持つタスクで特に優れた性能を発揮する。そのため、評価はARC-AGIや競技数学などのベンチマークに重点が置かれ、より主観的な文章作成や会話タスクでは、拡張推論の利点が一貫せず、追加の推論時間とコストを正当化しにくい。推論モデルはまた、他の言語モデルと同様の幻覚リスクの影響を受け続ける。なぜなら、より長い推論が事実上正しい最終回答を保証するわけではなく、厳密に聞こえる推論トレースを生成しながらも誤ったステップを埋め込むことが時折あるからである。

カテゴリ:large-language-models·reasoning·deep-learning
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴