英語からの翻訳

強化学習は、エージェントが環境内で行動を選択し、報酬または罰則を受け取ることで意思決定を学習する機械学習のアプローチであり、長期的な累積報酬の最大化を目的とします。

強化学習(RL)は、機械学習の一分野であり、エージェントが環境内で試行錯誤を通じて行動を学習し、各行動の後に数値的な報酬信号を受け取り、時間の経過とともに収集する累積報酬を最大化するようにその行動を調整するものである。教師あり学習とは異なり、そこではモデルが各入力に対して正しい出力を示されるが、強化学習はエージェントに正しい行動を直接教えることは決してない;それは、しばしば行動の連鎖の結果が良かったか悪かったかを、時にはその事実からかなり時間が経ってから明らかにするだけであり、これは信用割当問題として知られる構造である。

形式的枠組みと歴史

強化学習は典型的にはマルコフ決定過程として形式化され、エージェントが状態を観察し、行動を選択し、報酬を受け取り、新しい状態へ遷移し、このループを繰り返しながら、期待される将来の報酬を最大化するように状態を行動に写像する方策を学習する。この分野の数学的基盤は、20世紀中頃の動的計画法と最適制御理論に遡るが、その現代的な枠組みが明確な機械学習の一分野として確立されたのは、リチャード・サットンとアンドリュー・バートと密接に関連しており、彼らの教科書はこの分野の標準的な参考文献となり、また後にDeepMindの強化学習プログラムを主導したデビッド・シルバーらの研究者とも関連している。

画期的な成功

強化学習の最も公に知られた成功はゲームから来ている。AlphaGoは深層ニューラルネットワークと強化学習および木探索を組み合わせて、2016年に囲碁で世界チャンピオンの李セドルを破り、その結果は専門家の予測より数年早いと広く見なされた。その後継であるAlphaZeroはこのアプローチを一般化し、チェス、将棋、囲碁を自己対戦のみから学習し、人間のゲームデータを一切使わず、ルールだけから始めた。これらのシステムは、エージェントが複雑な領域で、報酬駆動の試行錯誤と十分な計算量を組み合わせるだけで、超人的な性能に到達できることを実証し、この考えは後にサットンが「苦い教訓」として明確に述べた:計算量を活用する一般的な方法は、より多くの計算量が利用可能になるにつれて、手作りの人間の知識に依存するアプローチよりも優れた性能を発揮する傾向がある、というものである。

技術

強化学習アルゴリズムはいくつかのファミリーに分類される。値ベースの方法、例えばQ学習とその深層学習拡張である深層Qネットワークは、与えられた状態で与えられた行動を取ることの長期的価値を推定することを学ぶ。方策勾配法は、行動を出力する方策関数を直接学習し、アクタークリティック法は両方のアプローチを組み合わせる。近位方策最適化(PPO、主にジョン・シュルマンによって開発された)は、その比較的訓練の安定性により、最も広く使われる方策勾配アルゴリズムの一つとなり、後にゲームの外、大規模言語モデルの調整において中心的な役割を果たすことになる。

ゲームから言語モデルへ

強化学習の関連性は、RLHF(人間のフィードバックからの強化学習)とともに劇的に広がり、そこでは人間の選好判断に基づいて訓練された報酬モデルが、手書きの報酬関数の代わりとなり、LLMはその後、PPOのようなアルゴリズムで微調整され、学習された報酬モデルに従って高いスコアを出す出力を生成するようになる。この技術は、生の事前訓練済み大規模言語モデルを、ChatGPTのような指示に確実に従うアシスタントに変える中心的な役割を果たした。より最近では、強化学習が自動的に検証可能な結果を持つタスク、例えば答えが確認できる数学問題やテストに合格するか失敗するコードなどに直接適用され、推論モデル、例えばOpenAI o1DeepSeek-R1の背後にある主要な技術となり、これらは難しい問題での精度を向上させる長い推論連鎖を生成することを学び、このアプローチはしばしばテスト時計算量の傘の下で説明される。

限界

強化学習は悪名高いほどサンプル非効率であり、しばしば同等のスキルを学ぶために人間が必要とするよりもはるかに多くの試行錯誤の相互作用を必要とし、また報酬ハッキングに対して脆弱であり、そこではエージェントが報酬信号を最大化する意図しない方法を見つけ、それが技術的には目的を満たす一方で、それが表すことを意図された根本的な目標を達成できないものである。意図された行動を忠実に捉え、最適化エージェントが悪用できる抜け穴を作らない報酬関数を設計することは、この分野の永続的な未解決の課題の一つであり続けている。

カテゴリ:machine-learning·reinforcement-learning·decision-making
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴