探索と活用のジレンマ、別名「探索と活用のトレードオフ」は、経済学から人工知能に至るまでの分野で現れる意思決定における中核的な概念です。これは、現在の知識(不完全または誤解を招く可能性がある)に基づいて最良の選択肢を選ぶ「活用」と、将来のより良い結果につながる可能性がある新しい選択肢を試すが、活用の機会を犠牲にする「探索」という、対立する2つの戦略のバランスを取ることを含みます。長期的な報酬を最適化するという目標は、このバランスを効果的に解決することを必要とします。
機械学習において、このトレードオフは強化学習(RL)の基本であり、エージェントが環境からのフィードバック(遅延または疎らな場合がある)に基づいて決定を下す学習の一種です。エージェントは、現在知られている最良の方策を活用するか、将来のパフォーマンスを向上させるために新しい方策を探索するかを決定しなければなりません。このジレンマは、自動運転、レコメンダーシステム、ゲームプレイAIなどの領域に現れます。
多腕バンディット法
多腕バンディット(MAB)問題はこのトレードオフの古典的な例であり、多くの手法が開発されています。イプシロン・グリーディは、エージェントがほとんどの場合で既知の最良の行動を活用するが、確率イプシロンでランダムな行動を選択する単純なアプローチです。トンプソンサンプリングは、報酬の事後分布を維持し、そこからサンプリングすることで探索と活用のバランスを取ります。上信頼境界(UCB)アルゴリズムは、平均報酬と不確実性ボーナスを比較して行動を選択します。
より複雑な設定では、エージェントは各決定点を、ペイオフが期待される将来報酬であるMABとして扱うことができます。例えば、モンテカルロ木探索はUCBの変種を使用してゲーム木の探索を導きます。これはチェスエンジンのようなプログラムに見られます。
探索の問題
特定の環境はトレードオフに特有の課題を生み出します。
疎らな報酬:報酬がまれにしか現れない場合、エージェントは探索を続けない可能性があります。標準的な例はアタリゲームのモンテズマの復讐で、明確な報酬が乏しいです。
欺瞞的な報酬:いくつかの初期の行動が即時的だが小さな報酬を与え、他の行動がより大きな遅延報酬を与える場合、エージェントは初期の小さな報酬を活用することに閉じ込められる可能性があります。
ノイズの多いテレビ問題:いくつかの観測が本質的にノイズが多い場合(ランダムな画像のテレビなど)、エージェントはそれらの予測不可能な状態を繰り返し観測することに固執する可能性があります。
これらの問題は最適なバランスを達成することを困難にし、探索を導くための追加の技術を必要とします。
探索報酬法
探索報酬法は、探索を一種の内発的報酬として扱うことで、ジレンマを純粋な活用問題に変換します。エージェントはその後、環境からの外発的報酬と内発的探索ボーナスの合計を最大化することを目指します。内発的報酬と外発的報酬は、時間ステップtでr_t^eおよびr_t^iと表記されます。
このアプローチは、2つの重要な点で活用と異なります:第一に、探索報酬は研究者によって自由に設計されるのに対し、外発的報酬は環境によって与えられます;第二に、外発的報酬は通常定常的であるのに対し、内発的報酬は非定常的であり、同じ行動が馴染み深くなるにつれてボーナスが減少します。
カウントベースの探索は、状態が訪問される頻度を測定し、訪問が少ない状態に報酬を与えますが、これは小さく離散的な状態空間でのみ実行可能です。密度ベースの探索は、密度モデルを使用してこれを拡張し、状態を訪問すると近隣の状態にも部分的なクレジットが与えられます。最大エントロピー探索は、エージェントの方策のエントロピーを内発的項として追加し、ランダムまたは多様な行動を好む方策を促進します。
予測ベースの探索
前方ダイナミクスモデルは、現在の状態と行動から次の状態を予測します:f: (s_t, a_t) を s_{t+1} にマッピングします。エージェントが環境と相互作用するにつれて、馴染みのある経路の状態遷移をより良く予測するためにこのモデルを訓練します。予測ベースの探索ボーナスは、モデルの予測と実際の次の状態との間の誤差として内発的報酬を定義します。状態が新規である場合、モデル誤差が高く、その行動が魅力的になります。
予測による探索は、カウントを使用できない高次元の状態空間で特に有用です。モデルの誤差は驚きの推定値として機能し、エージェントが予測が難しい状態を求めることを促し、外部のガイダンスなしでより広範な探索を促進します。この方法は、最近の深層強化学習システムで広く使用されています。