探索-利用困境,又称探索-利用权衡,是决策中的一个核心概念,出现在从经济学到人工智能的各个领域。它涉及平衡两种对立的策略:利用,即基于当前知识(可能不完整或具有误导性)选择最佳选项;探索,即尝试可能带来更好未来结果的新选项,但代价是放弃一次利用机会。优化长期回报的目标要求有效解决这一平衡问题。
在机器学习中,这种权衡是强化学习(RL)的基础,强化学习是一种智能体根据环境反馈(可能延迟或稀疏)做出决策的学习类型。智能体必须决定是利用当前已知的最佳策略,还是探索新策略以改善未来表现。这一困境出现在自动驾驶、推荐系统和游戏人工智能等领域。
多臂老虎机方法
多臂老虎机(MAB)问题是这种权衡的经典示例,人们已为其开发了许多方法。epsilon-greedy是一种简单方法,智能体大多数时候利用已知的最佳动作,但以概率epsilon选择随机动作。汤普森采样通过维护奖励的后验分布并从中采样来平衡探索与利用。上置信界(UCB)算法通过比较平均奖励与不确定性奖励来选择动作。
在更复杂的环境中,智能体可以将每个决策点视为一个MAB,其中收益是预期的未来奖励。例如,蒙特卡洛树搜索使用UCB变体来引导游戏树的探索,如国际象棋引擎等程序所示。
探索问题
某些环境会给这种权衡带来特定挑战。
稀疏奖励:如果奖励很少出现,智能体可能无法坚持探索。一个标准示例是Atari游戏《蒙特祖玛的复仇》,其中明确的奖励十分稀缺。
欺骗性奖励:当某些早期动作提供即时但微小的奖励,而其他动作提供更大但延迟的奖励时,智能体可能会陷入利用早期小奖励的困境。
噪声电视问题:如果某些观察结果具有不可约的噪声,例如显示随机图像的电视,智能体可能会反复观察这些不可预测的状态而陷入停滞。
这些问题使得实现最优平衡变得困难,需要额外技术来引导探索。
探索奖励方法
探索奖励方法通过将探索视为一种内在奖励,把这一困境转化为纯粹的利用问题。智能体随后旨在最大化来自环境的外在奖励与内在探索奖励之和。内在奖励和外在奖励在时间步t分别记为r_t^e和r_t^i。
这种方法在两个方面与利用不同:第一,探索奖励由研究者自由设计,而外部奖励由环境给出;第二,外在奖励通常是平稳的,而内在奖励是非平稳的,这意味着随着动作变得熟悉,相同动作产生的奖励会越来越少。
基于计数的探索衡量状态被访问的频率,并奖励访问较少的状态,但这仅在小规模且离散的状态空间中可行。基于密度的探索通过使用密度模型扩展了这一点,其中访问一个状态也会对邻近状态给予部分奖励。
最大熵探索将智能体策略的熵作为内在项加入,鼓励偏好随机或多样动作的策略。
基于预测的探索
前向动力学模型从当前状态和动作预测下一状态:f:(s_t, a_t)映射到s_{t+1}。随着智能体与环境交互,它训练该模型以更好地预测熟悉路径的状态转换。基于预测的探索奖励将内在奖励定义为模型预测与实际下一状态之间的误差。当状态是新颖的时,模型误差较高,使该动作具有吸引力。
基于预测的探索在高维状态空间中特别有用,因为在这些空间中无法使用计数。模型的误差可作为惊讶程度的估计,这鼓励智能体寻求更难预测的状态,从而在没有外部引导的情况下促进更广泛的探索。这种方法被广泛用于最近的深度强化学习系统中。