探索与利用的权衡,又称探索与利用困境,是决策中的一个基本概念,广泛出现在众多领域。它涉及平衡两种对立策略:利用,即基于当前知识(可能不完整或具有误导性)选择最佳选项;探索,即尝试可能在未来带来更好结果的新选项,但以放弃即时奖励为代价。找到最佳平衡点对于在决策问题中最大化长期收益至关重要。
在机器学习中,这种权衡是强化学习(RL)的基础,其中智能体从可能不完整或延迟的反馈中学习做出决策。智能体必须决定是利用当前已知的最佳策略,还是探索新策略以提高性能。这一困境以多种形式出现,从简单的老虎机问题到复杂的现实世界系统。
多臂老虎机方法
多臂老虎机(MAB)问题是这种权衡的经典示例,许多方法已被开发出来应对它。常见方法包括epsilon-greedy、汤普森采样和上置信界(UCB)。在epsilon-greedy中,智能体大多数时间利用已知最佳动作,但以概率epsilon选择随机动作,确保持续探索。UCB通过选择具有高上置信界的动作来平衡探索和利用,偏向于那些奖励不确定的动作。汤普森采样使用贝叶斯推断从后验分布中采样,自然平衡两种策略。
在更复杂的强化学习场景中,每个决策都可以被视为一个MAB,其中收益是预期的未来奖励。例如,用于国际象棋和围棋等游戏的蒙特卡洛树搜索采用UCB的变体来引导搜索。这些方法广泛应用于人工智能系统,包括由OpenAI和Google DeepMind开发的系统。
探索问题
在实践中,若干挑战使探索变得困难。稀疏奖励发生在奖励不频繁时,例如在Atari游戏《蒙特祖玛的复仇》中,智能体可能因缺乏引导而无法坚持探索。欺骗性奖励出现在早期动作产生少量即时奖励但分散注意力、远离更大后续奖励时,引诱智能体偏离更优策略。噪声电视问题描述了某些观察具有不可约随机性的情况,使智能体陷入无成效的探索,类似于观看有静电的电视。
这些问题突显了对复杂探索策略的需求,尤其是在深度学习和神经网络训练中常见的大动作空间场景中。
探索奖励方法
探索奖励(或探索奖励)方法通过将探索视为另一种奖励形式,将这一困境转化为利用的平衡。智能体最大化内在奖励(来自探索)和外在奖励(来自环境)的总和。内在奖励是自由设计的,不同于外在奖励,且通常是非平稳的,随着状态变得熟悉而减少。
基于计数的探索使用对状态的访问次数来计算奖励,但这仅在小规模、离散状态空间中可行。基于密度的探索通过使用密度模型近似访问计数来扩展这一方法,允许推广到邻近状态。最大熵探索将智能体策略的熵作为内在奖励,鼓励随机行为和更广泛的覆盖。
基于预测的探索
基于预测的方法使用一个前向动力学模型,根据当前状态和动作预测下一状态。模型在智能体交互时训练,提高对频繁访问的状态-动作对的预测准确性。探索奖励随后定义为预测误差,例如预测与实际下一状态之间的差异。这鼓励智能体寻求其模型不准确的区域,促进新奇体验的发现。
这种方法与好奇心驱动的学习相关,并已在各种强化学习框架中得到探索,包括用于生成式AI和大语言模型训练智能体的框架。
应用与启示
探索与利用的权衡超越强化学习,延伸到在线广告、临床试验和推荐系统等领域。在Amazon Web Services和Azure中,老虎机算法优化资源分配和用户参与。在AI研究中,平衡探索和利用对于训练稳健模型至关重要,如斯坦福AI实验室和伯克利AI研究的工作所示。
这一权衡也影响人类决策,从个人选择到组织战略。理解和解决它仍是一个活跃的研究领域,在课程学习和RLHF方面有持续发展,以提高学习效率和成果质量。