学徒制学习是机器学习的一个子领域,专注于通过观察专家的示范来教导智能体执行任务,而非接收显式的奖励信号或手工设计的指令。这一术语在2004年Pieter Abbeel和Andrew Ng的基础性工作中得到推广,他们将问题定义为在马尔可夫决策过程(MDP)中学习一种策略,使其匹配专家的特征期望。与直接复制专家动作的标准监督式模仿学习不同,学徒制学习通常旨在推断驱动专家行为的潜在奖励函数,这一问题也被称为逆强化学习。这种方法使智能体能够泛化到示范状态之外,并处理最优行为并非简单地从观测到动作的直接映射的情况。
核心思想是假设专家的行为相对于某个未知奖励函数是最优(或接近最优)的。学习者的目标是找到一种策略,使其表现与专家相当,以期望累积奖励来衡量。由于真实奖励未知,学习者必须从示范中估计它。Abbeel和Ng证明,如果奖励函数是已知特征的线性组合,那么匹配专家策略的特征期望就足以保证学习者的策略表现接近专家,无论奖励函数的具体权重如何。这一见解构成了许多学徒制学习算法的基础。
形式化框架
学徒制学习通常在马尔可夫决策过程(MDP)框架内形式化,该框架由一组状态、动作、转移概率和折扣因子定义。在标准设置中,奖励函数对学习者未知。专家提供一组轨迹,即状态和动作的序列。学习者随后必须计算一种策略,在未知奖励下最大化期望回报。
关键的数学工具是特征期望的概念。对于给定策略,特征期望是沿轨迹遇到的期望折扣特征向量之和。通过将学习者策略的特征期望与专家策略的匹配,学习者确保其策略在专家可能优化的任何线性奖励函数下都接近最优。这是一个强保证,因为它不要求学习者识别确切的奖励权重。
与逆强化学习的关系
学徒制学习与逆强化学习(IRL)密切相关,后者是从专家示范中恢复奖励函数的问题。在IRL中,目标是显式估计奖励函数,而在学徒制学习中,目标是直接产生表现良好的策略。许多学徒制学习算法通过迭代求解IRL问题,然后使用估计的奖励来训练策略。这一迭代过程通常被称为“学徒制学习算法”,并在2004年的论文中引入。该算法交替进行:找到一种最大化当前奖励估计的策略,并更新奖励估计以使专家行为显得更优。
算法与方法
已开发出多种用于学徒制学习的算法。Abbeel和Ng的原始算法使用线性规划方法找到匹配专家特征期望的策略。后续工作将其扩展到非线性奖励函数,使用最大熵IRL等技术,该技术将专家行为建模为随机的,并在匹配特征期望的约束下最大化策略的熵。另一种流行方法是使用生成对抗网络(GAN)形式的生成对抗模仿学习(GAIL),它直接学习模仿专家状态-动作分布的策略,而无需显式恢复奖励函数。
更近期的方法利用深度学习和神经网络架构来处理高维状态空间,如图像。这些方法通常将学徒制学习与深度学习技术结合,使智能体能够从原始像素输入中学习。例如,在机器人操作任务中,深度学徒制学习算法可以通过观察人类示范者来学习抓取物体,使用卷积神经网络处理视觉输入。
应用
学徒制学习已应用于多个领域。在机器人学中,它被用于教授机器人执行驾驶、飞行和操作等任务。例如,Waymo和Tesla已探索了用于自动驾驶的模仿学习技术,其中专家是人类驾驶员。在游戏领域,学徒制学习被用于通过观察专家走法来训练智能体玩国际象棋和围棋等游戏,尽管现代方法通常将其与强化学习结合。在自然语言处理中,学徒制学习已应用于对话系统,智能体通过模仿人类对话来学习交谈,以及摘要任务。
在医疗保健中,学徒制学习被用于建模临床决策。例如,智能体可以通过观察经验丰富的医生的决策来学习推荐治疗方案。这在指定奖励函数困难的领域特别有用,如个性化医疗。在金融领域,它被应用于算法交易,其中专家是成功的交易者,智能体学习复制其策略。
挑战与局限性
学徒制学习的主要挑战之一是需要大量专家示范。专家的行为可能带有噪声或次优,这可能导致学习效果不佳。此外,假设专家优化线性奖励函数在许多现实场景中可能过于严格。当真实奖励是非线性时,匹配特征期望可能不足以保证良好性能。
另一个挑战是分布偏移问题。学习者的策略可能访问专家示范未覆盖的状态,导致不可预测的行为。在高维状态空间中,专家覆盖稀疏时,这尤其成问题。已提出数据增强和域随机化等技术来缓解此问题,但它们并不总是有效。
此外,学徒制学习对特征的选择敏感。特征必须足够信息丰富以捕捉任务的相关方面,但又不能高维到使特征期望匹配在计算上不可行。在实践中,设计良好特征通常需要领域专业知识。
与其他学习范式的比较
学徒制学习常与其他范式进行比较,如课程学习和基于AI反馈的强化学习。在课程学习中,智能体在逐渐困难的任务上训练,这是提高学习效率的不同方法。相比之下,学徒制学习专注于从专家示范中学习。基于人类反馈的强化学习(RLHF),用于训练大型语言模型,与之相关但不同:RLHF使用人类偏好来塑造奖励模型,而学徒制学习直接使用示范。然而,两种方法都旨在使智能体行为与人类意图对齐。
另一个相关概念是行为克隆,这是一种简单的模仿学习形式,智能体使用监督学习学习从状态到动作的直接映射。行为克隆通常更容易实现,但遭受分布偏移,且无法泛化到专家示范之外。学徒制学习通过推断奖励,可能更好地泛化。
近期发展
学徒制学习的近期进展由深度学习和大规模计算的集成驱动。例如,OpenAI和Google DeepMind开发了将学徒制学习与强化学习结合的算法,在复杂环境中实现超人类性能。在生成式AI的背景下,学徒制学习被用于使模型与人类价值观对齐,类似于RLHF但使用示范而非偏好。
此外,对使用学徒制学习于多智能体系统的兴趣日益增长,其中多个智能体从彼此的示范中学习。这在自动驾驶中尤其相关,车辆必须相互交互。MIT CSAIL和Stanford AI Lab等机构的研究已探索这些方向,重点关注可扩展性和鲁棒性。
未来方向
学徒制学习的未来在于解决其当前局限性。一个有前景的方向是开发需要更少示范的方法,可能通过利用先验知识或使用主动学习在不确定状态查询专家获取额外示范。另一个方向是扩展到部分可观测环境,其中智能体必须从观测中推断隐藏状态。这对机器人和自动驾驶等现实应用至关重要,因为传感器提供噪声和不完整信息。
此外,正在进行的关于将学徒制学习与其他学习形式结合的工作,如模型剪枝和数据增强,以提高效率和泛化能力。随着AI系统更深入地融入社会,学徒制学习可能在使机器以安全可靠的方式从人类专业知识中学习方面发挥关键作用。