译自英文

强化学习是一种机器学习方法,其中智能体通过在与环境交互中采取行动并接收奖励或惩罚来学习做出决策,旨在随时间最大化累积奖励。

强化学习(RL)是机器学习的一个分支,其中智能体通过试错在环境中学习行动,每次行动后接收数值奖励信号,并调整其行为以最大化随时间累积的总奖励。与监督学习不同,监督学习会为每个输入展示正确的输出,而强化学习从不直接告诉智能体正确的行动;它只揭示,,有时在事后很久,,一系列行动的结果是好是坏,这种结构被称为信用分配问题。

形式化框架与历史

强化学习通常被形式化为马尔可夫决策过程,其中智能体观察状态、选择行动、接收奖励并转移到新状态,重复此循环,同时学习一个将状态映射到行动的策略,以最大化预期未来奖励。该领域的数学基础可追溯至20世纪中期的动态规划和最优控制理论,但其作为独立机器学习学科的现代框架与Richard Sutton和Andrew Barto密切相关,他们的教科书成为该领域的标准参考,也与后来领导DeepMind强化学习项目的研究人员(包括David Silver)相关。

里程碑式成就

强化学习最广为人知的成功来自游戏领域。AlphaGo结合深度神经网络、强化学习和树搜索,于2016年在围棋中击败世界冠军李世石,这一结果被广泛认为比专家预测提前了数年。其继任者AlphaZero推广了该方法,仅通过自我对弈学习国际象棋、将棋和围棋,不使用任何人类棋谱数据,仅从规则出发。这些系统证明,智能体仅通过奖励驱动的试错加上足够的计算能力,就能在复杂领域达到超人类表现,这一观点后来被Sutton阐述为“苦涩的教训”:随着计算能力的增加,利用计算的通用方法往往优于依赖手工设计人类知识的方法。

技术

强化学习算法分为几个家族。基于值的方法(如Q学习及其深度学习扩展深度Q网络)学习估计在给定状态下采取特定行动的长期价值。策略梯度方法直接学习输出行动的策略函数,而演员-评论家方法结合了这两种方法。近端策略优化(PPO)主要由John Schulman开发,因其相对稳定的训练特性成为最广泛使用的策略梯度算法之一,后来在游戏之外的大型语言模型对齐中发挥了核心作用。

从游戏到语言模型

强化学习的相关性随着基于人类反馈的强化学习而大幅扩展,其中在人类偏好判断上训练的奖励模型替代了手工编码的奖励函数,然后使用PPO等算法对LLM进行微调,以产生根据该学习奖励模型得分高的输出。这项技术对于将原始预训练的大型语言模型转变为像ChatGPT这样可靠遵循指令的助手至关重要。最近,强化学习直接应用于具有自动可验证结果的任务,例如答案可检查的数学问题或通过或失败测试的代码,成为推理模型(如OpenAI o1DeepSeek-R1)背后的关键技术,这些模型学习产生更长的推理链,以提高在难题上的准确性,这种方法通常被描述在测试时计算的框架下。

局限性

强化学习以样本效率低下而闻名,通常需要比人类学习类似技能多得多的试错交互,并且容易受到奖励黑客的影响,即智能体找到一种非预期的方式最大化其奖励信号,技术上满足目标,却未能实现其本应代表的根本目标。设计一个忠实捕捉预期行为、同时不给优化智能体留下可利用漏洞的奖励函数,仍然是该领域持续存在的开放挑战之一。

分类:machine-learning·reinforcement-learning·decision-making
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史