2015年发表在《自然》杂志上、由谷歌DeepMind研究人员撰写的论文《通过深度强化学习实现人类水平的控制》介绍了深度Q网络(DQN),这是深度强化学习领域的一个里程碑。它证明了一种单一的算法仅凭原始像素输入和游戏得分作为奖励,就能在多种Atari 2600游戏上达到或超越人类水平。这项工作将机器学习与深度学习连接起来,展示了神经网络能够逼近高维状态空间中的Q函数,而这一问题此前被认为难以解决。
DQN将经典的Q学习算法(用于估计在给定状态下采取行动所获得的预期回报,即Q值)与深度卷积神经网络相结合。该网络经过训练,能够根据游戏画面预测每个可能动作的Q值。论文的关键创新在于解决了将非线性函数逼近与强化学习结合时的不稳定性问题,从而实现了对原始视觉输入的稳定训练。
背景:Q学习与强化学习
强化学习涉及智能体与环境互动、采取行动并接收奖励,以最大化累积回报。Q学习发展于20世纪80年代,是一种无模型算法,用于学习在给定状态下采取某一行动的价值,即Q值。对于有限马尔可夫决策过程,只要有足够的探索,Q学习就能找到最优策略,但它传统上依赖于表格表示,这限制了其在高维状态空间(如原始图像)中的应用。DQN论文通过使用深度神经网络作为函数逼近器,将Q学习扩展到高维输入,这一概念此前已有探索,但直到DQN才成功实现规模化。
架构与训练创新
DQN的架构采用深度卷积神经网络,类似于图像识别中使用的网络,来处理原始的Atari游戏帧。网络接收连续四帧游戏画面作为输入,以捕捉运动信息,并为多达18个可能的动作输出Q值。实现稳定训练的两项关键创新是:第一,经验回放--智能体将状态、动作、奖励和下一状态等转换存储在记忆缓冲区中,并从中随机抽样小批量数据进行训练,从而打破连续样本之间的相关性;第二,目标网络--使用一个单独的网络副本,定期更新,用于计算目标Q值,以减少因目标值不断变化而导致的发散风险。此外,算法还使用了折扣因子0.99、学习率0.00025以及随时间衰减的ε-贪婪探索策略。
结果与影响
DQN在49款Atari 2600游戏上进行了测试,这是强化学习的标准基准。它在包括《打砖块》、《乒乓球》和《太空侵略者》在内的多款游戏中取得了超越人类的表现,并超越了所有以往的强化学习方法。在29款游戏中,DQN的得分达到了人类水平的75%以上,在6款游戏中超过了人类最高分。论文报告称,DQN在单个GPU上训练约10天,处理约3800万帧游戏画面。这些结果有力地证明了深度强化学习能够处理复杂的高维感官输入,而无需手工设计特征。
遗产与后续发展
DQN论文激发了深度强化学习领域的研究热潮。它催生了众多改进算法,如双DQN、决斗DQN和优先经验回放,这些方法进一步提升了性能和稳定性。它还影响了AlphaGo的开发,后者是DeepMind后来的一款系统,将深度学习与蒙特卡洛树搜索相结合,击败了围棋世界冠军。DQN引入的技术,包括经验回放和目标网络,已成为强化学习领域的标准工具。该论文被广泛引用,被视为该领域的奠基之作,与人工智能和深度学习领域的其他进展并列。它的成功也彰显了谷歌DeepMind作为领先研究实验室的潜力,并为深度学习在生成式AI等更广泛领域的应用做出了贡献,尽管它对大型语言模型的影响是间接的,因为后者主要依赖于监督学习和自监督学习,而非环境奖励驱动的强化学习。