译自英文

DeepMind DQN是由谷歌DeepMind开发的深度强化学习模型,它将深度神经网络与Q学习相结合,在Atari游戏中实现了人类水平的控制,并于2015年首次展示。

DeepMind DQN(深度Q网络)是由Google DeepMind的研究人员开发的一款具有里程碑意义的人工智能模型。它证明了一种单一算法能够仅利用原始像素输入和游戏得分作为奖励信号,以媲美或超越人类表现的水平学习玩多种Atari 2600视频游戏。该研究成果于2015年2月发表在《自然》期刊上,题为“通过深度强化学习实现人类水平的控制”,标志着机器学习人工智能领域的一个重要里程碑。

DQN的核心创新在于将深度神经网络与Q学习这一强化学习技术相结合。传统的Q学习方法仅限于小型状态空间,而DQN使用卷积神经网络来逼近Q函数,该函数根据当前游戏画面估计每个动作的预期未来奖励。这使得模型能够处理视频游戏的高维视觉输入,而无需手工设计的特征。

架构与训练

DQN的架构由三个卷积层和两个全连接层组成的卷积神经网络构成。输入是四帧连续的84x84灰度图像堆叠,用于捕捉运动信息。网络为每个可能的动作(例如向左移动、向右移动或开火)输出一个Q值。训练采用经验回放机制,智能体将转移(状态、动作、奖励、下一状态)存储在记忆缓冲区中,并随机采样小批量数据来更新网络,从而打破序列数据中的相关性。

第二个关键组件是目标网络,它是主网络的定期更新副本,用于计算目标Q值。这通过减少因网络使用自身预测进行更新而导致的发散风险,稳定了训练过程。该模型使用了Adam优化器(尽管原始论文使用的是RMSProp),并采用随时间衰减的学习率调度。训练在单个Nvidia GTX 580 GPU上进行,每个游戏大约相当于38天的游戏时间(相当于2亿帧)。

结果与影响

在2015年的《自然》论文中,DQN在49款Atari游戏上进行了评估。它在超过一半的游戏上取得了至少达到人类平均水平75%的得分,并在29款游戏上超越了人类表现,包括《打砖块》、《乒乓球》和《太空侵略者》等经典游戏。该模型在需要长期规划的游戏中的表现尤为突出,例如在《打砖块》中,它学会了利用墙壁上的缺口来获得高分。

DQN的成功引发了深度强化学习领域的研究浪潮。它证明了深度学习可以应用于序列决策问题,而不仅仅是图像识别等监督任务。后续工作建立在DQN的基础上,带来了诸如Double DQN、Dueling DQN和优先经验回放等改进,这些方法解决了其部分局限性,包括Q值高估和采样效率低下。

与其他AI发展的关系

DQN是Google DeepMind更广泛成就谱系的一部分,其中包括后来的AlphaGo和AlphaZero等模型。虽然DQN专注于视频游戏,但其将神经网络与强化学习相结合的原则被扩展到了棋盘游戏和机器人领域。该模型还影响了生成式人工智能大型语言模型的发展,因为许多此类系统使用基于人类反馈的强化学习(RLHF)来微调行为,这一技术与DQN的奖励驱动学习在概念上有着共同的根源。

OpenAI后来在通用智能体方面的工作不同,DQN专门针对Atari环境,但它提供了一个概念验证,证明深度神经网络可以从原始感官数据中学习复杂的控制策略。这激发了自动驾驶(例如Waymo特斯拉自动驾驶)和机器人领域的研究,这些领域应用了类似的深度强化学习方法。

局限性与遗产

尽管取得了成功,DQN仍存在明显的局限性。它需要数百万帧的经验才能学习,与人类学习相比样本效率较低。它在奖励稀疏或需要广泛探索的游戏中表现不佳。该模型对超参数敏感,其性能在不同游戏间存在差异,有时在某些游戏上完全无法学习。

尽管如此,DQN仍然是人工智能领域的基础性工作。它在学术文献中被广泛引用,并作为评估新强化学习算法的标准基准。DeepMind开源了代码和训练模型,使全球研究人员能够复现和扩展其结果。截至2020年代中期,DQN的影响力在现代AI研究中持续存在,特别是在多智能体强化学习和元学习等领域。

主要贡献者

DQN论文的作者包括Volodymyr Mnih、Koray Kavukcuoglu、David Silver、Andrei A. Rusu、Joel Veness、Marc G. Bellemare、Alex Graves、Martin Riedmiller、Andreas K. Fidjeland、Georg Ostrovski、Stig Petersen、Charles Beattie、Amir Sadik、Ioannis Antonoglou、Helen King、Dharshan Kumaran、Daan Wierstra、Shane Legg和Demis Hassabis。其中著名人物包括Koray Kavukcuoglu,他后来成为DeepMind的研究总监,以及Demis Hassabis(尽管不在提供的列表中,他是DeepMind的联合创始人)。该工作建立在Richard Sutton(未列出)和Andrew Barto(未列出)等研究者的早期贡献之上,他们奠定了强化学习的理论基础。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:reinforcement-learning·deep-learning·google-deepmind·atari
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史