DeepMind Technologies Limited,以Google DeepMind或简称DeepMind的名义运营,是一家英美人工智能研究实验室,也是Alphabet Inc.的子公司。该公司于2010年在英国成立,2014年被谷歌收购,并于2023年4月与谷歌AI的Google Brain部门合并,成为Google DeepMind。公司总部位于伦敦,在美国、加拿大、法国、德国和瑞士设有研究中心。
DeepMind以其在机器学习和深度学习方面的工作而闻名,特别是在开发使用强化学习训练的神经网络模型来玩视频游戏和棋盘游戏方面。2016年,其AlphaGo程序在五局比赛中击败围棋世界冠军李世石,成为头条新闻,该比赛后来被收录在纪录片《AlphaGo》中。一个更通用的程序AlphaZero,在通过强化学习进行数天的自我对弈后,击败了围棋、国际象棋和将棋的最强程序。此后,DeepMind训练了用于游戏(MuZero、AlphaStar)、数学(AlphaGeometry、FunSearch)和算法发现(AlphaEvolve、AlphaDev、AlphaTensor)的模型。
历史
这家初创公司由戴密斯·哈萨比斯、谢恩·莱格和穆斯塔法·苏莱曼于2010年11月创立。哈萨比斯和莱格最初在伦敦大学学院的盖茨比计算神经科学部门相识。创始人的目标是创造一个通用人工智能,能够对几乎任何事情都有用且有效。哈萨比斯表示,这家初创公司通过教AI玩20世纪70年代和80年代的Atari视频游戏(包括《打砖块》、《乓》和《太空侵略者》)来开始人工智能技术的研究。AI在没有任何编程知识的情况下被引入游戏。经过一段时间的摸索,AI最终会学会什么有效,并随着时间的推移甚至成为专家。据说AI经历的认知过程与一个从未见过游戏的人用来理解和尝试掌握游戏的过程非常相似。
主要风险投资公司Horizons Ventures和Founders Fund投资了该公司,企业家斯科特·班尼斯特、彼得·蒂尔和埃隆·马斯克也进行了投资。Jaan Tallinn是早期投资者和公司顾问。DeepMind需要一个资金充足的赞助者来支付员工工资、提供计算资源并进一步扩张。它曾受到Facebook、马斯克、谷歌和其他一些公司的追捧。
2014年1月26日,谷歌确认收购DeepMind,据报道价格在4亿至6.5亿美元之间。该公司随后更名为Google DeepMind,并保留该名称约两年。2014年,DeepMind获得了剑桥大学计算机实验室颁发的“年度公司”奖。
为了寻找造福社会的机会,DeepMind与国家医疗服务体系(NHS)启动了一个试点项目,以现代化其信息系统,这些系统通常仍使用普通纸张和传真机。2015年9月,DeepMind与Royal Free NHS Trust签署了初步信息共享协议,共同开发临床任务管理应用程序Streams。
在谷歌收购后,该公司成立了一个人工智能伦理委员会。该AI研究伦理委员会是一个谜,谷歌和DeepMind都拒绝透露委员会成员。DeepMind开设了一个名为DeepMind伦理与社会的新部门,专注于人工智能引发的伦理和社会问题,并邀请著名哲学家尼克·博斯特罗姆担任顾问。2017年10月,DeepMind成立了一个新的研究团队来调查AI伦理。
2019年12月,联合创始人苏莱曼宣布将离开DeepMind,加入母公司谷歌,担任政策相关职务。
2023年4月,DeepMind与谷歌AI的Google Brain部门合并,组成Google DeepMind,这是该公司为应对OpenAI向公众发布ChatGPT而加速AI工作的持续努力的一部分。这标志着DeepMind高管多年来争取从谷歌获得更大自主权的斗争结束。2026年夏天,DeepMind搬入了谷歌位于国王十字中央的Platform 37大楼。
产品和技术
截至2020年,DeepMind已发表超过一千篇论文,其中十三篇被《自然》或《科学》接受。DeepMind在AlphaGo时期获得了媒体关注;根据LexisNexis搜索,2016年有1842篇已发表的新闻报道提及DeepMind,2019年降至1363篇。
游戏
与IBM的Deep Blue或Watson等早期AI不同,这些AI是为预定义目的而开发且仅在该范围内运作,DeepMind最初的算法旨在具有通用性。它们使用强化学习,这是一种仅使用原始像素作为数据输入、从经验中学习的算法。其最初的方法使用带有卷积神经网络的深度Q学习。他们在视频游戏上测试了该系统,特别是早期街机游戏,如《太空侵略者》或《打砖块》。在不改变代码的情况下,同一个AI能够比任何人类更高效地玩某些游戏。2018年7月,DeepMind的研究人员训练其一个系统玩电脑游戏《雷神之锤III竞技场》。
2013年,DeepMind发表了一项关于AI系统的研究,该系统在《乓》、《打砖块》和《Enduro》等游戏中超越了人类能力,同时在《Seaquest》、《Beamrider》和《Q*bert》上超越了最先进性能。据报道,这项工作促成了该公司被谷歌收购。DeepMind的AI已应用于20世纪70年代和80年代制作的视频游戏;针对更复杂的3D游戏(如首次出现在20世纪90年代的《雷神之锤》)的工作仍在进行中。2020年,DeepMind发布了Agent57,这是一个在Atari 2600套件的全部57个游戏中超越人类水平表现的AI代理。2022年7月,DeepMind宣布开发了DeepNash,这是一种无模型的多代理强化学习系统,能够以人类专家的水平玩棋盘游戏《Stratego》。
#### AlphaGo及其后继者
2015年10月,由DeepMind开发的计算机围棋程序AlphaGo以五比零击败了欧洲围棋冠军樊麾(职业二段)。这是人工智能程序首次击败职业围棋选手。2016年3月,AlphaGo在韩国首尔的五局比赛中击败了九段世界冠军李世石。这场比赛估计有全球2亿人观看,后来被收录在纪录片《AlphaGo》中。
2017年12月,DeepMind推出了AlphaZero,这是AlphaGo的一个更通用版本,通过自我对弈和强化学习从零开始学习围棋、国际象棋和将棋。AlphaZero在几天的训练后击败了这些游戏的最强程序。2020年,DeepMind发布了MuZero,它在无需事先了解游戏规则的情况下掌握了围棋、国际象棋、将棋和Atari游戏。
AlphaFold与科学研究
2020年,DeepMind在蛋白质折叠问题上取得了重大进展,其AlphaFold在蛋白质折叠预测的基准测试中创下了最先进记录。2022年7月,宣布超过2亿个预测蛋白质结构(代表几乎所有已知蛋白质)将在AlphaFold数据库上发布。这项工作被广泛认为是生物学和医学领域的重大突破。
大型语言模型与生成式AI
Google DeepMind已负责开发两个大型语言模型系列:专有的Gemini和开放权重的Gemma,以及其他生成式AI模型,如Imagen(文本到图像)、Veo(文本到视频)和Lyria(文本到音乐)。这些模型是更广泛的生成式AI和大型语言模型研究领域的一部分。
影响与遗产
DeepMind的工作对人工智能领域产生了重大影响,特别是在强化学习和深度学习方面。其研究已发表在顶级科学期刊上,并影响了各行业AI技术的发展。该公司被谷歌收购并随后与Google Brain合并,使其成为全球AI格局中的关键参与者,与OpenAI和Anthropic等其他主要实验室竞争。
DeepMind对科学的贡献,特别是在蛋白质折叠方面,被比作诺基亚贝尔实验室和施乐帕洛阿尔托研究中心在其各自时代的工作。该公司的研究文化结合了神经科学、计算机科学和数学的见解,对塑造现代AI开发方法产生了影响。