Google Brain 是谷歌旗下的一个深度学习人工智能研究团队,在并入新成立的谷歌母公司伞形机构 Google AI 之前,曾作为谷歌唯一的 AI 分支部门运营。该团队成立于 2011 年,致力于将开放式机器学习研究与大规模计算资源相结合。其开发的工具(如 TensorFlow)不仅服务于内部项目,也向公众开放。2023 年 4 月,Google Brain 与谷歌姊妹公司 DeepMind 合并,组建为 Google DeepMind。
该团队以在深度学习领域的开创性工作而闻名,包括开发了Transformer架构,该架构成为大型语言模型的基础。其研究范围涵盖图像增强、机器翻译,甚至包括人工智能设计的加密方法。
历史
Google Brain 项目于 2011 年在 Google X 实验室启动,是谷歌研究员杰夫·迪恩、格雷格·科拉多与斯坦福大学教授吴恩达之间的合作项目。2012 年,该团队利用来自 YouTube 视频的 1000 万张图像训练了一个大规模神经网络;该系统在没有被明确训练识别的情况下,学会了识别包括猫在内的高级概念。
2013 年,谷歌通过聘请杰弗里·辛顿并收购其与亚历克斯·克里热夫斯基和伊利亚·苏茨克弗共同创立的 DNNresearch 公司,扩大了其深度学习研究。同年晚些时候,托马斯·米科洛夫及其在 Google Brain 的同事开发了 word2vec,一种从大规模文本集合中学习词嵌入的方法。
2015 年,谷歌开源了 TensorFlow,这是 Google Brain 团队为开发和训练机器学习模型而开发的框架。2017 年,谷歌研究人员在论文《Attention Is All You Need》中提出了 Transformer 架构。该架构最初用于机器翻译,后来成为大型语言模型的主导架构。
2023 年 4 月,Google Brain 与 DeepMind 合并,组建 Google DeepMind,这是该公司持续加速 AI 研究努力的一部分。
团队与所在地
Google Brain 最初由谷歌研究员杰夫·迪恩和访问学者、斯坦福大学教授吴恩达创立。2014 年,团队成员包括杰夫·迪恩、黎奎克、伊利亚·苏茨克弗、亚历克斯·克里热夫斯基、萨米·本吉奥和文森特·范霍克。2017 年,团队成员包括阿内利亚·安格洛娃、萨米·本吉奥、格雷格·科拉多、乔治·达尔、迈克尔·伊萨德、安朱莉·坎南、雨果·拉罗谢尔、克里斯·奥拉、伯努瓦·施泰纳、文森特·范霍克、维贾伊·瓦苏德万和费尔南达·维加斯。克里斯·拉特纳曾创建苹果的编程语言 Swift,并曾负责特斯拉的自动驾驶团队六个月,于 2017 年 8 月加入 Google Brain 团队。拉特纳于 2020 年 1 月离开团队,加入 SiFive。
截至 2021 年,Google Brain 由杰夫·迪恩、杰弗里·辛顿和祖宾·加赫拉马尼领导。其他成员包括凯瑟琳·张、张培、伊恩·西蒙、让-菲利普·维尔、内维娜·拉齐奇、阿内利亚·安格洛娃、卢卡什·凯泽、蔡凯莉、埃里克·布雷克、栾若明、卡洛斯·里克尔梅、雨果·拉罗谢尔和大卫·哈。萨米·本吉奥于 2021 年 4 月离开团队,其职责由祖宾·加赫拉马尼接任。
Google Research 包含 Google Brain,总部位于山景城。它还在阿克拉、阿姆斯特丹、亚特兰大、北京、柏林、剑桥、以色列、洛杉矶、伦敦、蒙特利尔、慕尼黑、纽约市、巴黎、匹兹堡、普林斯顿、旧金山、西雅图、东京、多伦多和苏黎世设有分支团队。
项目
人工智能设计的加密系统
2016 年 10 月,Google Brain 设计了一项实验,以确定神经网络是否能够学习安全的对称加密。在该实验中,创建了三个神经网络:爱丽丝、鲍勃和伊芙。实验遵循生成对抗网络(GAN)的思想,目标是让爱丽丝向鲍勃发送加密消息,鲍勃能够解密,而对手伊芙则无法解密。爱丽丝和鲍勃相对于伊芙的优势在于,他们共享用于加密和解密的密钥。通过这项实验,Google Brain 证明了神经网络具备学习安全加密的能力。
图像增强
2017 年 2 月,Google Brain 提出了一种概率方法,用于将 8x8 分辨率的图片转换为 32x32 分辨率。该方法基于已有的概率模型 pixelCNN 来生成像素转换。该方案利用两个神经网络来近似实现图像的像素构成转换。第一个网络称为“条件网络”,将高分辨率图像缩小到 8x8,并尝试从原始 8x8 图像创建映射到这些更高分辨率图像的对应关系。第二个网络称为“先验网络”,利用前一个网络的映射为原始图像添加更多细节。最终生成的图像并非原始图像的高分辨率版本,而是基于其他现有高分辨率图像对 32x32 分辨率下的估计。Google Brain 的研究结果表明,神经网络具备增强图像的可能性。
谷歌翻译
Google Brain 通过采用一种新的深度学习系统,为谷歌翻译项目做出了贡献,该系统将人工神经网络与海量多语言文本数据库相结合。2016 年 9 月,谷歌神经机器翻译(GNMT)系统上线,它是一个端到端的学习框架,能够从大量示例中学习。相比之下,谷歌翻译之前的基于短语的机器翻译(PBMT)方法会逐词进行统计分析,并尝试在不同语言间匹配对应词汇,而不考虑句子中的上下文短语。GNMT 并非为目标语言中的每个单词选择替换词,而是评估整个句子中的词段,以选择更准确的翻译。与较旧的 PBMT 模型相比,GNMT 模型在翻译与人工翻译的相似度上提升了 24%,错误率降低了 60%。对于像中译英这样难度较大的翻译,GNMT 也表现出显著改进。
虽然 GNMT 的引入提升了谷歌翻译在试点语言上的翻译质量,但要为其全部 103 种语言都实现同样的改进非常困难。为了解决这个问题,Google Brain 团队开发了多语言 GNMT 系统,该系统通过支持多种语言之间的翻译,扩展了原有系统。此外,该系统还支持零样本翻译,即可以在系统从未明确学习过的两种语言之间进行翻译。谷歌宣布,谷歌翻译现在还可以直接进行语音到文本的翻译,而无需先将语音转录为文本。据 Google Brain 的研究人员称,利用神经网络可以避免这一中间步骤。为了让系统学会这一点,他们向系统提供了多种语言的音频和文本配对数据,从而实现了直接的语音到文本翻译。
传承
Google Brain 对人工智能领域产生了深远的影响。TensorFlow 至今仍是全球使用最广泛的机器学习框架之一,而 Transformer 架构则构成了许多现代大型语言模型的基础,包括由 OpenAI、Anthropic 等机构开发的模型。该团队在序列到序列模型、多头注意力和位置编码方面的研究已成为自然语言处理领域的标准方法。2023 年与 DeepMind 的合并,进一步巩固了 Google Brain 所奠定的基础,推动了谷歌在 AI 研究领域的持续发展。