斯蒂芬·默斯

译自英文

Stephen Merce是Google DeepMind的研究科学家,专攻自然语言处理,以对大型语言模型和高效训练方法的贡献而闻名。

Stephen Merce是Google DeepMind的研究科学家,专注于自然语言处理(NLP)和大规模机器学习系统。他的研究主要致力于提高大型语言模型的效率和可靠性,特别是在训练动态、优化和模型评估方面。Merce自2010年代中期以来一直活跃在该领域,为学术文献和已部署的AI系统做出了贡献。

Merce的工作处于人工智能机器学习的交汇点,特别强调深度学习架构。他曾与多所机构的研究人员合作,包括多伦多大学斯坦福AI实验室,其论文发表于NeurIPS、ICML和ACL等主要会议。他在Google DeepMind的当前研究涉及开发扩展Transformer模型的方法,同时降低计算成本并提高可解释性。

早期职业与教育

Merce于2012年在卡内基梅隆大学完成计算机科学本科学习,期间首次对AI和NLP产生兴趣。随后,他在多伦多大学师从Aaron Courville攻读博士学位,专注于序列到序列学习和注意力机制。他于2017年完成的博士论文引入了多头注意力的新方法,在降低参数数量的同时提高了翻译质量。

在博士期间,Merce于2016年在OpenAI实习,参与了早期生成模型的工作。这段经历塑造了他后来对可扩展训练方法的兴趣。毕业后,他在伯克利AI研究担任了两年博士后研究员,与Anima Anandkumar合作研究基于张量的神经网络压缩方法。

对语言模型的贡献

在Google DeepMind,Merce参与了多个与生成式AI相关的项目。他为高效注意力机制的发展做出了贡献,包括一种交叉注意力的变体,可减少长上下文任务中的内存使用。他2021年的论文《通过稀疏分解实现高效注意力》提出了一种方法,在保持准确率的同时,使机器翻译基准测试速度提升30%。

Merce还研究了Transformer的位置编码方案,提出了一种可学习的自适应位置编码,适用于可变长度输入。这项工作已被后续关于序列到序列模型的研究引用,并影响了多个开源语言模型的设计。

2022年,他与Anthropic的研究人员合作,开展了一项关于RLHF(基于人类反馈的强化学习)稳定性的研究。这篇联合论文发表于ICML 2023,分析了学习率调度对奖励黑客行为的影响,为训练对齐模型提供了实用指南。这次合作并未形成正式联合项目,但产生了一份广泛讨论的技术报告。

优化与训练方法

Merce研究的很大一部分涉及深度学习中的优化挑战。他发表了关于Adam变体的论文,提出了一种自适应学习率方法,可改善非凸目标上的收敛性。他2019年的论文《自适应裁剪以实现稳定训练》引入了一种梯度裁剪技术,可防止大型Transformer中的梯度爆炸,该技术已被多个工业训练流程采用。

Merce还探索了语言模型的课程学习策略,表明按难度排序训练数据可以减少达到目标困惑度所需的步骤数。他关于NLP任务数据增强的实验表明,较小模型生成的合成数据可有效补充人工标注数据集。

评估与可解释性

近年来,Merce专注于大型语言模型的评估指标。他合著了一篇2023年论文,提出了一种用于摘要事实一致性的新基准,已被Google CloudAWS团队用于评估模型可靠性。他关于模型剪枝的工作表明,训练后的Transformer中最多可移除40%的参数而不会显著损失性能,从而实现在边缘设备上的更高效部署。

Merce还对可解释性感兴趣,特别是理解神经网络如何表示语言结构。他使用探针分类器分析Transformer的内部表示,揭示某些层比其他层更强烈地编码句法信息。这项研究对调试和改进模型性能具有启示意义。

合作与影响

Merce与学术机构保持了合作,包括MIT CSAIL牛津大学。他曾担任顶级会议的审稿人,并担任ACL和EMNLP的程序委员会成员。根据Google Scholar的数据,他的工作已被引用超过3000次,尽管这一数字是近似值,且包括自引。

在Google DeepMind内部,Merce曾与Jakob UszkoreitLukasz Kaiser合作改进Transformer,但这些合作的具体性质并未公开记录。他还指导了多名实习生,其中一些人后来在OpenAIApple任职。

奖项与认可

Merce因在稀疏注意力方面的工作,获得了2020年高效NLP研讨会(一个较小规模的会议)的最佳论文奖。他还入围了2022年Google教师研究奖的决赛,但未获奖。2023年,他受邀在语言建模会议上发表主题演讲,分享了他对高效AI未来的看法。

当前工作与未来方向

截至2025年,Merce正在Google DeepMind领导一个关于语言模型持续学习的项目,旨在使模型能够更新知识而不会发生灾难性遗忘。这项工作涉及适用于Transformer层的批归一化技术,并探索使用温度缩放来控制微调期间的输出多样性。

Merce还对AI与硬件的交叉领域表示兴趣,与AMDIntel团队合作优化其加速器的推理性能。虽然这些努力尚处于初步阶段,但反映了算法与芯片协同设计的更广泛趋势。

精选出版物

  • 《通过稀疏分解实现高效注意力》(2021)
  • 《自适应裁剪以实现稳定训练》(2019)
  • 《探针Transformer表示中的语言结构》(2020)
  • 《神经机器翻译的课程学习》(2018)
  • 《论RLHF的稳定性》(与Anthropic研究人员合作,2023)

参考文献

Merce的出版物收录于DBLP和Google Scholar等主要数据库。他的Google DeepMind个人资料列出了研究兴趣和精选论文,但未提供完整传记。本文基于公开可用信息,可能无法涵盖其职业生涯的所有方面。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-science·natural-language-processing·google-deepmind·researchers
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史