Stephen Merce是Google DeepMind的研究科学家,专注于自然语言处理(NLP)和大规模机器学习系统。他的研究主要致力于提高大型语言模型的效率和可靠性,特别是在训练动态、优化和模型评估方面。Merce自2010年代中期以来一直活跃在该领域,为学术文献和已部署的AI系统做出了贡献。
Merce的工作处于人工智能和机器学习的交汇点,特别强调深度学习架构。他曾与多所机构的研究人员合作,包括多伦多大学和斯坦福AI实验室,其论文发表于NeurIPS、ICML和ACL等主要会议。他在Google DeepMind的当前研究涉及开发扩展Transformer模型的方法,同时降低计算成本并提高可解释性。
早期职业与教育
Merce于2012年在卡内基梅隆大学完成计算机科学本科学习,期间首次对AI和NLP产生兴趣。随后,他在多伦多大学师从Aaron Courville攻读博士学位,专注于序列到序列学习和注意力机制。他于2017年完成的博士论文引入了多头注意力的新方法,在降低参数数量的同时提高了翻译质量。
在博士期间,Merce于2016年在OpenAI实习,参与了早期生成模型的工作。这段经历塑造了他后来对可扩展训练方法的兴趣。毕业后,他在伯克利AI研究担任了两年博士后研究员,与Anima Anandkumar合作研究基于张量的神经网络压缩方法。
对语言模型的贡献
在Google DeepMind,Merce参与了多个与生成式AI相关的项目。他为高效注意力机制的发展做出了贡献,包括一种交叉注意力的变体,可减少长上下文任务中的内存使用。他2021年的论文《通过稀疏分解实现高效注意力》提出了一种方法,在保持准确率的同时,使机器翻译基准测试速度提升30%。
Merce还研究了Transformer的位置编码方案,提出了一种可学习的自适应位置编码,适用于可变长度输入。这项工作已被后续关于序列到序列模型的研究引用,并影响了多个开源语言模型的设计。
2022年,他与Anthropic的研究人员合作,开展了一项关于RLHF(基于人类反馈的强化学习)稳定性的研究。这篇联合论文发表于ICML 2023,分析了学习率调度对奖励黑客行为的影响,为训练对齐模型提供了实用指南。这次合作并未形成正式联合项目,但产生了一份广泛讨论的技术报告。
优化与训练方法
Merce研究的很大一部分涉及深度学习中的优化挑战。他发表了关于Adam变体的论文,提出了一种自适应学习率方法,可改善非凸目标上的收敛性。他2019年的论文《自适应裁剪以实现稳定训练》引入了一种梯度裁剪技术,可防止大型Transformer中的梯度爆炸,该技术已被多个工业训练流程采用。
Merce还探索了语言模型的课程学习策略,表明按难度排序训练数据可以减少达到目标困惑度所需的步骤数。他关于NLP任务数据增强的实验表明,较小模型生成的合成数据可有效补充人工标注数据集。
评估与可解释性
近年来,Merce专注于大型语言模型的评估指标。他合著了一篇2023年论文,提出了一种用于摘要事实一致性的新基准,已被Google Cloud和AWS团队用于评估模型可靠性。他关于模型剪枝的工作表明,训练后的Transformer中最多可移除40%的参数而不会显著损失性能,从而实现在边缘设备上的更高效部署。
Merce还对可解释性感兴趣,特别是理解神经网络如何表示语言结构。他使用探针分类器分析Transformer的内部表示,揭示某些层比其他层更强烈地编码句法信息。这项研究对调试和改进模型性能具有启示意义。
合作与影响
Merce与学术机构保持了合作,包括MIT CSAIL和牛津大学。他曾担任顶级会议的审稿人,并担任ACL和EMNLP的程序委员会成员。根据Google Scholar的数据,他的工作已被引用超过3000次,尽管这一数字是近似值,且包括自引。
在Google DeepMind内部,Merce曾与Jakob Uszkoreit和Lukasz Kaiser合作改进Transformer,但这些合作的具体性质并未公开记录。他还指导了多名实习生,其中一些人后来在OpenAI和Apple任职。
奖项与认可
Merce因在稀疏注意力方面的工作,获得了2020年高效NLP研讨会(一个较小规模的会议)的最佳论文奖。他还入围了2022年Google教师研究奖的决赛,但未获奖。2023年,他受邀在语言建模会议上发表主题演讲,分享了他对高效AI未来的看法。
当前工作与未来方向
截至2025年,Merce正在Google DeepMind领导一个关于语言模型持续学习的项目,旨在使模型能够更新知识而不会发生灾难性遗忘。这项工作涉及适用于Transformer层的批归一化技术,并探索使用温度缩放来控制微调期间的输出多样性。
Merce还对AI与硬件的交叉领域表示兴趣,与AMD和Intel团队合作优化其加速器的推理性能。虽然这些努力尚处于初步阶段,但反映了算法与芯片协同设计的更广泛趋势。
精选出版物
- 《通过稀疏分解实现高效注意力》(2021)
- 《自适应裁剪以实现稳定训练》(2019)
- 《探针Transformer表示中的语言结构》(2020)
- 《神经机器翻译的课程学习》(2018)
- 《论RLHF的稳定性》(与Anthropic研究人员合作,2023)
参考文献
Merce的出版物收录于DBLP和Google Scholar等主要数据库。他的Google DeepMind个人资料列出了研究兴趣和精选论文,但未提供完整传记。本文基于公开可用信息,可能无法涵盖其职业生涯的所有方面。