那曼·戈亚尔

译自英文

Naman Goyal是一位计算机科学家,以共同撰写BART和为Fairseq做出贡献而闻名,推动了自然语言处理中序列到序列预训练的发展。

纳曼·戈亚尔是一位计算机科学家和人工智能领域的研究者。他以共同撰写BART而闻名,这是一种用于预训练序列到序列模型的去噪自编码器,并因其对Fairseq的贡献而受到关注,Fairseq是一个被广泛使用的开源深度学习库。他的工作影响了现代大语言模型的发展。

戈亚尔的研究属于机器学习领域,尤其涉及序列到序列学习和预训练相关方向。他的贡献连接了基础架构与训练大型模型的实用工具。

BART与预训练

戈亚尔是2019年发布BART的团队一员。BART架构结合了双向编码器和自回归解码器,使用去噪目标对损坏文本进行预训练。这种方法使模型能够在摘要和翻译等任务中生成高质量输出。该论文介绍了参数规模高达4亿的模型,并在多个基准测试中取得了最先进的结果,包括斯坦福问答数据集和GLUE。

BART是预训练领域的重要一步,因为它统一并扩展了BERT和GPT等早期模型的思想。BART不仅使用标准语言模型目标,还通过多种噪声函数(包括词元掩码和顺序置换)对文本进行损坏。戈亚尔的作用促进了该方法的实证成功,证明了序列到序列预训练可以与纯编码器或解码器模型同样有效。

Fairseq工具包

与此同时,戈亚尔为Fairseq做出了贡献,这是一个由Meta AI(前身为Facebook AI研究)开发的软件库。Fairseq支持训练用于翻译、摘要和其他序列任务的模型。它使用PyTorch,并为Transformer和其他架构提供高效实现。该库已开源,并在学术界和其他实验室中被广泛采用。

Fairseq引入了权重初始化层归一化学习率调度等技术,使深度网络的训练更加稳定。戈亚尔参与Fairseq的工作帮助了工程和实验方面,使其成为研究的标准工具。

对模型扩展的贡献

在相关工作中,戈亚尔探讨了梯度裁剪top-p采样等问题。他还参与了关于扩展和大型批量训练的研究,这影响了从业者进行预训练的方式。例如,2020年初关于神经语言模型扩展定律的工作表明,计算量、数据和参数需要保持平衡;这一研究方向影响了大型模型的设计。

戈亚尔也是通过社区发布自然问题数据集的研究者之一,尽管其归属由其他研究者管理。然而,他的许多出版物后来成为深度学习文献中的引用。

影响

他在BART和Fairseq上的工作为条件生成建立了基线。这些模型还为文本到语音的设计和更高效训练的研究提供了参考。

其遗产在后续发布和未公开的训练中得以延续。截至2024年,BART已成为多个库中的标准模型。戈亚尔的贡献通过引用次数和顶级会议的参与得到了认可。他还与杨立昆和Mikel Artetxe等研究者进行了合作。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-science·deep-learning·natural-language-processing·researchers
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史