纳曼·戈亚尔是一位计算机科学家和人工智能领域的研究者。他以共同撰写BART而闻名,这是一种用于预训练序列到序列模型的去噪自编码器,并因其对Fairseq的贡献而受到关注,Fairseq是一个被广泛使用的开源深度学习库。他的工作影响了现代大语言模型的发展。
戈亚尔的研究属于机器学习领域,尤其涉及序列到序列学习和预训练相关方向。他的贡献连接了基础架构与训练大型模型的实用工具。
BART与预训练
戈亚尔是2019年发布BART的团队一员。BART架构结合了双向编码器和自回归解码器,使用去噪目标对损坏文本进行预训练。这种方法使模型能够在摘要和翻译等任务中生成高质量输出。该论文介绍了参数规模高达4亿的模型,并在多个基准测试中取得了最先进的结果,包括斯坦福问答数据集和GLUE。
BART是预训练领域的重要一步,因为它统一并扩展了BERT和GPT等早期模型的思想。BART不仅使用标准语言模型目标,还通过多种噪声函数(包括词元掩码和顺序置换)对文本进行损坏。戈亚尔的作用促进了该方法的实证成功,证明了序列到序列预训练可以与纯编码器或解码器模型同样有效。
Fairseq工具包
与此同时,戈亚尔为Fairseq做出了贡献,这是一个由Meta AI(前身为Facebook AI研究)开发的软件库。Fairseq支持训练用于翻译、摘要和其他序列任务的模型。它使用PyTorch,并为Transformer和其他架构提供高效实现。该库已开源,并在学术界和其他实验室中被广泛采用。
Fairseq引入了权重初始化、层归一化和学习率调度等技术,使深度网络的训练更加稳定。戈亚尔参与Fairseq的工作帮助了工程和实验方面,使其成为研究的标准工具。
对模型扩展的贡献
在相关工作中,戈亚尔探讨了梯度裁剪和top-p采样等问题。他还参与了关于扩展和大型批量训练的研究,这影响了从业者进行预训练的方式。例如,2020年初关于神经语言模型扩展定律的工作表明,计算量、数据和参数需要保持平衡;这一研究方向影响了大型模型的设计。
戈亚尔也是通过社区发布自然问题数据集的研究者之一,尽管其归属由其他研究者管理。然而,他的许多出版物后来成为深度学习文献中的引用。
影响
他在BART和Fairseq上的工作为条件生成建立了基线。这些模型还为文本到语音的设计和更高效训练的研究提供了参考。
其遗产在后续发布和未公开的训练中得以延续。截至2024年,BART已成为多个库中的标准模型。戈亚尔的贡献通过引用次数和顶级会议的参与得到了认可。他还与杨立昆和Mikel Artetxe等研究者进行了合作。