塞巴斯蒂安·博尔戈是Google DeepMind的研究科学家,以在大语言模型中的缩放定律、模型架构和训练效率方面的研究而闻名。他是2022年论文《训练计算最优的大语言模型》的合著者,该论文引入了Chinchilla模型,并重塑了AI社区对模型规模和训练数据分配的处理方式。他的研究影响了后续大规模AI系统的设计,包括OpenAI和Anthropic的系统。
博尔戈的工作处于机器学习理论与实际工程的交汇点,专注于理解神经网络在不同计算预算下的经验行为。他为DeepMind的多个项目做出了贡献,涵盖语言建模到多模态系统,其研究结果在人工智能领域被广泛引用。
缩放定律与Chinchilla论文
Chinchilla论文于2022年3月发表,为训练大语言模型建立了新的范式。博尔戈及其同事,包括乔丹·霍夫曼和利翁·琼斯,证明了在给定计算预算下,最优模型规模和训练token数量大致按相同比例扩展,而非模型规模增长快于数据。这反驳了2020年卡普兰缩放定律的早期假设,后者认为模型规模应比数据增长更快。
具体而言,团队发现一个70亿参数的模型在1.4万亿token上训练,在多个基准测试上优于更大的模型,如Gopher(2800亿参数)和GPT-3(1750亿参数)。论文的实用建议,,即大多数现有模型明显训练不足,,导致了行业训练实践的转变,像OpenAI和DeepMind这样的公司在后续发布中提高了数据与参数的比例。
对模型架构和训练的贡献
除了缩放定律,博尔戈还致力于提高深度网络训练的效率和稳定性。他为多头注意力变体、位置编码和层归一化技术的研究做出了贡献,这些技术现已成为基于Transformer模型的标准。他的工作通常涉及大规模分布式训练,他帮助开发了减少内存使用和通信开销的方法。
他研究的一个显著领域是检索增强生成,其中模型在推理期间访问外部知识。博尔戈是2021年论文《通过从数万亿token中检索来改进语言模型》的合著者,该论文引入了RETRO(检索增强Transformer)模型。RETRO证明了一个75亿参数的检索模型在某些任务上可以匹配一个700亿参数的无检索模型的性能,突显了结合参数化和非参数化记忆的潜力。
对AI社区的影响
博尔戈的研究结果对更广泛的机器学习社区产生了可衡量的影响。Chinchilla论文的缩放定律现已成为学术论文和行业报告的标准参考,并影响了诸如OpenAI的GPT-4和Anthropic的Claude等模型的设计。他对计算最优训练的强调也引发了关于AI环境和经济成本的讨论,因为研究人员寻求以更少的资源实现更好的性能。
除了研究,博尔戈还参与了开源工具和数据集的发布。他为DeepMind的开源库做出了贡献,并在包括NeurIPS和ICML在内的主要会议上发表演讲,分享了关于缩放和评估的见解。他的工作常在生成式AI和更高效训练机制发展的背景下被引用。
当前工作与未来方向
截至2024年,博尔戈继续在Google DeepMind工作,专注于下一代模型架构和训练方法。他近期的项目探索降低推理计算成本的方法,如模型剪枝和量化,以及通过RLHF(基于人类反馈的强化学习)等技术改进模型与人类价值观的对齐。
他还对深度学习与神经科学的交叉感兴趣,从生物系统中汲取灵感以设计更高效的学习算法。虽然他正在进行项目的具体细节尚未公开,但他的过往记录表明,他未来的贡献将继续塑造人工智能研究的轨迹。
精选出版物
- 《训练计算最优的大语言模型》(2022年,与乔丹·霍夫曼、利翁·琼斯等人合著)
- 《通过从数万亿token中检索来改进语言模型》(2021年,与杰克·雷等人合著)
- 《使用语言模型进行问题解决的计算最优推理的经验分析》(2023年,与合著者)
这些论文是该领域被引用最多的论文之一,其方法论在学术和工业环境中被广泛采用。