乔丹·霍夫曼是人工智能领域的计算机科学家和研究者。他以在大语言模型的缩放定律方面的工作而闻名,尤其是在谷歌深度思维任职期间作为2022年Chinchilla论文的第一作者。霍夫曼后来加入了Anthropic,继续为先进AI系统的发展做出贡献。
霍夫曼的研究聚焦于理解深度学习中的模型规模、训练数据与计算预算之间的关系。他的工作对AI实验室在训练大型神经网络时如何分配资源产生了重大影响。
Chinchilla论文
2022年,在深度思维任职期间,霍夫曼带领团队发表了一篇关于大语言模型缩放定律的里程碑式论文。这篇题为《训练计算最优的大语言模型》的论文介绍了Chinchilla模型,这是一个拥有700亿参数、在1.4万亿个token上训练的Transformer模型。核心发现是:在给定的计算预算下,最优的模型规模和训练数据规模应大致同步扩展;此前许多模型在数据量方面存在明显训练不足的问题。这一见解促成了建议,即模型参数与训练token应按大致相等的比例增加,这一原则此后指导了许多后续大语言模型的设计。
Chinchilla论文的发现被AI行业广泛采纳,影响了包括OpenAI、Meta AI以及各学术机构在内的组织的训练实践。“Chinchilla缩放定律”一词成为高效模型训练讨论中的标准参考点。
在深度思维的职业生涯
在谷歌深度思维任职期间,霍夫曼是专注于缩放与效率的研究团队的一员。他的工作涉及通过理论分析和实证实验来研究模型容量与训练数据之间的权衡。Chinchilla研究是与深度思维的其他几位研究者合作完成的,包括杰克·克拉克和珊·卡特,不过核心的缩放分析由霍夫曼主导。
在此期间,深度思维还在开发其他大型模型,霍夫曼的贡献帮助塑造了该实验室在训练运行中的资源分配方法。
加入Anthropic
2023年,霍夫曼加入了Anthropic,这是一家由前OpenAI研究者创立的AI安全与研究公司。在Anthropic,他参与了构建大规模AI系统的工作,包括Claude系列模型。他的缩放定律专长对Anthropic的训练基础设施和模型开发策略具有重要价值。
在Anthropic,霍夫曼致力于提高大语言模型的效率和可靠性,重点关注性能与安全两方面的考量。他的工作涉及与其他研究者和工程师的紧密合作,以推动基于Transformer架构的系统的边界。
影响与认可
Chinchilla论文已被引用数千次,被认为是机器学习领域的基础性参考文献。霍夫曼的工作被公认为对如何有效训练大型模型的实际理解做出了关键贡献。他的发现促使AI实验室在数据集收集和模型规模设定方面发生了转变,许多组织现在优先考虑更大的数据集而非更大的模型架构。
霍夫曼的研究还以其方法论上的严谨性著称,将理论分析与广泛的实证验证相结合。该论文的结论已被其他研究者复制并扩展,巩固了其在深度学习研究经典中的地位。
个人生活与教育
关于霍夫曼的早期生活与教育背景,公开信息并不多。他拥有计算机科学背景,自2010年代末以来一直活跃于AI研究社区。他从深度思维到Anthropic的职业轨迹,反映了顶尖AI研究者在该领域主要实验室之间流动的更广泛趋势。
霍夫曼继续作为AI研究社区的活跃贡献者,他的工作同时影响着学术研究和工业实践。截至2024年,他仍在Anthropic任职,参与开发安全且能力强大的AI系统的持续努力。