乔纳森·弗兰克尔是一位专攻机器学习和深度学习的计算机科学家。他最为人所知的研究成果是神经网络稀疏性领域的工作,特别是他与迈克尔·卡宾在麻省理工学院计算机科学与人工智能实验室共同提出的彩票假说。截至2024年,他在MosaicML担任首席科学家,该公司专注于大型语言模型的高效训练与部署。
弗兰克尔的研究工作将神经网络的理论洞见与生成式人工智能的实践系统相结合。他的贡献影响了研究人员和工程师处理模型压缩及资源高效型人工智能的方式,而这一课题在整个行业中正变得日益重要。
早年生活与教育
弗兰克尔于2013年在卡内基梅隆大学完成了计算机科学的本科学习。随后,他在麻省理工学院计算机科学与人工智能实验室攻读博士学位,师从迈克尔·卡宾。他的博士研究聚焦于理解已训练神经网络的内部结构,并由此在2018年提出了彩票假说。他于2021年获得博士学位。
彩票假说
彩票假说最初在2019年与卡宾合著的一篇论文中提出,该假说认为,一个稠密神经网络中包含一个子网络、、即“中奖彩票”、、当这个子网络被单独训练时,可以达到与原网络相当甚至更优的测试准确率。该子网络通过迭代剪枝过程来识别:训练网络、剪除权重幅度最小的连接、将剩余权重重置为初始值,然后重新训练。这一假说挑战了传统观点,即剪枝主要服务于推理阶段的效率提升,并表明稀疏网络同样可以从零开始有效训练。
该研究在人工智能社区中引起了广泛关注,因为它对理解和优化神经网络都具有深远意义。它表明,深度学习中的过度参数化可能并非仅仅关乎容量,而更在于其中存在大量可行的子网络。弗兰克尔及其合作者的后续研究将该思想扩展到了更复杂的架构,包括Transformer,并探讨了学习率调度和权重初始化在寻找这些“彩票”中的作用。
在MosaicML的职业生涯
完成博士学位后,弗兰克尔加入了MosaicML,担任首席科学家。MosaicML是一家由前英特尔和英伟达工程师于2021年创立的初创公司。在MosaicML期间,他领导了高效训练方法的研究,包括开发MosaicML Streaming数据集库和Composer训练框架。他的团队专注于降低训练大型模型的成本和时间,使规模较小的组织也能使用这些模型。
2023年,MosaicML被数据分析公司Databricks以约13亿美元的价格收购。收购完成后,弗兰克尔继续担任首席科学家,负责模型优化研究以及MPT-7B和MPT-30B等开源模型的发布。这些模型以相对较少的计算资源取得了与OpenAI的GPT-3相当的性能,因而备受瞩目。
研究贡献
除了彩票假说之外,弗兰克尔还在机器学习研究的多个领域做出了贡献。他在“线性模式连通性”方面的研究探索了独立训练的模型如何在权重空间中进行插值,为深度网络的损失景观提供了洞见。他还研究了数据排序和批归一化对训练动态的影响。
弗兰克尔一直是人工智能研究可复现性的倡导者,他发布了详细的实验方案并开源了研究代码。他的论文发表于NeurIPS、ICML和ICLR等主要学术会议,并担任这些会议的审稿人。
影响与认可
弗兰克尔的研究在深度学习文献中被广泛引用,其中彩票假说论文获得了数千次引用。他的思想影响了模型压缩的实用工具,例如PyTorch和TensorFlow等框架中的剪枝库。谷歌深度思维和Anthropic等公司的行业从业者在讨论高效模型设计时也经常引用他的工作。
在更广泛的生成式人工智能背景下,弗兰克尔对效率的关注与推动大型模型民主化的努力方向一致。他在MosaicML的工作促进了开放权重模型的发展趋势,这与各大实验室的专有模型形成了鲜明对比。截至2024年,他仍活跃在该领域,经常在会议上发表演讲,并为可持续人工智能发展的公共讨论做出贡献。
精选论文
- 《彩票假说:寻找稀疏、可训练的神经网络》(与迈克尔·卡宾合著,2019年)
- 《线性模式连通性与彩票假说》(与甘达萨·萨胡等人合著,2020年)
- 《稳定彩票假说》(与甘达萨·萨胡等人合著,2020年)
- 《MosaicML:大型语言模型的高效训练》(技术报告,2023年)
参考文献
他的工作成果记录在可通过arXiv获取的学术论文和技术报告中,并在主要学术会议上发表。多家科技媒体对他进行了采访和专题报道,讨论他在高效人工智能方面的贡献。