尹泰特·李是一位计算机科学家和研究者,专注于优化算法、机器学习和理论计算机科学。他是华盛顿大学的副教授,同时也是谷歌深度思维的高级研究员。李在人工智能社区中因共同撰写具有影响力的《奇奇拉》论文而声名鹊起,该论文确立了高效训练大型语言模型的缩放定律。
李的研究将理论优化与实际机器学习相结合,在更快线性规划算法、凸优化和神经网络训练方面做出了贡献。他的工作对计算理论和大型人工智能系统的部署都具有重要意义。
早期职业与教育
李在国立台湾大学完成了本科学习,期间对算法和复杂性理论产生了兴趣。随后,他在麻省理工学院(MIT)攻读计算机科学博士学位,师从乔纳森·凯尔纳。他的博士研究聚焦于图问题和优化的近线性时间算法,并因理论突破而获得认可。
毕业后,李担任了博士后职位,后来加入华盛顿大学任教。他还开始了与谷歌研究人员的长期合作,这最终促成了他在Google DeepMind的角色。
优化算法
李工作的一个重要部分集中在提高基本优化方法的效率上。他共同开发了更快的线性规划求解算法,这些算法广泛应用于物流、金融和机器学习中。他的方法通常将连续优化技术与组合洞察相结合,为以前在大规模下被认为难以处理的问题实现了接近最优的时间复杂度。
李还为加速梯度方法的发展做出了贡献,这些方法对训练Deep learning模型至关重要。这些方法减少了收敛所需的迭代次数,使得在大型数据集上训练更大的Neural network架构变得可行。
奇奇拉论文与缩放定律
2022年,李与来自DeepMind和University of Toronto的研究人员共同撰写了论文《训练计算最优的大型语言模型》,通常称为奇奇拉论文。该研究解决了一个关键问题:在给定计算预算下,应使用多少参数和多少数据来训练Large language model。作者发现,大多数现有模型存在过度参数化和训练不足的问题,并提出模型大小和训练数据应大致等比例扩展。
论文介绍了奇奇拉模型,这是一个拥有700亿参数、在1.4万亿个令牌上训练的模型,在各种基准测试中优于像Gopher和GPT-3这样更大的模型。这一发现重塑了人工智能实验室设计模型的方式,影响了OpenAI、Anthropic及其他组织的后续发布。论文中推导出的缩放定律已成为Generative AI研究中分配计算资源的标准参考。
对机器学习系统的贡献
除了理论工作,李还为训练和推理的实际系统做出了贡献。他研究了提高Transformer (architecture)模型效率的优化技术,包括减少内存使用和加速收敛的方法。他对自适应学习率和预条件化的研究为大规模训练运行中使用的优化器设计提供了参考。
李与行业研究人员的合作也聚焦于使Machine learning更加普及。他探索了降低微调和推理计算成本的方法,这对于在资源受限设备上部署模型至关重要。他的工作经常出现在NeurIPS、ICML和STOC等顶级会议上。
认可与影响
李因其研究获得了多项奖项,包括斯隆研究奖学金和美国国家科学基金会职业奖。他的论文被引用数千次,反映了它们对理论计算机科学和应用人工智能的影响。他经常受邀在学术和行业会议上演讲,讨论优化与深度学习的交叉领域。
截至2020年代中期,李继续在华盛顿大学和Google DeepMind工作,指导学生并合作开展与高效人工智能相关的项目。他在学术界和工业界的双重角色使他能够将理论进展转化为实用工具,使他成为可扩展Artificial intelligence系统持续发展的关键人物。
精选出版物
- 《训练计算最优的大型语言模型》(2022年),,介绍了奇奇拉缩放定律。
- 《对称对角占优线性系统的预条件化和求解的近线性时间算法》,,快速图算法的基础论文。
- 《凸优化的加速方法》,,为基于梯度的方法的更快收敛率做出了贡献。
他的发表记录涵盖理论场所和应用机器学习会议,展示了将严谨数学与现实人工智能挑战相结合的罕见能力。