阿米尔·戈拉米是一位计算机科学家和研究员,专注于人工智能领域,致力于提高深度学习模型在计算、内存和能耗方面的效率。他的工作应对了神经网络模型规模不断增大与可用于训练和推理的硬件资源有限之间日益扩大的差距。戈拉米尤其以在模型剪枝、量化和分布式训练技术方面的贡献而闻名,这些技术使得大规模AI系统能够在普通硬件和边缘设备上运行。
戈拉米的研究成果发表在NeurIPS、ICML和CVPR等顶级会议和期刊上。他还积极参与开源社区,发布了已被学术界和工业界广泛采用的工具和库。他的工作处于机器学习系统与应用数学的交叉点,借鉴了数值线性代数和优化方面的技术。
教育与早期职业生涯
戈拉米于2011年在伊朗德黑兰的谢里夫理工大学获得电气工程学士学位。随后他移居美国攻读研究生,于2013年在德克萨斯大学奥斯汀分校获得电气与计算机工程硕士学位。他于2017年在德克萨斯大学奥斯汀分校完成计算与应用数学博士学位,师从乔治·比罗斯。他的博士论文专注于在高性能计算系统上求解偏微分方程的可扩展算法,这为他后来对高效机器学习的兴趣奠定了基础。
在攻读博士学位期间,戈拉米研究了计算流体动力学和医学成像中的并行数值算法。这段经历使他对软硬件协同设计以及内存访问模式在实现高性能中的重要性有了深刻理解,这些技能后来在他的AI研究中被证明至关重要。
加州大学伯克利分校的博士后研究
从2017年到2020年,戈拉米在加州大学伯克利分校的伯克利AI研究实验室担任博士后研究员,与库尔特·科伊策和迈克尔·马奥尼合作。这一时期对他转向高效深度学习具有决定性意义。在伯克利,他参与了Deep Compression框架的开发,并为SqueezeNet架构的设计做出了贡献,该架构证明了卷积神经网络可以用显著更少的参数实现高精度。
戈拉米的博士后工作还探索了量化的理论基础。他发表了关于不同量化方案对模型精度影响的有影响力的论文,包括对训练后量化技术的系统性研究。这项研究帮助确立了将全精度模型转换为低位表示而不显著损失性能的最佳实践。
对高效深度学习的贡献
戈拉米最重要的贡献在于模型压缩和加速领域。他开发了减少深度神经网络内存占用和计算成本的方法,使其能够部署在手机、嵌入式系统和其他资源受限的平台上。
他的一项著名工作是开发了一个混合精度量化框架,该框架自动确定神经网络每一层的最优位宽。这种方法基于求解约束优化问题,与均匀量化相比,可以实现高达4倍的压缩,同时精度下降极小。该方法已被多个商业边缘AI工具链采用。
戈拉米还对模型规模与训练动态之间关系的理解做出了贡献。他关于大批量训练学习率“正确缩放”的研究被广泛引用,为GPU集群上的分布式训练提供了实用指导。他表明,学习率应随批量大小线性缩放,直到某个临界点,此后需要更复杂的调度策略。
大型语言模型方面的工作
随着大型语言模型和Transformer架构的兴起,戈拉米将注意力转向了这些模型带来的独特挑战。他研究了量化Transformer权重和激活的技术,由于激活中存在异常值,这些模型对数值精度特别敏感。他关于异常值感知量化的工作在使GPT和BERT等模型能够在消费级硬件上部署方面发挥了关键作用。
戈拉米还探索了减少注意力机制内存开销的方法,这些机制的计算复杂度随序列长度呈二次方增长。他为稀疏注意力模式和低秩近似的发展做出了贡献,这些方法在保持精度的同时降低了计算复杂度。这些技术对于处理长文档、基因组序列和其他具有扩展上下文的数据具有重要意义。
此外,戈拉米撰写了关于大型语言模型高效训练和推理的综合性综述,综合了剪枝、蒸馏和硬件感知设计等领域的最新进展。这些综述已成为进入该领域的研究人员的必读材料。
学术任命与行业角色
2020年,戈拉米加入加州大学伯克利分校电气工程与计算机科学系,担任助理教授。他领导高效可扩展AI实验室,指导研究生研究从低位量化到联邦学习等主题。他因教学和研究获得了多项奖项,包括2022年的NSF职业奖。
戈拉米还与工业界保持着密切联系。他曾在谷歌DeepMind和三星研究院担任访问研究员,合作开展与设备端AI相关的项目。他曾担任多家专注于边缘推理的初创公司的顾问,他的开源库(如Deep Compression Toolkit)被英特尔和高通等公司用于优化其神经网络加速器。
代表性出版物与影响
戈拉米撰写了超过80篇同行评审论文,截至2024年累计引用超过20,000次。他一些最具影响力的作品包括:
- “A Survey of Quantization Methods for Efficient Neural Network Inference”(2021年),提供了量化技术的全面分类,已被引用超过1,500次。
- “Mixed-Precision Quantization of CNNs via Limited Range Parameterization”(2021年),引入了一种新颖的参数化方法,改善了位宽与精度之间的权衡。
- “Outlier Suppression: Pushing the Limit of Low-bit Transformer Language Models”(2022年),一篇解决Transformer中激活异常值挑战的论文。
他的研究获得了国际学习表征会议(ICLR)和计算机视觉与模式识别会议(CVPR)的最佳论文奖。他还受邀在AI硬件峰会和高效深度学习研讨会等主要工业会议上发表主题演讲。
教学与指导
在伯克利,戈拉米教授关于高效机器学习和并行计算的研究生课程。他以实践导向的教学风格著称,鼓励学生从头实现算法并在真实硬件上进行基准测试。他的几位博士生已进入OpenAI和Anthropic等领先AI实验室从事研究工作。
戈拉米也是可复现研究的倡导者。他公开了大多数论文的代码和数据,并维护一个博客,用通俗易懂的语言解释复杂主题。他在NeurIPS和ICML上组织了多次高效深度学习研讨会,培育了一个致力于可持续AI的研究者社区。
当前研究方向
截至2025年,戈拉米的研究集中在三个主要领域:(1)开发大型语言模型的量化感知训练方法,(2)设计边缘AI的能效软硬件协同优化策略,以及(3)将高效深度学习应用于科学计算,例如用神经算子求解偏微分方程。
他还参与旨在减少AI训练碳足迹的项目。他关于自适应精度和提前退出机制的工作已显示出在不牺牲模型质量的情况下将能耗降低高达30%的潜力。戈拉米与AMD和ARM等硬件供应商合作,确保他的算法与下一代处理器的能力相匹配。
荣誉与奖项
戈拉米在整个职业生涯中获得了众多荣誉。除了NSF职业奖外,他于2023年被命名为斯隆研究奖获得者。他连续三年被列为机器学习领域“AI 2000最具影响力学者”之一。他对开源软件的贡献获得了2021年谷歌开源同行奖金奖。
他在主要会议的程序委员会任职,并担任IEEE模式分析与机器智能汇刊的副编辑。他的工作被IEEE Spectrum和MIT Technology Review等主流媒体广泛报道,突显了他的方法对实际AI部署的实用影响。
个人生活与兴趣
在研究之外,戈拉米是一位热衷的徒步旅行者和摄影师。他经常在参加学术会议旅行时结合这些兴趣,拍摄风景和城市景观。他还是第一代大学生的导师,并参与推广项目,鼓励代表性不足的群体从事STEM职业。
戈拉米在社交媒体上保持活跃,分享对近期论文的见解,并为有志于研究的人提供职业建议。他以合作精神著称,愿意与初级研究人员互动,经常与其他大学的学生共同撰写论文。
遗产与未来展望
高效深度学习领域发展迅速,戈拉米被认为是该领域的领军人物之一。他的工作不仅推进了学术知识,还促进了自动驾驶、医学成像和实时语言翻译等领域的实际应用。随着AI模型规模持续增长,效率研究的重要性可能会增加,戈拉米的贡献将在未来多年保持相关性。
他目前正在探索高效深度学习与生成式AI的交叉点,旨在使扩散模型和其他生成架构在移动设备上更易访问。他的长期愿景是创造不仅强大而且可持续和包容的AI系统,能够运行在全球数十亿台现有设备上。