乔纳森·何是一位计算机科学家和研究员,因其对生成式人工智能的基础性贡献而闻名,特别是去噪扩散概率模型(DDPM)的开发。他于2020年发表的工作引入了一类机器学习模型,通过迭代去噪随机噪声来生成高质量图像,这种方法已成为现代生成系统的基石。何的研究影响了学术和工业应用,包括文本到图像和文本到视频生成,并已被主要人工智能研究组织广泛采用。
何获得了多伦多大学的博士学位,师从Anima Anandkumar,并隶属于向量研究所。他的博士研究专注于深度生成模型和概率推断,为后来的创新奠定了基础。2020年完成博士学业后,何加入OpenAI担任研究科学家,继续推进基于扩散的方法。他后来于2022年转至Google DeepMind,参与大规模生成模型及其应用的工作。
去噪扩散概率模型
2020年6月,何与Ajay Jain和Pieter Abbeel在arXiv上发表了论文“去噪扩散概率模型”。该论文引入了一种新的生成建模范式,建立在Sohl-Dickstein等人(2015年)和Song与Ermon(2019年)的早期工作之上。关键创新在于一种简化扩散过程的训练目标,使用加权变分下界和预测噪声与实际噪声之间的简单均方误差损失。这种方法实现了稳定训练并产生高质量样本,在CIFAR-10和CelebA-HQ等图像生成基准上取得了最先进的结果。
DDPM框架分两个阶段运行:一个前向过程,在固定数量的时间步内逐步向数据添加高斯噪声,以及一个反向过程,学习去噪。该模型通常实现为带有U-Net、残差网络块和注意力机制的架构,在每个步骤预测噪声。何的工作表明,这种简单公式可以生成与生成对抗网络(GAN)相媲美的图像,同时提供更好的训练稳定性和模式覆盖。
对生成式人工智能的影响
DDPM催化了基于扩散的研究的快速扩展。2021年,何合著了“扩散模型在图像合成上超越GAN”,表明扩散模型在样本质量上可以超越GAN,部分通过引入分类器引导实现。这项工作与OpenAI同事合作完成,确立了扩散模型作为高保真图像生成领先方法的地位。随后的发展,如潜在扩散模型和文本条件扩散,促成了Stable Diffusion和DALL-E 2等系统的创建,这些系统在创意和商业应用中广泛使用。
何的贡献扩展到视频生成。2022年,他合著了“视频扩散模型”,将扩散框架适应于生成连贯的视频序列。这项工作影响了后来的视频生成系统,包括在Google DeepMind和其他实验室开发的系统。扩散模型的可扩展性,结合神经网络架构和数据增强的进步,使其成为生成式人工智能的主导力量,与基于大型语言模型的多模态内容创作方法相抗衡。
研究理念与合作
何的研究强调简洁性和实证有效性。他的DDPM论文以其清晰、可复现的方法论而著称,促进了研究社区的快速采用。他与著名研究人员合作,包括在Google DeepMind的Jakob Uszkoreit和Llion Jones,参与与图像和视频合成相关的项目。他的方法通常涉及利用成熟技术,如Adam优化器和学习率调度,同时专注于产生实际收益的架构创新。
在OpenAI,何参与了引导扩散模型的开发,这些模型使用分类器引导将生成导向所需属性。这项工作于2021年发表,展示了扩散模型如何通过类标签或文本提示进行条件化,为文本到图像系统铺平了道路。他对扩散模型训练动态的见解,包括噪声调度和损失加权的作用,已为整个领域的后续研究提供了信息。
认可与影响
DDPM论文已成为机器学习领域被引用最多的作品之一,在几年内获得数千次引用。何的工作获得了奖项认可,包括2021年NeurIPS最佳论文奖,获奖作品为“扩散模型在图像合成上超越GAN”。他被邀请在主要会议和研讨会上发言,他的方法在高级生成建模课程中教授。“扩散模型”一词本身已成为人工智能词汇中的标准术语,何被广泛认为是这一范式的关键架构师。
后期职业与当前工作
截至2024年,何继续在Google DeepMind工作,专注于将扩散模型扩展到新领域,包括音频和3D生成。他最近的研究探索了扩散模型与强化学习和基于人工智能反馈的强化学习的交集,旨在提高样本质量和与人类偏好的对齐。他还研究了扩散模型在科学应用中的使用,如蛋白质结构预测,与巴巴原子研究中心和三星研究院等团体合作。何的持续贡献确保扩散模型保持在生成式人工智能研究的前沿,其影响涵盖从艺术和娱乐到药物发现和机器人技术等领域。
尽管领域快速演变,何关于DDPM的基础工作继续支撑许多最先进的系统。他将复杂思想提炼为实用算法的能力,使他成为人工智能历史上的关键人物,他的研究轨迹反映了现代机器学习的跨学科性质,连接了计算机视觉、优化和概率建模。