Neil Houlsby 是 Google DeepMind 的研究科学家,因其对机器学习和深度学习的贡献而受到认可。他最为人所知的是作为 Vision Transformer(ViT)论文的合著者之一,该论文证明了一种最初为自然语言处理开发的纯Transformer (architecture)架构,在直接应用于图像补丁序列时,可以在图像分类中取得最先进的结果。这项工作对人工智能领域产生了重大影响,影响了后续在视觉和多模态模型方面的研究。
Houlsby 的研究兴趣涵盖神经网络、表示学习和高效训练方法。他的工作常常弥合基于Transformer (architecture)的架构与实际应用之间的差距,为开发可扩展且有效的机器学习系统做出贡献。
教育与早期职业生涯
Houlsby 在多伦多大学完成了博士学位,研究方向为贝叶斯优化和主动学习。他的博士研究专注于开发高效的超参数调整和实验设计方法,这为他后来在大规模模型训练方面的工作奠定了基础。博士毕业后,他加入 Google Brain(现为Google DeepMind的一部分)担任研究科学家,开始探索用于视觉和语言任务的新颖架构。
Vision Transformer(ViT)
2020年,Houlsby 及其在 Google Brain 的同事发表了论文《一张图像等于16x16个词:用于大规模图像识别的 Transformers》。该论文介绍了 Vision Transformer,它将图像视为固定大小补丁的序列,并使用标准的Transformer (architecture)编码器进行处理。这种方法背离了计算机视觉中卷积神经网络(CNN)的主导使用。作者表明,当在大规模数据集上进行预训练时,ViT 可以在多个图像分类基准上超越 CNN,同时训练所需的计算资源更少。ViT 架构自此成为许多现代视觉和多模态模型的基础组件,包括用于生成式人工智能系统的模型。
其他贡献
除了 ViT 之外,Houlsby 还为大模型的高效微调研究做出了贡献。他参与了关于适配器的工作,适配器是插入预训练网络中的轻量级模块,能够实现对新任务的参数高效适应。这一研究方向对于在资源受限环境中部署大型语言模型和其他大规模系统具有实际意义。Houlsby 还探索了知识蒸馏、自监督学习以及Transformer (architecture)模型的扩展行为等主题。
影响与认可
ViT 论文被广泛引用,并影响了学术研究和工业实践。它启发了许多关于视觉 transformer、混合架构以及在医学成像、自动驾驶和机器人等领域的应用的后续工作。Houlsby 的工作是人工智能领域向统一架构发展的更广泛趋势的一部分,这种架构可以使用相同的底层Transformer (architecture)框架处理多种模态,如文本、图像和音频。
当前工作
截至2025年,Houlsby 继续在Google DeepMind工作,专注于推进机器学习模型的能力。他最近的研究兴趣包括提高基于Transformer (architecture)的模型的效率和可扩展性,以及探索用于多模态理解的新架构。他还参与使 AI 系统更加稳健和可靠的努力,这对于实际部署至关重要。
Houlsby 的贡献通过受邀在主要会议和研讨会上发表演讲而得到认可,他的论文获得了大量引用。他仍然是研究社区的活跃成员,与学术界和工业界的同事合作。