Neil Houlsby est un chercheur scientifique chez Google DeepMind, reconnu pour ses contributions à l'apprentissage automatique et à l'apprentissage profond. Il est surtout connu comme co-auteur de l'article sur le Vision Transformer (ViT), qui a démontré qu'une architecture transformer pure, initialement développée pour le traitement du langage naturel, peut atteindre des résultats de pointe en classification d'images lorsqu'elle est appliquée directement à des séquences de patches d'images. Ces travaux ont eu un impact significatif sur le domaine de l'intelligence artificielle, influençant les recherches ultérieures sur les modèles de vision et multimodaux.
Les intérêts de recherche de Houlsby couvrent les réseaux de neurones, l'apprentissage de représentations et les méthodes d'entraînement efficaces. Son travail comble souvent le fossé entre les architectures basées sur transformer et les applications pratiques, contribuant au développement de systèmes d'apprentissage automatique évolutifs et efficaces.
Éducation et début de carrière
Houlsby a obtenu son doctorat à l'Université de Toronto, où il a travaillé sur l'optimisation bayésienne et l'apprentissage actif. Ses recherches doctorales se sont concentrées sur le développement de méthodes efficaces pour le réglage des hyperparamètres et la conception expérimentale, ce qui a jeté les bases de ses travaux ultérieurs sur l'entraînement de modèles à grande échelle. Après son doctorat, il a rejoint Google Brain (maintenant partie de Google DeepMind) en tant que chercheur scientifique, où il a commencé à explorer de nouvelles architectures pour les tâches de vision et de langage.
Vision Transformer (ViT)
En 2020, Houlsby et ses collègues de Google Brain ont publié l'article « An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale ». L'article a introduit le Vision Transformer, qui traite une image comme une séquence de patches de taille fixe et les traite avec un encodeur transformer standard. Cette approche s'écarte de l'utilisation dominante des réseaux de neurones convolutionnels (CNN) en vision par ordinateur. Les auteurs ont montré que, lorsqu'il est pré-entraîné sur de grands ensembles de données, ViT peut surpasser les CNN sur plusieurs références de classification d'images, tout en nécessitant moins de ressources computationnelles pour l'entraînement. L'architecture ViT est depuis devenue un composant fondamental dans de nombreux modèles de vision et multimodaux modernes, y compris ceux utilisés dans les systèmes de IA générative.
Autres contributions
Au-delà de ViT, Houlsby a contribué à la recherche sur le fine-tuning efficace de grands modèles. Il a participé à des travaux sur les adaptateurs, qui sont des modules légers insérés dans des réseaux pré-entraînés pour permettre une adaptation paramétrique efficace à de nouvelles tâches. Cette ligne de recherche a des implications pratiques pour le déploiement de grands modèles de langage et d'autres systèmes à grande échelle dans des environnements à ressources limitées. Houlsby a également exploré des sujets tels que la distillation de connaissances, l'apprentissage auto-supervisé et le comportement de mise à l'échelle des modèles transformer.
Impact et reconnaissance
L'article sur ViT a été largement cité et a influencé à la fois la recherche académique et la pratique industrielle. Il a inspiré de nombreux travaux ultérieurs sur les vision transformers, les architectures hybrides et les applications dans des domaines tels que l'imagerie médicale, la conduite autonome et la robotique. Les travaux de Houlsby s'inscrivent dans une tendance plus large de l'intelligence artificielle vers des architectures unifiées capables de traiter plusieurs modalités, telles que le texte, les images et l'audio, en utilisant le même cadre transformer sous-jacent.
Travaux actuels
À partir de 2025, Houlsby continue de travailler chez Google DeepMind, où il se concentre sur l'avancement des capacités des modèles d'apprentissage automatique. Ses intérêts de recherche récents incluent l'amélioration de l'efficacité et de l'évolutivité des modèles basés sur transformer, ainsi que l'exploration de nouvelles architectures pour la compréhension multimodale. Il est également impliqué dans des efforts pour rendre les systèmes d'IA plus robustes et fiables, ce qui est essentiel pour les déploiements dans le monde réel.
Les contributions de Houlsby ont été reconnues par des invitations à prendre la parole lors de grandes conférences et ateliers, et ses articles ont reçu de nombreuses citations. Il reste un membre actif de la communauté de recherche, collaborant avec des collègues du monde académique et de l'industrie.