Ben Poole est un chercheur scientifique chez Google DeepMind, où il travaille sur l'intelligence artificielle générative et l'apprentissage automatique. Il est surtout connu comme co-auteur de plusieurs articles influents en apprentissage profond, notamment DreamFusion, Imagen, et des travaux fondateurs sur les modèles génératifs basés sur les scores. Sa recherche se concentre sur le développement de méthodes pour générer des images, des vidéos et du contenu 3D de haute qualité à partir de descriptions textuelles, avec des applications dans les outils créatifs et la simulation scientifique.
Les contributions de Poole ont contribué à façonner le paysage moderne de l'IA générative, en particulier dans les domaines de la synthèse texte-image et de la génération 3D. Son travail relie les avancées théoriques en modélisation probabiliste à des solutions d'ingénierie pratiques, faisant de lui une figure éminente dans le domaine. Il a collaboré avec des chercheurs du monde académique et de l'industrie, et ses articles sont largement cités dans la communauté de l'IA.
Début de carrière et éducation
Poole a obtenu son doctorat en informatique à l'Université de Toronto, où il a été encadré par Aaron Courville et a travaillé sur l'apprentissage profond et les modèles probabilistes. Pendant ses études doctorales, il s'est concentré sur l'inférence variationnelle et la modélisation générative, publiant des articles sur des sujets tels que l'inférence variationnelle en boîte noire et les modèles d'attention neuronale. Son travail de thèse a jeté les bases de ses contributions ultérieures aux modèles génératifs basés sur les scores.
Après avoir terminé son doctorat en 2016, Poole a rejoint l'équipe de recherche d'OpenAI en tant que chercheur scientifique. Chez OpenAI, il a travaillé sur l'apprentissage par renforcement et les modèles génératifs, contribuant à des projets impliquant des réseaux de neurones et des fonctions de perte. Il est resté chez OpenAI jusqu'en 2020, période durant laquelle il a co-écrit plusieurs articles notables, notamment sur les modèles génératifs implicites et l'entraînement adversarial.
Contributions clés à la modélisation générative
En 2021, Poole a co-écrit l'article « Score-Based Generative Modeling with Critically-Damped Langevin Diffusion », qui a introduit un nouveau cadre pour les modèles génératifs basés sur les scores. Ce travail, publié à la Conférence internationale sur les représentations de l'apprentissage (ICLR), a démontré comment améliorer la qualité des échantillons et la stabilité de l'entraînement en utilisant la dynamique de Langevin avec amortissement critique. L'article est considéré comme une contribution fondatrice au domaine, influençant les recherches ultérieures sur les modèles de diffusion.
En 2022, Poole a été l'auteur principal de « DreamFusion: Text-to-3D using 2D Diffusion », un article présenté à l'ICLR 2023. DreamFusion a introduit une méthode pour générer des modèles 3D à partir de prompts textuels en exploitant un modèle de diffusion 2D pré-entraîné, tel qu'Imagen, sans nécessiter de données d'entraînement 3D. L'approche, qui utilise une technique appelée échantillonnage par distillation de scores, a été largement adoptée et a inspiré de nombreux travaux ultérieurs en génération texte-3D. L'article a reçu le prix du meilleur article à l'ICLR 2023.
Toujours en 2022, Poole a contribué à « Imagen: Photorealistic Text-to-Image Diffusion Models », un article dirigé par l'équipe de Chris Bishop chez Google Research. Imagen a démontré une synthèse texte-image de pointe en utilisant un grand modèle de langage Transformer pour encoder le texte et une cascade de modèles de diffusion pour générer les images. L'article, publié comme prépublication puis présenté à NeurIPS 2022, a atteint un photoréalisme sans précédent et a contribué à établir les modèles de diffusion comme l'approche dominante en génération texte-image.
Recherche chez Google DeepMind
Poole a rejoint Google Research en 2020, qui a ensuite fusionné avec DeepMind pour former Google DeepMind en 2023. Chez Google DeepMind, il continue de travailler sur les modèles génératifs, en se concentrant sur la mise à l'échelle des modèles de diffusion et l'amélioration de leur efficacité. Ses travaux récents incluent la recherche sur la génération vidéo, où il a exploré des méthodes pour produire des vidéos temporellement cohérentes à partir de textes ou d'images. Il a également étudié des techniques de génération contrôlable, telles que l'utilisation de mécanismes de attention croisée pour guider la sortie des modèles de diffusion.
En plus de ses recherches, Poole a contribué à des outils et des frameworks open-source. Il a participé au développement de bibliothèques pour la recherche en apprentissage automatique, y compris des implémentations de modèles de diffusion basées sur JAX. Son travail a été présenté lors de grandes conférences telles que NeurIPS, ICLR et ICML, et il a servi de relecteur et de président de section pour ces événements.
Collaborations et impact
Poole a collaboré avec un large éventail de chercheurs, notamment Jakob Uszkoreit, Llion Jones et d'autres chez Google DeepMind. Son travail avec Anima Anandkumar à Caltech sur les modèles génératifs basés sur les scores a été particulièrement influent, conduisant au développement de méthodes désormais standard dans le domaine. L'article DreamFusion, en particulier, a généré un vaste corpus de recherches sur la génération texte-3D, avec des applications dans les jeux vidéo, la réalité virtuelle et la robotique.
Ses articles ont accumulé des dizaines de milliers de citations, reflétant leur impact considérable sur la recherche académique et les applications industrielles. Les techniques qu'il a contribué à développer sont utilisées dans des produits commerciaux, tels que les outils de génération d'images et les pipelines de création d'actifs 3D. En 2024, Poole reste un chercheur actif chez Google DeepMind, continuant de repousser les limites de ce qui est possible avec l'IA générative.
Publications sélectionnées
- « Score-Based Generative Modeling with Critically-Damped Langevin Diffusion » (ICLR 2021)
- « DreamFusion: Text-to-3D using 2D Diffusion » (ICLR 2023, prix du meilleur article)
- « Imagen: Photorealistic Text-to-Image Diffusion Models » (NeurIPS 2022)
- « Deep Unsupervised Learning using Nonequilibrium Thermodynamics » (co-auteur, 2015)
- « Black-Box Variational Inference for Stochastic Differential Equations » (ICML 2016)
Ces publications mettent en évidence ses contributions aux fondements théoriques et aux applications pratiques de la modélisation générative. Son travail continue d'influencer les nouvelles générations de chercheurs en intelligence artificielle et dans des domaines connexes.