Jonathan Ho est un chercheur en informatique reconnu pour ses contributions fondatrices à l'intelligence artificielle générative, en particulier le développement des modèles de diffusion par débruitage (DDPM). Ses travaux, publiés en 2020, ont introduit une classe de modèles d'apprentissage automatique capables de générer des images de haute qualité en débruitant itérativement un bruit aléatoire, une méthode devenue une pierre angulaire des systèmes génératifs modernes. Les recherches de Ho ont influencé des applications académiques et industrielles, notamment la génération d'images et de vidéos à partir de texte, et ont été largement adoptées par les grandes organisations de recherche en IA.
Ho a obtenu son doctorat de l'universite de toronto, sous la supervision d'Anima Anandkumar, et était affilié à l'Institut Vector. Ses recherches doctorales portaient sur les modèles génératifs profonds et l'inférence probabiliste, jetant les bases de ses innovations ultérieures. Après avoir terminé son doctorat en 2020, Ho a rejoint OpenAI en tant que chercheur, où il a continué à faire progresser les méthodes basées sur la diffusion. Il a ensuite rejoint Google DeepMind en 2022, contribuant aux modèles génératifs à grande échelle et à leurs applications.
Modèles de diffusion par débruitage
En juin 2020, Ho, avec Ajain Jain et Pieter Abbeel, a publié l'article « Denoising Diffusion Probabilistic Models » sur arXiv. L'article a introduit un nouveau paradigme pour la modélisation générative, s'appuyant sur les travaux antérieurs de Sohl-Dickstein et al. (2015) et de Song et Ermon (2019). L'innovation clé était un objectif d'entraînement simplifié pour le processus de diffusion, utilisant une borne variationnelle pondérée et une perte d'erreur quadratique moyenne simple entre le bruit prédit et le bruit réel. Cette approche a permis un entraînement stable et la production d'échantillons de haute qualité, atteignant des résultats de pointe sur des références de génération d'images telles que CIFAR-10 et CelebA-HQ.
Le cadre DDPM fonctionne en deux phases : un processus direct qui ajoute progressivement du bruit gaussien aux données sur un nombre fixe d'étapes, et un processus inverse qui apprend à débruiter. Le modèle, généralement implémenté comme un U-Net avec des blocs residuels et des mécanismes d'attention, prédit le bruit à chaque étape. Les travaux de Ho ont démontré que cette formulation simple pouvait générer des images d'une fidélité comparable aux reseaux antagonistes generatifs (GAN) tout en offrant une meilleure stabilité d'entraînement et une meilleure couverture de mode.
Impact sur l'IA générative
Les DDPM ont catalysé une expansion rapide de la recherche sur la diffusion. En 2021, Ho a co-écrit « Diffusion Models Beat GANs on Image Synthesis », qui a montré que les modèles de diffusion pouvaient surpasser les GAN en qualité d'échantillons, en partie grâce à l'intégration du guidage par classifieur. Ces travaux, réalisés en collaboration avec des collègues d'OpenAI, ont établi les modèles de diffusion comme l'approche de premier plan pour la génération d'images haute fidélité. Les développements ultérieurs, tels que les modèles de diffusion latente et la diffusion conditionnée par texte, ont conduit à la création de systèmes comme Stable Diffusion et DALL-E 2, largement utilisés dans des applications créatives et commerciales.
Les contributions de Ho s'étendent à la génération vidéo. En 2022, il a co-écrit « Video Diffusion Models », qui a adapté le cadre de diffusion pour générer des séquences vidéo cohérentes. Ces travaux ont influencé les systèmes de génération vidéo ultérieurs, y compris ceux développés chez Google DeepMind et d'autres laboratoires. L'évolutivité des modèles de diffusion, combinée aux progrès des architectures de reseaux neuronaux et de l'augmentation de donnees, en a fait une force dominante dans l'IA générative, rivalisant avec les approches basées sur les grands modeles de langage pour la création de contenu multimodal.
Philosophie de recherche et collaborations
La recherche de Ho met l'accent sur la simplicité et l'efficacité empirique. Son article sur les DDPM est remarquable pour sa méthodologie claire et reproductible, ce qui a facilité son adoption rapide par la communauté de recherche. Il a collaboré avec des chercheurs éminents, notamment Jakob Uszkoreit et Llion Jones chez Google DeepMind, où il a travaillé sur des projets liés à la synthèse d'images et de vidéos. Son approche consiste souvent à exploiter des techniques établies, telles que l'optimiseur adam et les schemas de taux d apprentissage, tout en se concentrant sur des innovations architecturales qui produisent des gains pratiques.
Chez OpenAI, Ho a contribué au développement des modèles de diffusion guidés, qui utilisent le guidage par classifieur pour orienter la génération vers des attributs souhaités. Ces travaux, publiés en 2021, ont démontré comment les modèles de diffusion pouvaient être conditionnés par des étiquettes de classe ou des invites textuelles, ouvrant la voie aux systèmes de génération texte-image. Ses idées sur la dynamique d'entraînement des modèles de diffusion, y compris le rôle des schémas de bruit et de la pondération des pertes, ont informé les recherches ultérieures dans tout le domaine.
Reconnaissance et influence
L'article sur les DDPM est devenu l'un des plus cités en apprentissage automatique, avec des milliers de citations en quelques années. Les travaux de Ho ont été récompensés, notamment par un prix du meilleur article à NeurIPS 2021 pour « Diffusion Models Beat GANs on Image Synthesis ». Il a été invité à s'exprimer lors de grandes conférences et ateliers, et ses méthodes sont enseignées dans des cours avancés sur la modélisation générative. Le terme « modèle de diffusion » est devenu un standard dans le lexique de l'IA, et Ho est largement reconnu comme un architecte clé de ce paradigme.
Carrière ultérieure et travaux actuels
En 2024, Ho continue de travailler chez Google DeepMind, où il se concentre sur l'extension des modèles de diffusion à de nouveaux domaines, notamment la génération audio et 3D. Ses recherches récentes explorent l'intersection des modèles de diffusion avec l'apprentissage par renforcement et le Reinforcement Learning from AI Feedback (RLAIF) (apprentissage par renforcement à partir de retours d'IA), visant à améliorer la qualité des échantillons et l'alignement avec les préférences humaines. Il a également étudié l'utilisation des modèles de diffusion dans des applications scientifiques, telles que la prédiction de structures protéiques, en collaboration avec des groupes comme Bhabha Atomic Research Centre et Samsung Research. Les contributions continues de Ho garantissent que les modèles de diffusion restent à la pointe de la recherche en IA générative, avec des implications pour des domaines allant de l'art et du divertissement à la découverte de médicaments et à la robotique.
Malgré l'évolution rapide du domaine, les travaux fondateurs de Ho sur les DDPM continuent de sous-tendre de nombreux systèmes de pointe. Sa capacité à distiller des idées complexes en algorithmes pratiques a fait de lui une figure centrale de l'histoire de l'intelligence artificielle, et sa trajectoire de recherche reflète la nature interdisciplinaire de l'apprentissage automatique moderne, reliant la vision par ordinateur, l'optimisation et la modélisation probabiliste.