Jascha Sohl-Dickstein est un informaticien et chercheur en apprentissage automatique et en intelligence artificielle. Il est surtout connu comme l'auteur principal de l'article de 2015 intitulé « Deep Unsupervised Learning using Nonequilibrium Thermodynamics », qui a introduit les modèles probabilistes de diffusion - une classe de modèles de IA générative qui sont devenus plus tard centraux dans les systèmes de génération d'images et de vidéos. Ses travaux font le pont entre la physique statistique, l'optimisation et le apprentissage profond.
Sohl-Dickstein a obtenu son doctorat de l'Université de Californie à Berkeley, où il a travaillé sur l'apprentissage automatique et les neurosciences computationnelles. Il a ensuite occupé des postes à l'Université Stanford et à l'Institut RIKEN des sciences du cerveau avant de rejoindre Google Brain en 2015. Chez Google Brain, il a contribué à la recherche sur l'optimisation, la généralisation et la modélisation générative. En 2021, il a rejoint Google DeepMind en tant que chercheur, et en 2023, il a rejoint Anthropic, où il s'est concentré sur l'interprétabilité et la sécurité des systèmes d'IA à grande échelle.
Modèles de diffusion et premiers travaux génératifs
L'article de 2015 de Sohl-Dickstein, coécrit avec Eric Weiss, Niru Maheswaranathan et Surya Ganguli, proposait un cadre pour la modélisation générative basé sur l'ajout progressif de bruit aux données, puis l'apprentissage de l'inversion de ce processus. L'approche s'inspirait de la thermodynamique hors équilibre et a d'abord été éclipsée par d'autres méthodes génératives telles que les réseaux antagonistes génératifs et les autoencodeurs variationnels. Cependant, elle est devenue plus tard la base de systèmes de premier plan comme DALL-E et Stable Diffusion, qui utilisent des modèles de diffusion pour produire des images réalistes à partir de prompts textuels. L'article est désormais largement cité comme un précurseur clé des systèmes modernes de IA générative.
Contributions à la recherche
Au-delà des modèles de diffusion, Sohl-Dickstein a publié sur une gamme de sujets en apprentissage automatique. Ses travaux incluent des études sur la géométrie des paysages de perte, la dynamique de l'entraînement des réseaux neuronaux et le rôle du bruit dans l'optimisation. Il a également étudié le lien entre l'apprentissage profond et les neurosciences, en particulier comment les circuits biologiques pourraient implémenter des règles d'apprentissage similaires à celles utilisées dans les réseaux artificiels. Sa recherche met souvent l'accent sur la compréhension théorique en parallèle des résultats empiriques.
Chez OpenAI - où il a été chercheur de 2017 à 2018 - il a travaillé sur des modèles génératifs à grande échelle et a contribué aux premiers efforts de recherche sur les modèles de langage de grande taille. Son passage là-bas a coïncidé avec le développement de l'architecture Transformer, bien que son principal intérêt soit resté la modélisation générative et l'optimisation.
Carrière ultérieure et interprétabilité
Après son retour à Google Brain puis son passage à Google DeepMind, Sohl-Dickstein a continué à explorer les fondements théoriques de l'apprentissage profond. Il a coécrit des articles sur le biais implicite de la descente de gradient, l'effet de la taille des lots sur la généralisation et le comportement de mise à l'échelle des réseaux neuronaux. Ses travaux sur la relation entre la taille des modèles et la performance ont informé des recommandations pratiques pour l'entraînement de grands modèles.
En 2023, Sohl-Dickstein a rejoint Anthropic, où il a travaillé sur l'interprétabilité mécaniste - l'effort pour comprendre les calculs internes des réseaux neuronaux. Cela inclut l'analyse de la manière dont les transformers représentent les concepts et comment identifier des circuits en leur sein. Son parcours en physique et en optimisation a été précieux pour développer des méthodes permettant de rétro-ingénier le comportement de modèles complexes.
Impact et reconnaissance
L'article de 2015 sur la diffusion a été reconnu comme l'un des travaux les plus influents de l'IA moderne. Il a jeté les bases d'une famille de modèles qui alimentent désormais des outils largement utilisés pour la synthèse d'images, la génération audio et des applications scientifiques. Les contributions plus larges de Sohl-Dickstein à l'optimisation et à la théorie de l'apprentissage ont également été largement citées. Il a pris la parole lors de grandes conférences et ateliers, et ses travaux ont été présentés à la fois dans des cadres académiques et dans les médias populaires.
La carrière de Sohl-Dickstein illustre la nature interdisciplinaire de la recherche en IA, combinant des idées issues de la physique, des statistiques et de l'informatique. Sa trajectoire - de l'académie aux laboratoires de recherche industriels - reflète la croissance du domaine lui-même, alors que les idées fondatrices des années 2010 sont devenues la base de produits commerciaux dans les années 2020.
Publications sélectionnées
- Sohl-Dickstein, J., Weiss, E., Maheswaranathan, N., & Ganguli, S. (2015). Deep Unsupervised Learning using Nonequilibrium Thermodynamics. International Conference on Machine Learning (ICML).
- Sohl-Dickstein, J., Poole, B., & Ganguli, S. (2014). Fast large-scale optimization by unifying stochastic gradient and quasi-Newton methods. ICML.
- Sohl-Dickstein, J., et al. (2020). On the relationship between batch size and generalization. (Preprint).
Ces travaux ont été influents dans la manière dont les chercheurs pensent la modélisation générative et l'optimisation en apprentissage profond.