Traduit de l'anglais

John Schulman est un chercheur américain en apprentissage automatique et cofondateur d'OpenAI, connu pour avoir développé l'algorithme d'optimisation de politique proximale et pour avoir dirigé les travaux d'apprentissage par renforcement à partir de retours humains derrière ChatGPT.

John Schulman est un chercheur en apprentissage automatique, surtout connu pour avoir développé des algorithmes de apprentissage par renforcement largement utilisés et pour avoir dirigé la méthodologie d'entraînement derrière les premiers modèles de chat d'OpenAI. Il a obtenu un doctorat à l'Université de Californie à Berkeley, travaillant dans un laboratoire de robotique et d'apprentissage par renforcement, et a été l'un des chercheurs fondateurs d'OpenAI lors de son lancement en décembre 2015.

Contributions à la recherche

La contribution technique la plus citée de Schulman est l'Optimisation de Politique Proximale (PPO), introduite dans un article de 2017 qu'il a dirigé. PPO a simplifié les méthodes de région de confiance antérieures en un algorithme plus facile à implémenter et à ajuster, et il est devenu l'un des algorithmes de gradient de politique les plus largement déployés, tant en robotique que, plus tard, dans l'entraînement des modèles de langage. PPO est ensuite devenu l'algorithme d'optimisation par défaut utilisé dans les pipelines de RLHF, y compris celui derrière ChatGPT.

Rôle chez OpenAI

Chez OpenAI, Schulman a dirigé l'équipe qui a appliqué le RLHF aux grands modèles de langage, un travail qui a produit InstructGPT en 2022 et a directement alimenté la sortie de ChatGPT en novembre 2022 (voir lancement de ChatGPT). Il a été largement crédité, en interne et en externe, comme l'architecte technique de la technique d'alignement qui a permis aux modèles de l'ère GPT-3 de suivre des instructions de manière fiable plutôt que de simplement continuer du texte. Il a continué à diriger la recherche sur le post-entraînement et l'alignement à travers l'ère GPT-4, travaillant aux côtés de collègues tels que Ilya Sutskever et Sam Altman.

Départ vers Anthropic et Thinking Machines Lab

En août 2024, Schulman a annoncé qu'il quittait OpenAI pour rejoindre Anthropic, déclarant qu'il souhaitait se concentrer plus directement sur la recherche en alignement de l'IA et sur un travail technique pratique plutôt que sur la gestion. Ce mouvement a été notable car il survenait moins d'un an après la crise du conseil d'administration d'OpenAI de novembre 2023 (voir crise du conseil d'administration d'OpenAI) et a été interprété par de nombreux observateurs comme faisant partie d'une vague plus large de chercheurs seniors se dirigeant vers des laboratoires axés sur la sécurité. Il a travaillé sur les méthodes d'alignement et de post-entraînement chez Anthropic tout au long de 2024.

En 2025, Schulman a quitté Anthropic pour rejoindre Thinking Machines Lab, la startup fondée par l'ancienne directrice technique d'OpenAI, Mira Murati, en tant que cofondateur et directeur scientifique. Ce mouvement l'a placé aux côtés de plusieurs autres anciens d'OpenAI dans une entreprise qui a levé l'un des plus grands tours de table de financement d'amorçage de l'histoire des startups d'IA.

Influence

Schulman est considéré comme l'un des chercheurs les plus responsables d'avoir transformé le apprentissage par renforcement à partir de retours humains en une technique pratique et à l'échelle de la production, plutôt qu'une curiosité de recherche, un changement qui sous-tend presque tous les chatbots grand public publiés après 2022. Sa trajectoire de carrière à travers OpenAI, Anthropic et Thinking Machines Lab a également été citée comme une étude de cas sur la façon dont les meilleurs talents de la recherche en IA circulent parmi les laboratoires de pointe.

Catégories:reinforcement-learning·alignment·industry
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique