John Schulman é um pesquisador de aprendizado de máquina mais conhecido por desenvolver algoritmos de Reinforcement learning amplamente utilizados e por liderar a metodologia de treinamento por trás dos primeiros modelos de chat da OpenAI. Ele obteve seu doutorado na Universidade da Califórnia, em Berkeley, trabalhando em um laboratório de robótica e aprendizado por reforço, e foi um dos pesquisadores fundadores da OpenAI quando ela foi lançada em dezembro de 2015.
Contribuições de pesquisa
A contribuição técnica mais citada de Schulman é a Proximal Policy Optimization (PPO), introduzida em um artigo de 2017 que ele liderou. A PPO simplificou métodos anteriores de região de confiança em um algoritmo mais fácil de implementar e ajustar, e se tornou um dos algoritmos de gradiente de política mais amplamente implantados tanto em robótica quanto, posteriormente, no treinamento de modelos de linguagem. A PPO subsequentemente se tornou o algoritmo de otimização padrão usado em pipelines de RLHF, incluindo o que está por trás do ChatGPT.
Papel na OpenAI
Na OpenAI, Schulman liderou a equipe que aplicou RLHF a grandes modelos de linguagem, trabalho que produziu o InstructGPT em 2022 e alimentou diretamente o lançamento do ChatGPT em novembro de 2022 (ver lançamento do ChatGPT). Ele foi amplamente creditado, interna e externamente, como o arquiteto técnico da técnica de alinhamento que fez os modelos da era GPT-3 seguirem instruções de forma confiável, em vez de apenas continuar texto. Ele continuou liderando pesquisas de pós-treinamento e alinhamento durante a era GPT-4, trabalhando ao lado de colegas como Ilya Sutskever e Sam Altman.
Saída para a Anthropic e Thinking Machines Lab
Em agosto de 2024, Schulman anunciou que estava deixando a OpenAI para se juntar à Anthropic, afirmando que queria se concentrar mais diretamente em pesquisa de alinhamento de IA e trabalho técnico prático, em vez de gestão. A mudança foi notável porque ocorreu menos de um ano após a crise do conselho da OpenAI em novembro de 2023 (ver crise do conselho da OpenAI) e foi interpretada por muitos observadores como parte de uma onda mais ampla de pesquisadores seniores migrando para laboratórios focados em segurança. Ele trabalhou em métodos de alinhamento e pós-treinamento na Anthropic ao longo de 2024.
Em 2025, Schulman deixou a Anthropic para se juntar à Thinking Machines Lab, a startup fundada pela ex-diretora de tecnologia da OpenAI Mira Murati, como cofundador e cientista-chefe. A mudança o colocou ao lado de vários outros ex-alunos da OpenAI em uma empresa que levantou uma das maiores rodadas de financiamento inicial da história das startups de IA.
Influência
Schulman é considerado um dos pesquisadores mais responsáveis por transformar o aprendizado por reforço a partir de feedback humano em uma técnica prática e em escala de produção, em vez de uma curiosidade de pesquisa, uma mudança que sustenta quase todos os chatbots de consumo lançados após 2022. Sua trajetória profissional pela OpenAI, Anthropic e Thinking Machines Lab também foi citada como um estudo de caso sobre como os melhores talentos de pesquisa em IA circulam entre os laboratórios de fronteira.