John Schulman es un investigador de aprendizaje automático conocido principalmente por desarrollar algoritmos de aprendizaje por refuerzo ampliamente utilizados y por liderar la metodología de entrenamiento detrás de los primeros modelos de chat de OpenAI. Obtuvo su doctorado en la Universidad de California, Berkeley, trabajando en un laboratorio de robótica y aprendizaje por refuerzo, y fue uno de los investigadores fundadores de OpenAI cuando se lanzó en diciembre de 2015.
Contribuciones de investigación
La contribución técnica más citada de Schulman es la Optimización de Política Proximal (PPO), introducida en un artículo de 2017 que él lideró. PPO simplificó los métodos anteriores de región de confianza en un algoritmo que era más fácil de implementar y ajustar,y se convirtió en uno de los algoritmos de gradiente de política más ampliamente desplegados tanto en robótica como, más tarde, en el entrenamiento de modelos de lenguaje. PPO posteriormente se convirtió en el algoritmo de optimización predeterminado utilizado en los pipelines de RLHF, incluido el que respalda a ChatGPT.
Rol en OpenAI
En OpenAI, Schulman lideró el equipo que aplicó RLHF a modelos de lenguaje grandes, un trabajo que produjo InstructGPT en 2022 y que alimentó directamente el lanzamiento de ChatGPT en noviembre de 2022 (ver lanzamiento de ChatGPT). Fue ampliamente acreditado, tanto interna como externamente, como el arquitecto técnico de la técnica de alineación que hizo que los modelos de la era GPT-3 siguieran instrucciones de manera fiable en lugar de simplemente continuar texto. Continuó liderando la investigación de post-entrenamiento y alineación a través de la era de GPT-4, trabajando junto a colegas como Ilya Sutskever y Sam Altman.
Salida a Anthropic y Thinking Machines Lab
En agosto de 2024, Schulman anunció que dejaba OpenAI para unirse a Anthropic, declarando que quería centrarse más directamente en la investigación de alineación de IA y en el trabajo técnico práctico en lugar de en la gestión. El movimiento fue notable porque llegó menos de un año después de la crisis del consejo de OpenAI en noviembre de 2023(ver crisis del consejo de OpenAI) y fue interpretado por muchos observadores como parte de una ola más amplia de investigadores senior que se trasladaban hacia laboratorios centrados en la seguridad. Trabajó en métodos de alineación y post-entrenamiento en Anthropic a lo largo de 2024. En 2025, Schulman dejó Anthropic para unirse a Thinking Machines Lab, la startup fundada por la ex directora de tecnología de OpenAI Mira Murati, como cofundador y científico jefe. El movimiento lo colocó junto a varios otros exalumnos de OpenAI en una empresa que recaudó una de las rondas de financiación semilla más grandes en la historia de las startups de IA.
Influencia
Schulman es considerado uno de los investigadores más responsables de convertir el aprendizaje por refuerzo a partir de retroalimentación humana en una técnica práctica y de escala de producción en lugar de una curiosidad de investigación, un cambio que sustenta casi todos los chatbots de consumo lanzados después de 2022. Su trayectoria profesional a través de OpenAI, Anthropic, y Thinking Machines Lab también ha sido citada como un estudio de caso en cómo el talento investigador de IA de primer nivel circula entre los laboratorios fronterizos.