Aus dem Englischen übersetzt

John Schulman ist ein amerikanischer Forscher für maschinelles Lernen und Mitbegründer von OpenAI, bekannt für die Entwicklung des Proximal-Policy-Optimization-Algorithmus und für die Leitung der Arbeit zur Verstärkung des Lernens aus menschlichem Feedback, die hinter ChatGPT steht.

John Schulman ist ein Forscher im Bereich maschinelles Lernen, der vor allem für die Entwicklung weit verbreiteter Verstärkungslern-Algorithmen und für die Leitung der Trainingsmethodik hinter den frühen Chat-Modellen von OpenAI bekannt ist. Er promovierte an der University of California, Berkeley, wo er in einem Labor für Robotik und Verstärkungslernen arbeitete, und war einer der Gründungsforscher von OpenAI, als diese im Dezember 2015 gestartet wurde.

Forschungsbeiträge

Der am häufigsten zitierte technische Beitrag von Schulman ist Proximal Policy Optimization (PPO), eingeführt in einem von ihm geleiteten Paper aus dem Jahr 2017. PPO vereinfachte frühere Trust-Region-Methoden zu einem Algorithmus, der einfacher zu implementieren und abzustimmen war, und wurde zu einem der am weitesten verbreiteten Policy-Gradient-Algorithmen sowohl in der Robotik als auch später im Training von Sprachmodellen. PPO wurde anschließend zum Standard-Optimierungsalgorithmus in RLHF-Pipelines, einschließlich derjenigen hinter ChatGPT.

Rolle bei OpenAI

Bei OpenAI leitete Schulman das Team, das RLHF auf große Sprachmodelle anwendete. Diese Arbeit führte 2022 zu InstructGPT und floss direkt in die Veröffentlichung von ChatGPT im November 2022 ein (siehe ChatGPT-Start). Intern und extern wurde er weithin als der technische Architekt der Alignment-Technik anerkannt, die Modelle der GPT-3-Ära dazu brachte, Anweisungen zuverlässig zu befolgen, anstatt lediglich Text fortzusetzen. Er leitete weiterhin die Forschung zu Post-Training und Alignment bis in die GPT-4-Ära hinein und arbeitete dabei mit Kollegen wie Ilya Sutskever und Sam Altman zusammen.

Wechsel zu Anthropic und Thinking Machines Lab

Im August 2024 gab Schulman bekannt, dass er OpenAI verlässt, um zu Anthropic zu wechseln. Er erklärte, er wolle sich stärker direkt auf KI-Alignment-Forschung und praktische technische Arbeit konzentrieren statt auf Management. Der Wechsel war bemerkenswert, da er weniger als ein Jahr nach der Vorstandskrise von OpenAI im November 2023 erfolgte (siehe OpenAI-Vorstandskrise) und von vielen Beobachtern als Teil einer breiteren Welle von Senior-Forschern gedeutet wurde, die zu sicherheitsorientierten Laboren wechselten. Er arbeitete bis 2024 bei Anthropic an Alignment- und Post-Training-Methoden.

Im Jahr 2025 verließ Schulman Anthropic, um Thinking Machines Lab beizutreten, dem von der ehemaligen OpenAI-Technologiechefin Mira Murati gegründeten Startup, und wurde dort Mitgründer und Chefwissenschaftler. Der Schritt brachte ihn neben mehreren anderen OpenAI-Alumni in ein Unternehmen, das eine der größten Seed-Finanzierungsrunden in der Geschichte von KI-Startups aufnahm.

Einfluss

Schulman gilt als einer der Forscher, die am meisten dafür verantwortlich sind, Verstärkungslernen aus menschlichem Feedback von einer Forschungskuriosität zu einer praktischen, produktionsreifen Technik zu machen - eine Verschiebung, die nahezu jedem Verbraucher-Chatbot zugrunde liegt, der nach 2022 veröffentlicht wurde. Seine Karriere über OpenAI, Anthropic und Thinking Machines Lab wird auch als Fallstudie dafür angeführt, wie Top-KI-Forschungstalente zwischen den führenden Laboren zirkulieren.

Kategorien:reinforcement-learning·alignment·industry
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte