ジョン・シュルマン

英語からの翻訳

ジョン・シュルマンは、アメリカの機械学習研究者であり、OpenAIの共同創業者である。Proximal Policy Optimizationアルゴリズムの開発と、ChatGPTの背後にある人間のフィードバックからの強化学習の取り組みを主導したことで知られている。

ジョン・シュルマンは機械学習研究者であり、広く使用されている強化学習アルゴリズムの開発と、OpenAIの初期のチャットモデルにおけるトレーニング手法の主導で最もよく知られている。彼はカリフォルニア大学バークレー校で博士号を取得し、ロボティクスと強化学習の研究室で働き、2015年12月にOpenAIが発足した際には創設研究者の一人であった。

研究貢献

シュルマンの最も引用されている技術的貢献は、彼が主導した2017年の論文で紹介された近接ポリシー最適化(PPO)である。PPOは、それまでの信頼領域法を、実装と調整が容易なアルゴリズムに簡素化し、ロボティクスと、その後の言語モデルトレーニングの両方で最も広く展開されたポリシー勾配アルゴリズムの一つとなった。PPOはその後、RLHFパイプライン、特にChatGPTの背後にあるものにおいて、デフォルトの最適化アルゴリズムとなった。

OpenAIでの役割

OpenAIでは、シュルマンはRLHFを大規模言語モデルに適用するチームを率い、その成果は2022年のInstructGPTを生み出し、2022年11月のChatGPTのリリースに直接つながった(ChatGPTのリリースを参照)。彼は、GPT-3時代のモデルが単にテキストを継続するのではなく、指示に確実に従うようにしたアライメント技術の技術的設計者として、社内外で広く評価された。彼はGPT-4時代を通じてポストトレーニングとアライメント研究を引き続き主導し、イリヤ・サツケバーサム・アルトマンなどの同僚と共に働いた。

AnthropicとThinking Machines Labへの移籍

2024年8月、シュルマンはOpenAIを離れAnthropicに加わると発表し、管理職ではなくAIアライメント研究と実践的な技術作業により直接焦点を当てたいと述べた。この動きは、OpenAIの2023年11月の取締役会危機(OpenAI取締役会危機を参照)から1年も経たないうちに起こったため注目され、多くの観察者によって、安全性重視の研究所へ向かう上級研究者のより広い波の一部と見なされた。彼は2024年を通じてAnthropicでアライメントとポストトレーニング手法に取り組んだ。

2025年、シュルマンはAnthropicを離れ、元OpenAI最高技術責任者ミラ・ムラティが設立したスタートアップであるThinking Machines Labに共同創業者兼最高科学責任者として加わった。この動きにより、彼はAIスタートアップ史上最大級のシードラウンドを調達した企業で、他の数人のOpenAI卒業生と並ぶこととなった。

影響

シュルマンは、強化学習を人間のフィードバックから、研究上の好奇心ではなく実用的で本番規模の技術へと変えた研究者の一人と見なされており、この変化は2022年以降にリリースされたほぼすべての消費者向けチャットボットの基盤となっている。OpenAI、Anthropic、Thinking Machines Labにわたる彼のキャリアの軌跡は、トップクラスのAI研究人材がフロンティア研究所の間をどのように循環するかについてのケーススタディとしても引用されている。

カテゴリ:reinforcement-learning·alignment·industry
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴