जॉन शुलमैन एक मशीन लर्निंग शोधकर्ता हैं, जिन्हें व्यापक रूप से उपयोग किए जाने वाले Reinforcement learning एल्गोरिदम विकसित करने और OpenAI के शुरुआती चैट मॉडल के पीछे प्रशिक्षण पद्धति का नेतृत्व करने के लिए जाना जाता है। उन्होंने कैलिफोर्निया विश्वविद्यालय, बर्कले से पीएचडी प्राप्त की, जहाँ उन्होंने रोबोटिक्स और सुदृढीकरण सीखने की प्रयोगशाला में काम किया, और दिसंबर 2015 में OpenAI के संस्थापक शोधकर्ताओं में से एक थे।
शोध योगदान
शुलमैन का सबसे अधिक उद्धृत तकनीकी योगदान प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) है, जिसे उनके नेतृत्व में 2017 के एक पेपर में पेश किया गया था। PPO ने पहले के ट्रस्ट-क्षेत्र विधियों को एक ऐसे एल्गोरिदम में सरल बना दिया जो लागू करने और ट्यून करने में आसान था, और यह रोबोटिक्स और बाद में भाषा मॉडल प्रशिक्षण दोनों में सबसे व्यापक रूप से उपयोग किए जाने वाले पॉलिसी-ग्रेडिएंट एल्गोरिदम में से एक बन गया। PPO बाद में RLHF पाइपलाइनों में उपयोग किया जाने वाला डिफ़ॉल्ट अनुकूलन एल्गोरिदम बन गया, जिसमें ChatGPT के पीछे वाला भी शामिल है।
OpenAI में भूमिका
OpenAI में, शुलमैन ने उस टीम का नेतृत्व किया जिसने बड़े भाषा मॉडलों पर RLHF लागू किया, जिसके परिणामस्वरूप 2022 में InstructGPT बना और नवंबर 2022 में ChatGPT के रिलीज़ में सीधे योगदान दिया (देखें Launch of ChatGPT)। उन्हें आंतरिक और बाह्य रूप से व्यापक रूप से उस संरेखण तकनीक के तकनीकी वास्तुकार के रूप में श्रेय दिया गया, जिसने GPT-3-युग के मॉडलों को केवल पाठ जारी रखने के बजाय निर्देशों का विश्वसनीय रूप से पालन करने में सक्षम बनाया। उन्होंने GPT-4 युग के दौरान पोस्ट-ट्रेनिंग और संरेखण अनुसंधान का नेतृत्व जारी रखा, और Ilya Sutskever और Sam Altman जैसे सहयोगियों के साथ काम किया।
एंथ्रोपिक और थिंकिंग मशीन्स लैब में प्रस्थान
अगस्त 2024 में, शुलमैन ने घोषणा की कि वह OpenAI छोड़कर Anthropic में शामिल हो रहे हैं, और कहा कि वह प्रबंधन के बजाय AI संरेखण अनुसंधान और व्यावहारिक तकनीकी कार्य पर अधिक सीधे ध्यान केंद्रित करना चाहते हैं। यह कदम उल्लेखनीय था क्योंकि यह OpenAI के नवंबर 2023 के बोर्ड संकट (देखें OpenAI board crisis) के एक साल से भी कम समय बाद आया था, और कई पर्यवेक्षकों ने इसे सुरक्षा-केंद्रित प्रयोगशालाओं की ओर वरिष्ठ शोधकर्ताओं के व्यापक प्रवाह के हिस्से के रूप में पढ़ा। उन्होंने 2024 के दौरान एंथ्रोपिक में संरेखण और पोस्ट-ट्रेनिंग विधियों पर काम किया।
2025 में, शुलमैन ने एंथ्रोपिक छोड़कर थिंकिंग मशीन्स लैब में शामिल हो गए, जो पूर्व OpenAI मुख्य प्रौद्योगिकी अधिकारी Mira Murati द्वारा स्थापित स्टार्टअप है, और वहाँ सह-संस्थापक और मुख्य वैज्ञानिक बने। यह कदम उन्हें कई अन्य OpenAI पूर्व छात्रों के साथ एक ऐसी कंपनी में ले गया, जिसने AI स्टार्टअप इतिहास में सबसे बड़े सीड राउंड में से एक जुटाया।
प्रभाव
शुलमैन को उन शोधकर्ताओं में से एक माना जाता है जो Reinforcement learning को मानव प्रतिक्रिया से एक व्यावहारिक, उत्पादन-स्तर की तकनीक में बदलने के लिए सबसे अधिक जिम्मेदार हैं, न कि केवल एक शोध जिज्ञासा के रूप में, एक बदलाव जो 2022 के बाद जारी लगभग हर उपभोक्ता चैटबॉट को रेखांकित करता है। OpenAI, एंथ्रोपिक और थिंकिंग मशीन्स लैब में उनका करियर प्रक्षेपवक्र भी एक केस स्टडी के रूप में उद्धृत किया गया है कि कैसे शीर्ष AI शोध प्रतिभा सीमांत प्रयोगशालाओं के बीच घूमती है।