जशा सोहल-डिकस्टीन एक कंप्यूटर वैज्ञानिक और मशीन-लर्निंग तथा कृत्रिम-बुद्धिमत्ता के शोधकर्ता हैं। वे 2015 के पेपर "डीप अनसुपरवाइज्ड लर्निंग यूजिंग नॉनइक्विलिब्रियम थर्मोडायनामिक्स" के मुख्य लेखक के रूप में सबसे अधिक जाने जाते हैं, जिसने डिफ्यूजन प्रोबेबिलिस्टिक मॉडल पेश किए - ये जनरेटिव-एआई मॉडलों का एक वर्ग है जो बाद में छवि और वीडियो निर्माण प्रणालियों के लिए केंद्रीय बन गया। उनका काम सांख्यिकीय भौतिकी, अनुकूलन और डीप-लर्निंग को जोड़ता है।
सोहल-डिकस्टीन ने कैलिफोर्निया विश्वविद्यालय, बर्कले से पीएचडी प्राप्त की, जहाँ उन्होंने मशीन लर्निंग और कम्प्यूटेशनल तंत्रिका विज्ञान पर काम किया। इसके बाद उन्होंने 2015 में गूगल ब्रेन में शामिल होने से पहले स्टैनफोर्ड विश्वविद्यालय और रिकेन ब्रेन साइंस इंस्टीट्यूट में पदों पर कार्य किया। गूगल ब्रेन में, उन्होंने अनुकूलन, सामान्यीकरण और जनरेटिव मॉडलिंग पर शोध में योगदान दिया। 2021 में, वे एक शोध वैज्ञानिक के रूप में गूगल-डीपमाइंड चले गए, और 2023 में वे एंथ्रोपिक में शामिल हुए, जहाँ उन्होंने बड़े पैमाने पर एआई प्रणालियों की व्याख्या और सुरक्षा पर ध्यान केंद्रित किया है।
डिफ्यूजन मॉडल और प्रारंभिक जनरेटिव कार्य
सोहल-डिकस्टीन का 2015 का पेपर, जो एरिक वीस, निरु महेश्वरनाथन और सूर्य गांगुली के साथ सह-लेखक था, ने डेटा में धीरे-धीरे शोर जोड़ने और फिर उस प्रक्रिया को उलटने के लिए सीखने के आधार पर जनरेटिव मॉडलिंग के लिए एक ढांचा प्रस्तावित किया। यह दृष्टिकोण नॉनइक्विलिब्रियम थर्मोडायनामिक्स पर आधारित था और शुरू में जनरेटिव एडवरसैरियल नेटवर्क और वैरिएशनल ऑटोएनकोडर जैसी अन्य जनरेटिव विधियों से प्रभावित था। हालाँकि, यह बाद में DALL-E और स्टेबल डिफ्यूजन जैसी उच्च-प्रोफ़ाइल प्रणालियों की नींव बन गया, जो टेक्स्ट प्रॉम्प्ट से यथार्थवादी छवियाँ उत्पन्न करने के लिए डिफ्यूजन मॉडल का उपयोग करते हैं। यह पेपर अब आधुनिक जनरेटिव-एआई प्रणालियों के प्रमुख अग्रदूत के रूप में व्यापक रूप से उद्धृत किया जाता है।
शोध योगदान
डिफ्यूजन मॉडल के अलावा, सोहल-डिकस्टीन ने मशीन-लर्निंग में कई विषयों पर प्रकाशन किया है। उनके कार्य में लॉस लैंडस्केप की ज्यामिति, न्यूरल-नेटवर्क प्रशिक्षण की गतिशीलता और अनुकूलन में शोर की भूमिका पर अध्ययन शामिल हैं। उन्होंने डीप लर्निंग और तंत्रिका विज्ञान के बीच संबंध की भी जाँच की है, विशेष रूप से यह कि जैविक सर्किट कृत्रिम नेटवर्क में उपयोग किए जाने वाले सीखने के नियमों के समान नियमों को कैसे लागू कर सकते हैं। उनका शोध अक्सर अनुभवजन्य परिणामों के साथ-साथ सैद्धांतिक समझ पर जोर देता है।
ओपनएआई में - जहाँ वे 2017 से 2018 तक शोध वैज्ञानिक थे - उन्होंने बड़े पैमाने पर जनरेटिव मॉडल पर काम किया और बड़े-भाषा-मॉडल शोध में प्रारंभिक प्रयासों में योगदान दिया। उनका समय वहाँ ट्रांसफॉर्मर आर्किटेक्चर के विकास के साथ ओवरलैप हुआ, हालाँकि उनका प्राथमिक ध्यान जनरेटिव मॉडलिंग और अनुकूलन पर रहा।
बाद का करियर और व्याख्या
गूगल ब्रेन लौटने और फिर गूगल-डीपमाइंड जाने के बाद, सोहल-डिकस्टीन ने डीप लर्निंग की सैद्धांतिक नींव का पता लगाना जारी रखा। उन्होंने ग्रेडिएंट डिसेंट के अंतर्निहित पूर्वाग्रह, सामान्यीकरण पर बैच आकार के प्रभाव और न्यूरल नेटवर्क के स्केलिंग व्यवहार पर पेपर सह-लेखक किए। मॉडल आकार और प्रदर्शन के बीच संबंध पर उनका काम बड़े मॉडलों के प्रशिक्षण के लिए व्यावहारिक दिशानिर्देशों को सूचित करता है।
2023 में, सोहल-डिकस्टीन एंथ्रोपिक में शामिल हुए, जहाँ उन्होंने यांत्रिक व्याख्या पर काम किया है - यह न्यूरल नेटवर्क के आंतरिक गणनाओं को समझने का प्रयास है। इसमें यह विश्लेषण करना शामिल है कि ट्रांसफॉर्मर अवधारणाओं का प्रतिनिधित्व कैसे करते हैं और उनके भीतर सर्किट की पहचान कैसे करें। भौतिकी और अनुकूलन में उनकी पृष्ठभूमि जटिल मॉडलों के व्यवहार को रिवर्स-इंजीनियर करने के तरीकों को विकसित करने में मूल्यवान रही है।
प्रभाव और मान्यता
2015 का डिफ्यूजन पेपर आधुनिक एआई में सबसे प्रभावशाली कार्यों में से एक के रूप में मान्यता प्राप्त है। इसने मॉडलों के एक परिवार की नींव रखी जो अब छवि संश्लेषण, ऑडियो निर्माण और वैज्ञानिक अनुप्रयोगों के लिए व्यापक रूप से उपयोग किए जाने वाले उपकरणों को शक्ति प्रदान करता है। अनुकूलन और सीखने के सिद्धांत में सोहल-डिकस्टीन के व्यापक योगदान भी व्यापक रूप से उद्धृत किए गए हैं। उन्होंने प्रमुख सम्मेलनों और कार्यशालाओं में बात की है, और उनका काम शैक्षणिक मंचों और लोकप्रिय मीडिया दोनों में प्रदर्शित किया गया है।
सोहल-डिकस्टीन का करियर एआई शोध की अंतःविषय प्रकृति को दर्शाता है, जो भौतिकी, सांख्यिकी और कंप्यूटर विज्ञान से अंतर्दृष्टि को जोड़ता है। उनका प्रक्षेपवक्र - शिक्षा से उद्योग शोध प्रयोगशालाओं तक - क्षेत्र के विकास को दर्शाता है, क्योंकि 2010 के दशक के मौलिक विचार 2020 के दशक में वाणिज्यिक उत्पादों का आधार बन गए।
चयनित प्रकाशन
- सोहल-डिकस्टीन, जे., वीस, ई., महेश्वरनाथन, एन., और गांगुली, एस. (2015)। डीप अनसुपरवाइज्ड लर्निंग यूजिंग नॉनइक्विलिब्रियम थर्मोडायनामिक्स। इंटरनेशनल कॉन्फ्रेंस ऑन मशीन लर्निंग (ICML)।
- सोहल-डिकस्टीन, जे., पूल, बी., और गांगुली, एस. (2014)। फास्ट लार्ज-स्केल ऑप्टिमाइजेशन बाय यूनिफाइंग स्टोकेस्टिक ग्रेडिएंट एंड क्वासी-न्यूटन मेथड्स। ICML।
- सोहल-डिकस्टीन, जे., एट अल. (2020)। ऑन द रिलेशनशिप बिटवीन बैच साइज़ एंड जनरलाइज़ेशन। (प्रीप्रिंट)।
ये कार्य डीप-लर्निंग में जनरेटिव मॉडलिंग और अनुकूलन के बारे में शोधकर्ताओं के सोचने के तरीके को आकार देने में प्रभावशाली रहे हैं।