जोनाथन हो एक कंप्यूटर वैज्ञानिक और शोधकर्ता हैं, जिन्हें Generative AI में उनके मौलिक योगदान के लिए पहचाना जाता है, विशेष रूप से डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (डीडीपीएम) के विकास के लिए। उनका काम, जो 2020 में प्रकाशित हुआ, ने Machine learning मॉडलों का एक वर्ग पेश किया जो यादृच्छिक शोर को बार-बार डीनॉइज़ करके उच्च-गुणवत्ता वाली छवियां उत्पन्न करते हैं, एक विधि जो तब से आधुनिक जनरेटिव सिस्टम की आधारशिला बन गई है। हो के शोध ने शैक्षणिक और औद्योगिक दोनों अनुप्रयोगों को प्रभावित किया है, जिसमें टेक्स्ट-टू-इमेज और टेक्स्ट-टू-वीडियो निर्माण शामिल है, और इसे प्रमुख एआई अनुसंधान संगठनों द्वारा व्यापक रूप से अपनाया गया है।
हो ने University of Toronto से पीएचडी प्राप्त की, जहां उन्होंने Anima Anandkumar के पर्यवेक्षण में काम किया और वेक्टर इंस्टीट्यूट से संबद्ध थे। उनका डॉक्टरेट अनुसंधान गहरे जनरेटिव मॉडल और संभाव्य अनुमान पर केंद्रित था, जिसने उनके बाद के नवाचारों की नींव रखी। 2020 में पीएचडी पूरी करने के बाद, हो OpenAI में एक शोध वैज्ञानिक के रूप में शामिल हुए, जहां उन्होंने डिफ्यूज़न-आधारित विधियों को आगे बढ़ाना जारी रखा। बाद में वे 2022 में Google DeepMind चले गए, जहां उन्होंने बड़े पैमाने पर जनरेटिव मॉडल और उनके अनुप्रयोगों में योगदान दिया।
डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल
जून 2020 में, हो ने अजय जैन और पीटर एबेल के साथ मिलकर arXiv पर "डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल" नामक पेपर प्रकाशित किया। पेपर ने जनरेटिव मॉडलिंग के लिए एक नया प्रतिमान पेश किया, जो सोहल-डिकस्टीन एट अल. (2015) और सोंग और एर्मन (2019) के पहले के काम पर आधारित था। मुख्य नवाचार एक प्रशिक्षण उद्देश्य था जिसने डिफ्यूज़न प्रक्रिया को सरल बनाया, एक भारित परिवर्तनीय सीमा और अनुमानित और वास्तविक शोर के बीच एक सरल माध्य-वर्ग त्रुटि हानि का उपयोग करते हुए। इस दृष्टिकोण ने स्थिर प्रशिक्षण सक्षम किया और उच्च-गुणवत्ता वाले नमूने तैयार किए, जिससे CIFAR-10 और CelebA-HQ जैसे छवि निर्माण बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त हुए।
डीडीपीएम ढांचा दो चरणों में काम करता है: एक आगे की प्रक्रिया जो डेटा में निश्चित संख्या में टाइमस्टेप्स पर धीरे-धीरे गाऊसी शोर जोड़ती है, और एक विपरीत प्रक्रिया जो डीनॉइज़ करना सीखती है। मॉडल, जो आमतौर पर U-Net के रूप में लागू किया जाता है, जिसमें Residual Network (ResNet) ब्लॉक और ध्यान तंत्र होते हैं, प्रत्येक चरण पर शोर की भविष्यवाणी करता है। हो के काम ने प्रदर्शित किया कि यह सरल सूत्रीकरण जनरेटिव-एडवर्सरियल-नेटवर्क (GANs) के बराबर निष्ठा वाली छवियां उत्पन्न कर सकता है, जबकि बेहतर प्रशिक्षण स्थिरता और मोड कवरेज प्रदान करता है।
जनरेटिव एआई पर प्रभाव
डीडीपीएम ने डिफ्यूज़न-आधारित अनुसंधान के तेजी से विस्तार को उत्प्रेरित किया। 2021 में, हो ने "डिफ्यूज़न मॉडल्स बीट GANs ऑन इमेज सिंथेसिस" का सह-लेखन किया, जिसने दिखाया कि डिफ्यूज़न मॉडल नमूना गुणवत्ता में GANs से आगे निकल सकते हैं, आंशिक रूप से क्लासिफायर मार्गदर्शन को शामिल करके। यह काम, जो OpenAI सहयोगियों के साथ किया गया था, ने डिफ्यूज़न मॉडल को उच्च-निष्ठा छवि निर्माण के लिए अग्रणी दृष्टिकोण के रूप में स्थापित किया। बाद के विकास, जैसे अव्यक्त डिफ्यूज़न मॉडल और टेक्स्ट-कंडीशन्ड डिफ्यूज़न, ने स्टेबल डिफ्यूज़न और DALL-E 2 जैसी प्रणालियों के निर्माण का नेतृत्व किया, जो रचनात्मक और वाणिज्यिक अनुप्रयोगों में व्यापक रूप से उपयोग की जाती हैं।
हो के योगदान वीडियो निर्माण तक फैले हुए हैं। 2022 में, उन्होंने "वीडियो डिफ्यूज़न मॉडल्स" का सह-लेखन किया, जिसने सुसंगत वीडियो अनुक्रम उत्पन्न करने के लिए डिफ्यूज़न ढांचे को अनुकूलित किया। इस काम ने बाद के वीडियो निर्माण प्रणालियों को प्रभावित किया, जिसमें Google DeepMind और अन्य प्रयोगशालाओं में विकसित शामिल हैं। डिफ्यूज़न मॉडल की स्केलेबिलिटी, Neural network आर्किटेक्चर और Data Augmentation में प्रगति के साथ मिलकर, उन्हें जनरेटिव एआई में एक प्रमुख शक्ति बना दिया है, जो मल्टीमॉडल सामग्री निर्माण के लिए Large language model-आधारित दृष्टिकोणों को टक्कर देती है।
अनुसंधान दर्शन और सहयोग
हो का शोध सरलता और अनुभवजन्य प्रभावशीलता पर जोर देता है। उनका डीडीपीएम पेपर अपनी स्पष्ट, प्रतिलिपि योग्य पद्धति के लिए उल्लेखनीय है, जिसने अनुसंधान समुदाय द्वारा तेजी से अपनाने की सुविधा प्रदान की। उन्होंने प्रमुख शोधकर्ताओं के साथ सहयोग किया है, जिसमें Jakob Uszkoreit और Llion Jones शामिल हैं, जो Google DeepMind में हैं, जहां उन्होंने छवि और वीडियो संश्लेषण से संबंधित परियोजनाओं पर काम किया। उनका दृष्टिकोण अक्सर स्थापित तकनीकों का लाभ उठाता है, जैसे Adam (Optimizer) और Learning Rate Scheduling, जबकि वास्तुशिल्प नवाचारों पर ध्यान केंद्रित करता है जो व्यावहारिक लाभ देते हैं।
OpenAI में, हो ने निर्देशित डिफ्यूज़न मॉडल के विकास में योगदान दिया, जो वांछित विशेषताओं की ओर निर्माण को निर्देशित करने के लिए क्लासिफायर मार्गदर्शन का उपयोग करते हैं। यह काम, जो 2021 में प्रकाशित हुआ, ने प्रदर्शित किया कि डिफ्यूज़न मॉडल को कक्षा लेबल या टेक्स्ट संकेतों पर कैसे सशर्त किया जा सकता है, जिससे टेक्स्ट-टू-इमेज सिस्टम का मार्ग प्रशस्त हुआ। डिफ्यूज़न मॉडल के प्रशिक्षण गतिशीलता में उनकी अंतर्दृष्टि, जिसमें शोर अनुसूचियों और हानि भार की भूमिका शामिल है, ने क्षेत्र में बाद के अनुसंधान को सूचित किया है।
मान्यता और प्रभाव
डीडीपीएम पेपर मशीन लर्निंग में सबसे अधिक उद्धृत कार्यों में से एक बन गया है, जिसमें कुछ वर्षों के भीतर हजारों उद्धरण हैं। हो के काम को पुरस्कारों से मान्यता दी गई है, जिसमें "डिफ्यूज़न मॉडल्स बीट GANs ऑन इमेज सिंथेसिस" के लिए NeurIPS 2021 में सर्वश्रेष्ठ पेपर पुरस्कार शामिल है। उन्हें प्रमुख सम्मेलनों और कार्यशालाओं में बोलने के लिए आमंत्रित किया गया है, और उनके तरीके जनरेटिव मॉडलिंग पर उन्नत पाठ्यक्रमों में पढ़ाए जाते हैं। "डिफ्यूज़न मॉडल" शब्द स्वयं एआई शब्दावली में मानक बन गया है, और हो को व्यापक रूप से इस प्रतिमान के प्रमुख वास्तुकार के रूप में श्रेय दिया जाता है।
बाद का करियर और वर्तमान कार्य
2024 तक, हो Google DeepMind में काम करना जारी रखते हैं, जहां वे डिफ्यूज़न मॉडल को नए डोमेन, जैसे ऑडियो और 3D निर्माण, में स्केल करने पर ध्यान केंद्रित करते हैं। उनका हालिया शोध Reinforcement learning और Reinforcement Learning from AI Feedback (RLAIF) (एआई फीडबैक से सुदृढीकरण सीखना) के साथ डिफ्यूज़न मॉडल के प्रतिच्छेदन की खोज करता है, जिसका उद्देश्य नमूना गुणवत्ता और मानव प्राथमिकताओं के साथ संरेखण में सुधार करना है। उन्होंने वैज्ञानिक अनुप्रयोगों, जैसे प्रोटीन संरचना भविष्यवाणी, में डिफ्यूज़न मॉडल के उपयोग की भी जांच की है, जिसमें Bhabha Atomic Research Centre और Samsung Research जैसे समूहों के साथ सहयोग किया गया है। हो के चल रहे योगदान सुनिश्चित करते हैं कि डिफ्यूज़न मॉडल जनरेटिव एआई अनुसंधान में सबसे आगे बने रहें, जिसमें कला और मनोरंजन से लेकर दवा खोज और रोबोटिक्स तक के क्षेत्रों के लिए निहितार्थ हैं।
क्षेत्र के तेजी से विकास के बावजूद, डीडीपीएम पर हो का मौलिक काम कई अत्याधुनिक प्रणालियों को रेखांकित करना जारी रखता है। जटिल विचारों को व्यावहारिक एल्गोरिदम में आसुत करने की उनकी क्षमता ने उन्हें Artificial intelligence के इतिहास में एक महत्वपूर्ण व्यक्ति बना दिया है, और उनका शोध प्रक्षेपवक्र आधुनिक मशीन लर्निंग की अंतःविषय प्रकृति को दर्शाता है, जो कंप्यूटर विज़न, अनुकूलन और संभाव्य मॉडलिंग को जोड़ता है।