बेन पूल गूगल डीपमाइंड में एक शोध वैज्ञानिक हैं, जहाँ वे जनरेटिव आर्टिफिशियल इंटेलिजेंस और मशीन लर्निंग पर काम करते हैं। वे डीप लर्निंग में कई प्रभावशाली पेपरों के सह-लेखक के रूप में प्रसिद्ध हैं, जिनमें ड्रीमफ्यूज़न, इमेजेन, और स्कोर-आधारित जनरेटिव मॉडल पर मौलिक कार्य शामिल हैं। उनका शोध टेक्स्ट विवरणों से उच्च-गुणवत्ता वाली छवियों, वीडियो और 3D सामग्री उत्पन्न करने के तरीकों को विकसित करने पर केंद्रित है, जिसके अनुप्रयोग रचनात्मक उपकरणों और वैज्ञानिक सिमुलेशन में हैं।
पूल के योगदान ने जनरेटिव AI के आधुनिक परिदृश्य को आकार देने में मदद की है, विशेष रूप से टेक्स्ट-से-छवि संश्लेषण और 3D जनरेशन के क्षेत्रों में। उनका काम संभाव्य मॉडलिंग में सैद्धांतिक प्रगति को व्यावहारिक इंजीनियरिंग समाधानों से जोड़ता है, जिससे वे इस क्षेत्र में एक प्रमुख व्यक्ति बन गए हैं। उन्होंने शिक्षा और उद्योग के शोधकर्ताओं के साथ सहयोग किया है, और उनके पेपर AI समुदाय में व्यापक रूप से उद्धृत किए जाते हैं।
प्रारंभिक करियर और शिक्षा
पूल ने टोरंटो विश्वविद्यालय से कंप्यूटर विज्ञान में पीएचडी पूरी की, जहाँ उन्होंने आरोन कूरविल के अधीन काम किया और डीप लर्निंग और संभाव्य मॉडल पर शोध किया। अपने डॉक्टरेट अध्ययन के दौरान, उन्होंने वैरिएशनल इन्फ्रेंस और जनरेटिव मॉडलिंग पर ध्यान केंद्रित किया, और ब्लैक-बॉक्स वैरिएशनल इन्फ्रेंस और न्यूरल अटेंशन मॉडल जैसे विषयों पर पेपर प्रकाशित किए। उनके थीसिस कार्य ने स्कोर-आधारित जनरेटिव मॉडल में उनके बाद के योगदानों की नींव रखी।
2016 में पीएचडी पूरी करने के बाद, पूल ओपनएआई की शोध टीम में एक शोध वैज्ञानिक के रूप में शामिल हुए। ओपनएआई में, उन्होंने रीइन्फोर्समेंट लर्निंग और जनरेटिव मॉडल पर काम किया, और न्यूरल नेटवर्क और लॉस फंक्शन से जुड़ी परियोजनाओं में योगदान दिया। वे 2020 तक ओपनएआई में रहे, इस दौरान उन्होंने इम्प्लिसिट जनरेटिव मॉडल और एडवरसैरियल ट्रेनिंग पर काम सहित कई उल्लेखनीय पेपरों के सह-लेखक के रूप में कार्य किया।
जनरेटिव मॉडलिंग में प्रमुख योगदान
2021 में, पूल ने "स्कोर-बेस्ड जनरेटिव मॉडलिंग विद क्रिटिकली-डैम्प्ड लैंजेविन डिफ्यूज़न" पेपर का सह-लेखन किया, जिसने स्कोर-आधारित जनरेटिव मॉडल के लिए एक नया ढांचा पेश किया। यह कार्य, जो इंटरनेशनल कॉन्फ्रेंस ऑन लर्निंग रिप्रेजेंटेशन्स (ICLR) में प्रकाशित हुआ, ने दिखाया कि क्रिटिकली-डैम्प्ड लैंजेविन डायनेमिक्स का उपयोग करके नमूना गुणवत्ता और प्रशिक्षण स्थिरता में सुधार कैसे किया जाए। यह पेपर क्षेत्र में एक मौलिक योगदान माना जाता है, जिसने डिफ्यूज़न मॉडल पर बाद के शोध को प्रभावित किया।
2022 में, पूल "ड्रीमफ्यूज़न: टेक्स्ट-टू-3D यूज़िंग 2D डिफ्यूज़न" पेपर के प्रमुख लेखक थे, जो ICLR 2023 में प्रस्तुत किया गया। ड्रीमफ्यूज़न ने 3D प्रशिक्षण डेटा की आवश्यकता के बिना, इमेजेन जैसे पूर्व-प्रशिक्षित 2D डिफ्यूज़न मॉडल का लाभ उठाकर टेक्स्ट प्रॉम्प्ट से 3D मॉडल उत्पन्न करने की एक विधि पेश की। यह दृष्टिकोण, जो स्कोर डिस्टिलेशन सैंपलिंग नामक तकनीक का उपयोग करता है, व्यापक रूप से अपनाया गया और टेक्स्ट-टू-3D जनरेशन में कई अनुवर्ती कार्यों को प्रेरित किया। पेपर को ICLR 2023 में उत्कृष्ट पेपर पुरस्कार मिला।
साथ ही 2022 में, पूल ने "इमेजेन: फोटोरियलिस्टिक टेक्स्ट-टू-इमेज डिफ्यूज़न मॉडल" पेपर में योगदान दिया, जो गूगल रिसर्च में क्रिस बिशप की टीम द्वारा नेतृत्व किया गया। इमेजेन ने टेक्स्ट को एनकोड करने के लिए एक बड़े ट्रांसफॉर्मर भाषा मॉडल और छवियों को उत्पन्न करने के लिए डिफ्यूज़न मॉडल के कैस्केड का उपयोग करके अत्याधुनिक टेक्स्ट-टू-इमेज संश्लेषण प्रदर्शित किया। यह पेपर, जो प्रीप्रिंट के रूप में जारी किया गया और बाद में NeurIPS 2022 में प्रकाशित हुआ, ने अभूतपूर्व फोटोरियलिज्म हासिल किया और टेक्स्ट-टू-इमेज जनरेशन में डिफ्यूज़न मॉडल को प्रमुख दृष्टिकोण के रूप में स्थापित करने में मदद की।
गूगल डीपमाइंड में शोध
पूल 2020 में गूगल रिसर्च में शामिल हुए, जो बाद में 2023 में डीपमाइंड के साथ विलय होकर गूगल डीपमाइंड बना। गूगल डीपमाइंड में, वे जनरेटिव मॉडल पर काम करना जारी रखते हैं, डिफ्यूज़न मॉडल को स्केल करने और उनकी दक्षता में सुधार करने पर ध्यान केंद्रित करते हैं। उनके हालिया काम में वीडियो जनरेशन पर शोध शामिल है, जहाँ उन्होंने टेक्स्ट या छवि इनपुट से अस्थायी रूप से सुसंगत वीडियो उत्पन्न करने के तरीकों की खोज की है। उन्होंने नियंत्रणीय जनरेशन की तकनीकों की भी जांच की है, जैसे कि डिफ्यूज़न मॉडल के आउटपुट को मार्गदर्शन करने के लिए क्रॉस-अटेंशन तंत्र का उपयोग करना।
अपने शोध के अलावा, पूल ने ओपन-सोर्स टूल्स और फ्रेमवर्क में योगदान दिया है। वे मशीन लर्निंग शोध के लिए लाइब्रेरी विकसित करने में शामिल रहे हैं, जिसमें डिफ्यूज़न मॉडल के JAX-आधारित कार्यान्वयन शामिल हैं। उनका काम NeurIPS, ICLR और ICML जैसे प्रमुख सम्मेलनों में प्रस्तुत किया गया है, और उन्होंने इन स्थानों के लिए समीक्षक और क्षेत्र अध्यक्ष के रूप में कार्य किया है।
सहयोग और प्रभाव
पूल ने जैकब उस्ज़कोरिट, लियोन जोन्स और गूगल डीपमाइंड के अन्य लोगों सहित शोधकर्ताओं की एक विस्तृत श्रृंखला के साथ सहयोग किया है। कैलटेक में अनिमा आनंदकुमार के साथ स्कोर-आधारित जनरेटिव मॉडल पर उनका काम विशेष रूप से प्रभावशाली रहा है, जिससे ऐसे तरीकों का विकास हुआ जो अब क्षेत्र में मानक हैं। ड्रीमफ्यूज़न पेपर, विशेष रूप से, टेक्स्ट-टू-3D जनरेशन पर शोध का एक बड़ा निकाय उत्पन्न किया है, जिसके अनुप्रयोग गेमिंग, वर्चुअल रियलिटी और रोबोटिक्स में हैं।
उनके पेपरों ने हजारों उद्धरण जमा किए हैं, जो शैक्षणिक शोध और उद्योग अनुप्रयोगों दोनों पर उनके व्यापक प्रभाव को दर्शाता है। उनके द्वारा विकसित तकनीकों का उपयोग वाणिज्यिक उत्पादों में किया जाता है, जैसे कि छवि जनरेशन टूल और 3D एसेट निर्माण पाइपलाइन। 2024 तक, पूल गूगल डीपमाइंड में एक सक्रिय शोधकर्ता बने हुए हैं, जो जनरेटिव AI के साथ संभव की सीमाओं को आगे बढ़ा रहे हैं।
चयनित प्रकाशन
- "स्कोर-बेस्ड जनरेटिव मॉडलिंग विद क्रिटिकली-डैम्प्ड लैंजेविन डिफ्यूज़न" (ICLR 2021)
- "ड्रीमफ्यूज़न: टेक्स्ट-टू-3D यूज़िंग 2D डिफ्यूज़न" (ICLR 2023, उत्कृष्ट पेपर पुरस्कार)
- "इमेजेन: फोटोरियलिस्टिक टेक्स्ट-टू-इमेज डिफ्यूज़न मॉडल" (NeurIPS 2022)
- "डीप अनसुपरवाइज़्ड लर्निंग यूज़िंग नॉनइक्विलिब्रियम थर्मोडायनामिक्स" (सह-लेखक, 2015)
- "ब्लैक-बॉक्स वैरिएशनल इन्फ्रेंस फॉर स्टोकेस्टिक डिफरेंशियल इक्वेशन्स" (ICML 2016)
ये प्रकाशन जनरेटिव मॉडलिंग के सैद्धांतिक आधारों और व्यावहारिक अनुप्रयोगों दोनों में उनके योगदान को उजागर करते हैं। उनका काम आर्टिफिशियल इंटेलिजेंस और संबंधित क्षेत्रों में शोधकर्ताओं की नई पीढ़ियों को प्रभावित करना जारी रखता है।