नमन गोयल एक कंप्यूटर वैज्ञानिक और कृत्रिम बुद्धिमत्ता में शोधकर्ता हैं। वे BART के सह-लेखक होने के लिए सबसे अधिक जाने जाते हैं, जो अनुक्रम-से-अनुक्रम मॉडल के प्रीट्रेनिंग के लिए एक डीनॉइज़िंग ऑटोएनकोडर है, और Fairseq में उनके योगदान के लिए, जो एक व्यापक रूप से उपयोग की जाने वाली ओपन-सोर्स डीप लर्निंग लाइब्रेरी है। उनके काम ने आधुनिक बड़े भाषा मॉडल के विकास को प्रभावित किया है।
गोयल का शोध मशीन लर्निंग के क्षेत्र में स्थित है, विशेष रूप से अनुक्रम-से-अनुक्रम सीखने और प्रीट्रेनिंग से संबंधित क्षेत्रों में। उनके योगदान बड़े मॉडलों को प्रशिक्षित करने के लिए मौलिक वास्तुकला और व्यावहारिक उपकरणों के बीच सेतु बनाते हैं।
BART और प्रीट्रेनिंग
गोयल उस टीम का हिस्सा थे जिसने 2019 में BART जारी किया। BART वास्तुकला एक द्विदिश एनकोडर और एक प्रतिगामी डिकोडर को जोड़ती है, जो दूषित पाठ पर प्रीट्रेनिंग के लिए एक डीनॉइज़िंग उद्देश्य का उपयोग करती है। इस दृष्टिकोण ने मॉडल को सारांशीकरण और अनुवाद जैसे कार्यों के लिए उच्च-गुणवत्ता वाला आउटपुट उत्पन्न करने की अनुमति दी। इस पेपर ने 400 मिलियन पैरामीटर तक के मॉडल पेश किए, और इसने स्टैनफोर्ड प्रश्न-उत्तर डेटासेट और GLUE सहित कई बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए।
BART प्रीट्रेनिंग में एक महत्वपूर्ण कदम था क्योंकि इसने BERT और GPT जैसे पहले के मॉडलों के विचारों को एकीकृत और विस्तारित किया। केवल एक मानक भाषा मॉडल उद्देश्य का उपयोग करने के बजाय, BART ने टोकन मास्किंग और ऑर्डर क्रमपरिवर्तन सहित विभिन्न नॉइज़िंग फ़ंक्शंस के साथ पाठ को दूषित किया। गोयल की भूमिका ने दृष्टिकोण की अनुभवजन्य सफलता में योगदान दिया, जिसने प्रदर्शित किया कि अनुक्रम-से-अनुक्रम प्रीट्रेनिंग शुद्ध एनकोडर या डिकोडर मॉडल जितनी प्रभावी हो सकती है।
Fairseq टूलकिट
साथ ही, गोयल ने Fairseq में योगदान दिया, जो मेटा एआई (पूर्व में फेसबुक एआई रिसर्च) में विकसित एक सॉफ्टवेयर लाइब्रेरी है। Fairseq अनुवाद, सारांशीकरण और अन्य अनुक्रम कार्यों के लिए मॉडल प्रशिक्षण का समर्थन करता है। यह PyTorch का उपयोग करता है और ट्रांसफॉर्मर और अन्य वास्तुकलाओं के लिए कुशल कार्यान्वयन प्रदान करता है। लाइब्रेरी को ओपन-सोर्स किया गया था और शैक्षणिक और अन्य प्रयोगशालाओं में व्यापक रूप से अपनाया गया है।
Fairseq ने वेट-इनिशियलाइज़ेशन, लेयर-नॉर्मलाइज़ेशन और लर्निंग-रेट-शेड्यूल जैसी तकनीकें पेश कीं जिन्होंने गहरे नेटवर्क के प्रशिक्षण को अधिक स्थिर बना दिया। Fairseq में गोयल की भागीदारी ने इंजीनियरिंग और प्रयोग में मदद की, जिससे यह शोध के लिए एक मानक उपकरण बन गया।
मॉडल स्केलिंग में योगदान
संबंधित कार्यों में, गोयल ने ग्रेडिएंट-क्लिपिंग और टॉप-पी-सैंपलिंग जैसे मुद्दों का पता लगाया। उन्होंने स्केलिंग और बड़े बैच प्रशिक्षण पर शोध में भी भाग लिया, जिसने चिकित्सकों के प्रीट्रेनिंग के दृष्टिकोण को प्रभावित किया। उदाहरण के लिए, 2020 की शुरुआत में तंत्रिका भाषा मॉडल के लिए मॉडल-स्केलिंग-कानूनों पर काम ने प्रदर्शित किया कि कंप्यूट, डेटा और पैरामीटर को संतुलन में होना चाहिए; शोध की यह पंक्ति बड़े मॉडलों के डिजाइन को प्रभावित करती है।
गोयल उन शोधकर्ताओं में से भी थे जिन्होंने समुदाय के माध्यम से नेचुरल क्वेश्चन डेटासेट जारी किया, हालांकि अन्य शोधकर्ताओं ने इसके श्रेय का प्रबंधन किया। फिर भी, उनके कई प्रकाशन बाद में डीप लर्निंग साहित्य में उद्धरण बन गए हैं।
प्रभाव
BART और Fairseq पर उनके काम ने अनुवाद द्वारा सशर्त पीढ़ी के लिए एक आधार रेखा स्थापित करने में मदद की। मॉडलों ने टेक्स्ट-टू-स्पीच के डिजाइन और अधिक कुशल प्रशिक्षण में शोध को भी सूचित किया।
विरासत बाद के रिलीज़ और अनगिनत प्रशिक्षणों में जारी है। 2024 तक, BART कई लाइब्रेरीज़ में एक मानक मॉडल बन गया है। गोयल के योगदान को उद्धरण संख्या और शीर्ष सम्मेलनों में भागीदारी के माध्यम से मान्यता दी गई है। उन्होंने यान लेकुन और मिकेल आर्टेटक्से जैसे शोधकर्ताओं के साथ भी सहयोग किया है।