ELMo (भाषा मॉडल से एम्बेडिंग) एक शब्द एम्बेडिंग विधि है जो शब्दों के अनुक्रम को वैक्टरों के संगत अनुक्रम के रूप में प्रस्तुत करती है। इसे एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा बनाया गया था, और पहली बार फरवरी 2018 में जारी किया गया था। ELMo एक द्विदिशात्मक LSTM है जो वर्ण-स्तरीय इनपुट लेता है और शब्द-स्तरीय एम्बेडिंग उत्पन्न करता है, जिसे लगभग 30 मिलियन वाक्यों और 1 बिलियन शब्दों के कोरपस पर प्रशिक्षित किया गया था।
ELMo की वास्तुकला टोकनों की प्रासंगिक समझ को पूरा करती है। गहरी प्रासंगिक शब्द प्रस्तुति कई प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए उपयोगी है, जैसे कोरफेरेंस समाधान और पॉलीसेमी समाधान। ELMo ऐतिहासिक रूप से स्व-पर्यवेक्षित उत्पादक प्रीट्रेनिंग और उसके बाद फाइन-ट्यूनिंग के अग्रणी के रूप में महत्वपूर्ण था, जहां एक बड़े मॉडल को एक बड़े कोरपस को पुन: उत्पन्न करने के लिए प्रशिक्षित किया जाता है, फिर अतिरिक्त कार्य-विशिष्ट भार के साथ संवर्धित किया जाता है और पर्यवेक्षित कार्य डेटा पर फाइन-ट्यून किया जाता है। यह ट्रांसफार्मर-आधारित भाषा मॉडलिंग की ओर विकास में एक महत्वपूर्ण कदम था।
Architecture
ELMo एक टोकन एम्बेडिंग परत के शीर्ष पर एक बहुस्तरीय द्विदिशात्मक LSTM है। सभी LSTM के आउटपुट को एक साथ जोड़कर टोकन एम्बेडिंग बनती है। इनपुट टेक्स्ट अनुक्रम को पहले एक एम्बेडिंग परत द्वारा वैक्टरों के अनुक्रम में मैप किया जाता है। फिर दो भाग इस पर समानांतर रूप से चलाए जाते हैं। अग्रगामी भाग 4096 इकाइयों और 512 आयाम प्रक्षेपणों के साथ एक 2-स्तरीय LSTM है, जिसमें पहली से दूसरी परत तक एक अवशिष्ट कनेक्शन होता है। पश्चगामी भाग की वास्तुकला समान है, लेकिन यह अनुक्रम को पीछे से आगे की ओर संसाधित करता है। सभी 5 घटकों (एम्बेडिंग परत, दो अग्रगामी LSTM परतें, और दो पश्चगामी LSTM परतें) से आउटपुट को जोड़ा जाता है और एक रैखिक मैट्रिक्स (एक प्रक्षेपण मैट्रिक्स) से गुणा किया जाता है ताकि प्रति इनपुट टोकन एक 512-आयामी प्रस्तुति उत्पन्न हो।
ELMo को 1 बिलियन शब्दों के टेक्स्ट कोरपस पर प्रीट्रेन किया गया था। अग्रगामी भाग को बार-बार अगले टोकन की भविष्यवाणी करके प्रशिक्षित किया जाता है, और पश्चगामी भाग को बार-बार पिछले टोकन की भविष्यवाणी करके प्रशिक्षित किया जाता है। प्रीट्रेनिंग के बाद, ELMo पैरामीटर स्थिर रहते हैं, प्रक्षेपण मैट्रिक्स को छोड़कर, जिसे विशिष्ट भाषा कार्यों पर हानि को कम करने के लिए फाइन-ट्यून किया जा सकता है। यह प्रीट्रेनिंग-फाइन-ट्यून प्रतिमान का एक प्रारंभिक उदाहरण है। मूल पेपर ने छह बेंचमार्क एनएलपी कार्यों पर सर्वोत्तम स्थिति में सुधार करके इसका प्रदर्शन किया।
Contextual word representation
ELMo की वास्तुकला टोकनों की प्रासंगिक समझ को पूरा करती है। उदाहरण के लिए, पहला अग्रगामी LSTM प्रत्येक इनपुट टोकन को सभी पिछले टोकनों के संदर्भ में संसाधित करता है, और पहला पश्चगामी LSTM प्रत्येक टोकन को सभी बाद के टोकनों के संदर्भ में संसाधित करता है। दूसरा अग्रगामी LSTM फिर प्रत्येक टोकन को और अधिक प्रासंगिक बनाने के लिए उन्हें शामिल करता है।
गहरी प्रासंगिक शब्द प्रस्तुति कई प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए उपयोगी है, जैसे कोरफेरेंस समाधान और पॉलीसेमी समाधान। उदाहरण के लिए, वाक्य "She went to the bank to withdraw money" पर विचार करें। टोकन "bank" का प्रतिनिधित्व करने के लिए, मॉडल को संदर्भ में इसकी पॉलीसेमी का समाधान करना होगा। पहला अग्रगामी LSTM "bank" को "She went to the" के संदर्भ में संसाधित करता है, जो इसे शब्द को एक स्थान के रूप में प्रस्तुत करने की अनुमति देता है जिसकी ओर विषय जा रहा है। पहला पश्चगामी LSTM "bank" को "to withdraw money" के संदर्भ में संसाधित करता है, जो इसे शब्द को एक वित्तीय संस्थान के रूप में संदर्भित करने की अनुमति देता है। दूसरा अग्रगामी LSTM फिर पहले पश्चगामी LSTM द्वारा प्रदान किए गए प्रतिनिधित्व वेक्टर का उपयोग करके "bank" को संसाधित कर सकता है, जिससे यह इसे एक वित्तीय संस्थान के रूप में प्रस्तुत कर सकता है जिसकी ओर विषय जा रहा है।
Historical context
ELMo भाषा मॉडलिंग के ऐतिहासिक विकास में एक कड़ी है। दस्तावेज़ वर्गीकरण की एक सरल समस्या पर विचार करें, जहां हम दिए गए टेक्स्ट के एक टुकड़े को एक लेबल (जैसे, "स्पैम", "स्पैम नहीं", "राजनीति", "खेल") निर्दिष्ट करना चाहते हैं। सबसे सरल दृष्टिकोण "बैग ऑफ वर्ड्स" दृष्टिकोण है, जहां दस्तावेज़ में प्रत्येक शब्द को स्वतंत्र रूप से माना जाता है, और इसकी आवृत्ति को वर्गीकरण के लिए एक विशेषता के रूप में उपयोग किया जाता है। यह कम्प्यूटेशनल रूप से सस्ता था लेकिन शब्दों के क्रम और वाक्य के भीतर उनके संदर्भ को अनदेखा करता था। GloVe और Word2Vec ने बड़े टेक्स्ट कोरपस में सह-घटना पैटर्न के आधार पर शब्दों के लिए निश्चित वेक्टर प्रस्तुतियाँ (एम्बेडिंग) सीखकर इस पर निर्माण किया।
BERT की तरह (लेकिन "बैग ऑफ वर्ड्स" विधियों जैसे Word2Vec और GloVe के विपरीत), ELMo शब्द एम्बेडिंग संदर्भ-संवेदनशील हैं, जो समान वर्तनी वाले शब्दों के लिए अलग-अलग प्रस्तुतियाँ उत्पन्न करते हैं। इसे लगभग 30 मिलियन वाक्यों और 1 बिलियन शब्दों के कोरपस पर प्रशिक्षित किया गया था। पहले, द्विदिशात्मक LSTM का उपयोग प्रासंगिक शब्द प्रस्तुति के लिए किया जाता था, लेकिन ELMo ने इस विचार को बड़े पैमाने पर लागू किया, जिससे सर्वोत्तम स्थिति का प्रदर्शन प्राप्त हुआ।
2017 में Transformer (architecture) वास्तुकला के प्रकाशन के बाद, ELMo की वास्तुकला को एक बहुस्तरीय द्विदिशात्मक LSTM से एक ट्रांसफार्मर एनकोडर में बदल दिया गया, जिससे BERT का उदय हुआ। BERT में एक समान प्रीट्रेन-फाइन-ट्यून कार्यप्रवाह है, लेकिन यह एक ट्रांसफार्मर का उपयोग करता है जिसमें अधिक समानांतरीकरण योग्य प्रशिक्षण के निहितार्थ हैं। ELMo का प्रभाव अन्य Large language model विकासों तक भी फैला, क्योंकि इसने बड़े कोरपस पर प्रीट्रेनिंग और उसके बाद कार्य-विशिष्ट फाइन-ट्यूनिंग की शक्ति का प्रदर्शन किया, एक प्रतिमान जो बाद के मॉडलों जैसे OpenAI और Google DeepMind के लिए केंद्रीय बन गया।
Impact and legacy
फरवरी 2018 में ELMo का जारी होना प्राकृतिक भाषा प्रसंस्करण में एक बदलाव का प्रतीक था। प्रासंगिक एम्बेडिंग प्रदान करके, इसने प्रश्न उत्तरण, भावना विश्लेषण और नामित इकाई पहचान जैसे कार्यों पर प्रदर्शन में सुधार किया। इसकी सफलता ने भाषा के लिए Deep learning दृष्टिकोणों में आगे के शोध को प्रेरित किया, जिससे Artificial intelligence अनुप्रयोगों में तेजी से प्रगति हुई। ELMo को अक्सर BERT के साथ पाठ के लिए Machine learning के आधुनिक युग में एक आधारभूत मॉडल के रूप में उद्धृत किया जाता है।
विधि ने Neural network वास्तुकलाओं के महत्व को भी उजागर किया जो लंबी दूरी की निर्भरताओं को पकड़ती हैं, एक अवधारणा जिसे बाद में Transformer (architecture)-आधारित मॉडलों में परिष्कृत किया गया। ELMo की वर्ण-स्तरीय इनपुट हैंडलिंग ने इसे शब्दावली से बाहर के शब्दों के प्रति मजबूत बनाया, एक विशेषता जिसने बाद की एम्बेडिंग तकनीकों को प्रभावित किया। हालांकि ELMo स्वयं अब उत्पादन में व्यापक रूप से उपयोग नहीं किया जाता है, इसके सिद्धांत कई समकालीन एनएलपी प्रणालियों में अंतर्निहित हैं।
References
- Peters, M. E., et al. (2018). Deep contextualized word representations. Proceedings of NAACL-HLT.
- Allen Institute for Artificial Intelligence. (2018). ELMo: Deep contextualized word representations. Official release notes.