अंग्रेज़ी से अनुवादित

ELMo (embeddings from language model) एक शब्द एम्बेडिंग विधि है जो द्विदिशात्मक LSTM का उपयोग करके प्रासंगिक शब्द वैक्टर उत्पन्न करती है, जिसे 2018 में एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस और यूनिवर्सिटी ऑफ वाशिंगटन द्वारा पेश किया गया था।

ELMo (भाषा मॉडल से एम्बेडिंग) एक शब्द एम्बेडिंग विधि है जो शब्दों के अनुक्रम को वैक्टरों के संगत अनुक्रम के रूप में प्रस्तुत करती है। इसे एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा बनाया गया था, और पहली बार फरवरी 2018 में जारी किया गया था। ELMo एक द्विदिशात्मक LSTM है जो वर्ण-स्तरीय इनपुट लेता है और शब्द-स्तरीय एम्बेडिंग उत्पन्न करता है, जिसे लगभग 30 मिलियन वाक्यों और 1 बिलियन शब्दों के कोरपस पर प्रशिक्षित किया गया था।

ELMo की वास्तुकला टोकनों की प्रासंगिक समझ को पूरा करती है। गहरी प्रासंगिक शब्द प्रस्तुति कई प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए उपयोगी है, जैसे कोरफेरेंस समाधान और पॉलीसेमी समाधान। ELMo ऐतिहासिक रूप से स्व-पर्यवेक्षित उत्पादक प्रीट्रेनिंग और उसके बाद फाइन-ट्यूनिंग के अग्रणी के रूप में महत्वपूर्ण था, जहां एक बड़े मॉडल को एक बड़े कोरपस को पुन: उत्पन्न करने के लिए प्रशिक्षित किया जाता है, फिर अतिरिक्त कार्य-विशिष्ट भार के साथ संवर्धित किया जाता है और पर्यवेक्षित कार्य डेटा पर फाइन-ट्यून किया जाता है। यह ट्रांसफार्मर-आधारित भाषा मॉडलिंग की ओर विकास में एक महत्वपूर्ण कदम था।

Architecture

ELMo एक टोकन एम्बेडिंग परत के शीर्ष पर एक बहुस्तरीय द्विदिशात्मक LSTM है। सभी LSTM के आउटपुट को एक साथ जोड़कर टोकन एम्बेडिंग बनती है। इनपुट टेक्स्ट अनुक्रम को पहले एक एम्बेडिंग परत द्वारा वैक्टरों के अनुक्रम में मैप किया जाता है। फिर दो भाग इस पर समानांतर रूप से चलाए जाते हैं। अग्रगामी भाग 4096 इकाइयों और 512 आयाम प्रक्षेपणों के साथ एक 2-स्तरीय LSTM है, जिसमें पहली से दूसरी परत तक एक अवशिष्ट कनेक्शन होता है। पश्चगामी भाग की वास्तुकला समान है, लेकिन यह अनुक्रम को पीछे से आगे की ओर संसाधित करता है। सभी 5 घटकों (एम्बेडिंग परत, दो अग्रगामी LSTM परतें, और दो पश्चगामी LSTM परतें) से आउटपुट को जोड़ा जाता है और एक रैखिक मैट्रिक्स (एक प्रक्षेपण मैट्रिक्स) से गुणा किया जाता है ताकि प्रति इनपुट टोकन एक 512-आयामी प्रस्तुति उत्पन्न हो।

ELMo को 1 बिलियन शब्दों के टेक्स्ट कोरपस पर प्रीट्रेन किया गया था। अग्रगामी भाग को बार-बार अगले टोकन की भविष्यवाणी करके प्रशिक्षित किया जाता है, और पश्चगामी भाग को बार-बार पिछले टोकन की भविष्यवाणी करके प्रशिक्षित किया जाता है। प्रीट्रेनिंग के बाद, ELMo पैरामीटर स्थिर रहते हैं, प्रक्षेपण मैट्रिक्स को छोड़कर, जिसे विशिष्ट भाषा कार्यों पर हानि को कम करने के लिए फाइन-ट्यून किया जा सकता है। यह प्रीट्रेनिंग-फाइन-ट्यून प्रतिमान का एक प्रारंभिक उदाहरण है। मूल पेपर ने छह बेंचमार्क एनएलपी कार्यों पर सर्वोत्तम स्थिति में सुधार करके इसका प्रदर्शन किया।

Contextual word representation

ELMo की वास्तुकला टोकनों की प्रासंगिक समझ को पूरा करती है। उदाहरण के लिए, पहला अग्रगामी LSTM प्रत्येक इनपुट टोकन को सभी पिछले टोकनों के संदर्भ में संसाधित करता है, और पहला पश्चगामी LSTM प्रत्येक टोकन को सभी बाद के टोकनों के संदर्भ में संसाधित करता है। दूसरा अग्रगामी LSTM फिर प्रत्येक टोकन को और अधिक प्रासंगिक बनाने के लिए उन्हें शामिल करता है।

गहरी प्रासंगिक शब्द प्रस्तुति कई प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए उपयोगी है, जैसे कोरफेरेंस समाधान और पॉलीसेमी समाधान। उदाहरण के लिए, वाक्य "She went to the bank to withdraw money" पर विचार करें। टोकन "bank" का प्रतिनिधित्व करने के लिए, मॉडल को संदर्भ में इसकी पॉलीसेमी का समाधान करना होगा। पहला अग्रगामी LSTM "bank" को "She went to the" के संदर्भ में संसाधित करता है, जो इसे शब्द को एक स्थान के रूप में प्रस्तुत करने की अनुमति देता है जिसकी ओर विषय जा रहा है। पहला पश्चगामी LSTM "bank" को "to withdraw money" के संदर्भ में संसाधित करता है, जो इसे शब्द को एक वित्तीय संस्थान के रूप में संदर्भित करने की अनुमति देता है। दूसरा अग्रगामी LSTM फिर पहले पश्चगामी LSTM द्वारा प्रदान किए गए प्रतिनिधित्व वेक्टर का उपयोग करके "bank" को संसाधित कर सकता है, जिससे यह इसे एक वित्तीय संस्थान के रूप में प्रस्तुत कर सकता है जिसकी ओर विषय जा रहा है।

Historical context

ELMo भाषा मॉडलिंग के ऐतिहासिक विकास में एक कड़ी है। दस्तावेज़ वर्गीकरण की एक सरल समस्या पर विचार करें, जहां हम दिए गए टेक्स्ट के एक टुकड़े को एक लेबल (जैसे, "स्पैम", "स्पैम नहीं", "राजनीति", "खेल") निर्दिष्ट करना चाहते हैं। सबसे सरल दृष्टिकोण "बैग ऑफ वर्ड्स" दृष्टिकोण है, जहां दस्तावेज़ में प्रत्येक शब्द को स्वतंत्र रूप से माना जाता है, और इसकी आवृत्ति को वर्गीकरण के लिए एक विशेषता के रूप में उपयोग किया जाता है। यह कम्प्यूटेशनल रूप से सस्ता था लेकिन शब्दों के क्रम और वाक्य के भीतर उनके संदर्भ को अनदेखा करता था। GloVe और Word2Vec ने बड़े टेक्स्ट कोरपस में सह-घटना पैटर्न के आधार पर शब्दों के लिए निश्चित वेक्टर प्रस्तुतियाँ (एम्बेडिंग) सीखकर इस पर निर्माण किया।

BERT की तरह (लेकिन "बैग ऑफ वर्ड्स" विधियों जैसे Word2Vec और GloVe के विपरीत), ELMo शब्द एम्बेडिंग संदर्भ-संवेदनशील हैं, जो समान वर्तनी वाले शब्दों के लिए अलग-अलग प्रस्तुतियाँ उत्पन्न करते हैं। इसे लगभग 30 मिलियन वाक्यों और 1 बिलियन शब्दों के कोरपस पर प्रशिक्षित किया गया था। पहले, द्विदिशात्मक LSTM का उपयोग प्रासंगिक शब्द प्रस्तुति के लिए किया जाता था, लेकिन ELMo ने इस विचार को बड़े पैमाने पर लागू किया, जिससे सर्वोत्तम स्थिति का प्रदर्शन प्राप्त हुआ।

2017 में Transformer (architecture) वास्तुकला के प्रकाशन के बाद, ELMo की वास्तुकला को एक बहुस्तरीय द्विदिशात्मक LSTM से एक ट्रांसफार्मर एनकोडर में बदल दिया गया, जिससे BERT का उदय हुआ। BERT में एक समान प्रीट्रेन-फाइन-ट्यून कार्यप्रवाह है, लेकिन यह एक ट्रांसफार्मर का उपयोग करता है जिसमें अधिक समानांतरीकरण योग्य प्रशिक्षण के निहितार्थ हैं। ELMo का प्रभाव अन्य Large language model विकासों तक भी फैला, क्योंकि इसने बड़े कोरपस पर प्रीट्रेनिंग और उसके बाद कार्य-विशिष्ट फाइन-ट्यूनिंग की शक्ति का प्रदर्शन किया, एक प्रतिमान जो बाद के मॉडलों जैसे OpenAI और Google DeepMind के लिए केंद्रीय बन गया।

Impact and legacy

फरवरी 2018 में ELMo का जारी होना प्राकृतिक भाषा प्रसंस्करण में एक बदलाव का प्रतीक था। प्रासंगिक एम्बेडिंग प्रदान करके, इसने प्रश्न उत्तरण, भावना विश्लेषण और नामित इकाई पहचान जैसे कार्यों पर प्रदर्शन में सुधार किया। इसकी सफलता ने भाषा के लिए Deep learning दृष्टिकोणों में आगे के शोध को प्रेरित किया, जिससे Artificial intelligence अनुप्रयोगों में तेजी से प्रगति हुई। ELMo को अक्सर BERT के साथ पाठ के लिए Machine learning के आधुनिक युग में एक आधारभूत मॉडल के रूप में उद्धृत किया जाता है।

विधि ने Neural network वास्तुकलाओं के महत्व को भी उजागर किया जो लंबी दूरी की निर्भरताओं को पकड़ती हैं, एक अवधारणा जिसे बाद में Transformer (architecture)-आधारित मॉडलों में परिष्कृत किया गया। ELMo की वर्ण-स्तरीय इनपुट हैंडलिंग ने इसे शब्दावली से बाहर के शब्दों के प्रति मजबूत बनाया, एक विशेषता जिसने बाद की एम्बेडिंग तकनीकों को प्रभावित किया। हालांकि ELMo स्वयं अब उत्पादन में व्यापक रूप से उपयोग नहीं किया जाता है, इसके सिद्धांत कई समकालीन एनएलपी प्रणालियों में अंतर्निहित हैं।

References

  • Peters, M. E., et al. (2018). Deep contextualized word representations. Proceedings of NAACL-HLT.
  • Allen Institute for Artificial Intelligence. (2018). ELMo: Deep contextualized word representations. Official release notes.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·word-embeddings·deep-learning·language-models
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास