अंग्रेज़ी से अनुवादित

XLNet एक autoregressive Transformer मॉडल है जो प्राकृतिक भाषा प्रसंस्करण के लिए है, जिसे जून 2019 में BERT के सुधार के रूप में जारी किया गया था। यह द्विदिशात्मक संदर्भ को पकड़ने के लिए क्रमपरिवर्तन भाषा मॉडलिंग का उपयोग करता है, जिससे विभिन्न कार्यों पर अत्याधुनिक परिणाम प्राप्त होते हैं।

XLNet एक Artificial intelligence मॉडल है जो प्राकृतिक भाषा प्रसंस्करण के लिए है, जिसे 19 जून 2019 को एक स्वप्रतिगामी Transformer (architecture) वास्तुकला के रूप में पेश किया गया था। इसे BERT में सुधार के रूप में डिज़ाइन किया गया था, जो मास्क्ड भाषा मॉडलिंग की सीमाओं को संबोधित करने के लिए क्रमचय भाषा मॉडलिंग का उपयोग करके द्विदिशात्मक संदर्भ को पकड़ता है। मॉडल में 340 मिलियन पैरामीटर हैं और इसे 33 बिलियन शब्दों के कोष पर प्रशिक्षित किया गया था, जिससे भाषा मॉडलिंग, प्रश्न उत्तर, और प्राकृतिक भाषा अनुमान जैसे कार्यों पर अत्याधुनिक परिणाम प्राप्त हुए। इसे Apache 2.0 लाइसेंस के तहत जारी किया गया था, जिससे यह अनुसंधान और वाणिज्यिक उपयोग दोनों के लिए स्वतंत्र रूप से उपलब्ध है।

XLNet Large language model के व्यापक परिवार से संबंधित है, जो Neural network प्रणालियाँ हैं जो विशाल पाठ कोषों पर प्रशिक्षित होती हैं ताकि मानव भाषा को समझा और उत्पन्न किया जा सके। इसका विकास Deep learning और Transformer (architecture) वास्तुकला में प्रगति पर आधारित था, जिसने 2017 में अपनी शुरुआत के बाद से क्षेत्र में क्रांति ला दी थी। पहले के मॉडलों के विपरीत जो पाठ को एक निश्चित बाएं-से-दाएं या दाएं-से-बाएं क्रम में संसाधित करते थे, XLNet ने एक नया प्रशिक्षण उद्देश्य पेश किया जो एक वाक्य के सभी संभावित क्रमचयों पर विचार करता है, जिससे यह बाएं और दाएं दोनों संदर्भों से एक साथ सीख सकता है।

वास्तुकला

XLNet का मूल नवाचार क्रमचय भाषा मॉडलिंग है। मानक स्वप्रतिगामी मॉडलिंग में, "My dog is cute" जैसा वाक्य सशर्त संभावनाओं के उत्पाद के रूप में गुणनखंडित किया जाता है, जहाँ प्रत्येक शब्द की भविष्यवाणी पिछले सभी शब्दों के आधार पर की जाती है: Pr(My) × Pr(dog|My) × Pr(is|My, dog) × Pr(cute|My, dog, is)। यह बाएं-से-दाएं क्रम मॉडल की भविष्य के संदर्भ का उपयोग करने की क्षमता को सीमित करता है। हालाँकि, XLNet प्रशिक्षण के दौरान शब्दों के क्रम को बेतरतीब ढंग से क्रमचयित करता है। उदाहरण के लिए, 3-2-4-1 के क्रमचय क्रम के साथ, मॉडल पहले "is" की भविष्यवाणी करता है, फिर "dog", फिर "cute", और अंत में "My", हर बार उन शब्दों पर आधारित होता है जो उस क्रमचय में पहले ही उत्पन्न हो चुके हैं। सभी संभावित क्रमचयों पर प्रशिक्षण देकर, मॉडल BERT के समान द्विदिशात्मक संदर्भ का उपयोग करना सीखता है, लेकिन उन कृत्रिम [MASK] टोकनों के बिना जिन पर BERT निर्भर करता है।

दो-धारा स्व-ध्यान

क्रमचय भाषा मॉडलिंग को लागू करने के लिए, XLNet एक दो-धारा स्व-ध्यान तंत्र का उपयोग करता है। पहली धारा, जिसे सामग्री धारा कहा जाता है, प्रत्येक शब्द की वास्तविक सामग्री को मानक कारणात्मक रूप से मास्क्ड स्व-ध्यान का उपयोग करके एन्कोड करती है, जो एक सामान्य Transformer (architecture) डिकोडर के समान है। दूसरी धारा, जिसे क्वेरी धारा कहा जाता है, प्रत्येक शब्द की सामग्री को क्रमचय में अब तक उत्पन्न संदर्भ के संदर्भ में एन्कोड करती है। यह एक मास्क्ड क्रॉस-ध्यान तंत्र का उपयोग करती है जहाँ क्वेरी क्वेरी धारा से आती हैं और कुंजी-मूल्य जोड़े सामग्री धारा से आते हैं। यह पृथक्करण मॉडल को अपनी स्वयं की सामग्री को देखे बिना एक शब्द की भविष्यवाणी करने की अनुमति देता है, जो क्रमचय उद्देश्य के लिए आवश्यक है। दोनों धाराएँ प्रशिक्षण के दौरान संयुक्त होती हैं, और अनुमान के दौरान केवल सामग्री धारा का उपयोग किया जाता है।

प्रशिक्षण और प्रदर्शन

XLNet को 33 बिलियन शब्दों के एक बड़े कोष पर प्रशिक्षित किया गया था, जिसमें पुस्तकों, वेब पेजों और अन्य स्रोतों से पाठ शामिल था। प्रशिक्षण प्रक्रिया ने क्रमचय भाषा मॉडलिंग उद्देश्य का उपयोग किया, जिसमें मॉडल प्रत्येक प्रशिक्षण उदाहरण के लिए एक क्रमचय क्रम को बेतरतीब ढंग से नमूना करता था। मॉडल के 340 मिलियन पैरामीटर इसे BERT-large के आकार के बराबर बनाते थे, लेकिन इसका प्रशिक्षण उद्देश्य इसे कई बेंचमार्कों पर बेहतर प्रदर्शन प्राप्त करने की अनुमति देता था। उदाहरण के लिए, GLUE बेंचमार्क पर, जो कई कार्यों में प्राकृतिक भाषा समझ का परीक्षण करता है, XLNet ने अधिकांश कार्यों में BERT से बेहतर प्रदर्शन किया, जिसमें भावना विश्लेषण, प्रश्न उत्तर, और पाठीय आधार्य शामिल हैं। इसने SQuAD प्रश्न उत्तर डेटासेट और भाषा मॉडलिंग पर्प्लेक्सिटी कार्यों पर भी अत्याधुनिक परिणाम प्राप्त किए।

XLNet का एक उल्लेखनीय लाभ लंबी-सीमा निर्भरताओं को पकड़ने की इसकी क्षमता है। क्योंकि यह सभी क्रमचयों पर विचार करता है, मॉडल मूल वाक्य में दूर स्थित शब्दों के बीच संबंध सीख सकता है, भले ही वे किसी विशेष क्रमचय में आसन्न हों। यह उन कार्यों के लिए विशेष रूप से उपयोगी है जिन्हें वैश्विक संदर्भ की समझ की आवश्यकता होती है, जैसे दस्तावेज़ वर्गीकरण या सहसंदर्भ समाधान।

BERT के साथ तुलना

BERT, जिसे 2018 में पेश किया गया था, ने एक मास्क्ड भाषा मॉडलिंग उद्देश्य का उपयोग किया जहाँ इनपुट टोकनों के एक प्रतिशत को [MASK] से बदल दिया जाता है, और मॉडल को मूल टोकनों की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है। हालाँकि यह प्रभावी है, इस दृष्टिकोण की सीमाएँ हैं: [MASK] टोकन फाइन-ट्यूनिंग या अनुमान के दौरान मौजूद नहीं होते हैं, जिससे प्रशिक्षण और तैनाती के बीच एक बेमेल पैदा होता है। इसके अतिरिक्त, BERT मानता है कि मास्क्ड टोकन एक दूसरे से स्वतंत्र हैं, जो हमेशा सत्य नहीं होता है। XLNet क्रमचय भाषा मॉडलिंग का उपयोग करके इन मुद्दों को संबोधित करता है, जो [MASK] टोकनों पर निर्भर नहीं करता है और मॉडल को सभी टोकनों के बीच निर्भरताओं को पकड़ने की अनुमति देता है। यह XLNet को प्रशिक्षण और अनुमान के बीच अधिक सुसंगत बनाता है, और यह संयुक्त संभाव्यता वितरणों को अधिक सटीक रूप से मॉडल कर सकता है।

हालाँकि, क्रमचय दृष्टिकोण की कम्प्यूटेशनल लागत भी है। XLNet को BERT की तुलना में अधिक प्रशिक्षण समय की आवश्यकता होती है क्योंकि इसे प्रत्येक प्रशिक्षण उदाहरण के लिए कई क्रमचयों को संसाधित करना पड़ता है। दो-धारा स्व-ध्यान तंत्र भी वास्तुकला में जटिलता जोड़ता है। इन लागतों के बावजूद, प्रदर्शन लाभ ने XLNet को अपने जारी होने के समय कई NLP अनुप्रयोगों के लिए एक लोकप्रिय विकल्प बना दिया।

प्रभाव और विरासत

XLNet का Machine learning और प्राकृतिक भाषा प्रसंस्करण के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा। इसने प्रदर्शित किया कि स्वप्रतिगामी मॉडल मास्क्ड भाषा मॉडलों के प्रदर्शन को मिला सकते हैं या उससे आगे निकल सकते हैं, जबकि एक अधिक सैद्धांतिक रूप से सुदृढ़ प्रशिक्षण उद्देश्य प्रदान करते हैं। इसकी सफलता ने क्रमचय-आधारित और क्रमचय-समवर्ती मॉडलों में आगे के अनुसंधान को प्रेरित किया। कई बाद के मॉडल, जैसे ELECTRA और T5, ने XLNet के विचारों पर निर्माण किया, और क्रमचय भाषा मॉडलिंग की अवधारणा ने बाद के बड़े भाषा मॉडलों के डिज़ाइन को प्रभावित किया। हालाँकि XLNet को GPT-3 और T5 जैसे अधिक शक्तिशाली मॉडलों द्वारा प्रतिस्थापित कर दिया गया है, यह Generative AI और Transformer (architecture)-आधारित वास्तुकलाओं के विकास में एक महत्वपूर्ण मील का पत्थर बना हुआ है। Apache 2.0 लाइसेंस के तहत इसका ओपन-सोर्स जारी होना भी AI अनुसंधान के लोकतंत्रीकरण में योगदान दिया, जिससे दुनिया भर के शोधकर्ताओं और डेवलपर्स को मॉडल का उपयोग और संशोधन करने की अनुमति मिली।

संदर्भ

  • Yang, Z., Dai, Z., Yang, Y., Carbonell, J., Salakhutdinov, R., & Le, Q. V. (2019). XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv preprint arXiv:1906.08237.
  • Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv preprint arXiv:1810.04805.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·transformer-models·deep-learning·language-models
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास