XLNet एक स्वतःप्रतिगामी (autoregressive) Transformer (architecture) मॉडल है जिसे प्राकृतिक भाषा प्रसंस्करण के लिए डिज़ाइन किया गया है, और इसे BERT पर सुधार के रूप में प्रस्तुत किया गया था। इसे 19 जून 2019 को Apache 2.0 लाइसेंस के तहत जारी किया गया था, जिसमें 340 मिलियन पैरामीटर थे और इसे 33 बिलियन शब्दों पर प्रशिक्षित किया गया था। इस मॉडल ने भाषा मॉडलिंग, प्रश्न उत्तरण और प्राकृतिक भाषा अनुमान सहित कार्यों में अत्याधुनिक परिणाम प्राप्त किए, और यह Large language model वास्तुकला का एक उल्लेखनीय उदाहरण है Deep learning अनुसंधान में।
BERT के विपरीत, जो मास्क्ड भाषा मॉडलिंग का उपयोग करता है, XLNet क्रमचय भाषा मॉडलिंग (permutation language modeling) का उपयोग करता है। यह दृष्टिकोण एक अनुक्रम की संयुक्त प्रायिकता को सभी संभावित क्रमों में गुणनखंडित करता है, जिससे मॉडल बिना मास्किंग पर निर्भर हुए द्विदिशात्मक संदर्भ को पकड़ सकता है। यह डिज़ाइन BERT की एक सीमा को संबोधित करने के लिए था, जहाँ मास्क्ड टोकन प्रीट्रेनिंग के दौरान नहीं देखे जाते हैं, जिससे प्रीट्रेनिंग और फाइन-ट्यूनिंग के बीच विसंगति पैदा होती है।
क्रमचय भाषा मॉडलिंग
मानक स्वतःप्रतिगामी मॉडलिंग में, एक अनुक्रम की प्रायिकता एक निश्चित बाएँ-से-दाएँ क्रम में गुणनखंडित की जाती है। उदाहरण के लिए, वाक्य "My dog is cute" को सशर्त प्रायिकताओं के गुणनफल के रूप में मॉडल किया जाता है: Pr(My) Pr(dog|My) Pr(is|My, dog) * Pr(cute|My, dog, is)। XLNet इसके बजाय टोकन पदों का एक यादृच्छिक क्रमचय नमूना लेता है और उस क्रम के अनुसार प्रायिकता को गुणनखंडित करता है। उदाहरण के लिए, क्रमचय 3-2-4-1 के साथ, मॉडल पहले "is" की भविष्यवाणी करता है, फिर "dog", फिर "cute", और अंत में "My", प्रत्येक पहले से भविष्यवाणी किए गए टोकन पर सशर्त होता है। सभी क्रमचयों पर प्रशिक्षण देकर, मॉडल दोनों दिशाओं से संदर्भ का उपयोग करना सीखता है, जिससे लंबी दूरी की निर्भरताओं को पकड़ने की क्षमता में सुधार होता है।
दो-स्ट्रीम सेल्फ-अटेंशन
क्रमचय भाषा मॉडलिंग को लागू करने के लिए, XLNet दो-स्ट्रीम सेल्फ-अटेंशन तंत्र का उपयोग करता है। पहली स्ट्रीम, जिसे कंटेंट स्ट्रीम कहा जाता है, मानक कारणात्मक सेल्फ-अटेंशन का उपयोग करके प्रत्येक टोकन की सामग्री को एन्कोड करती है। दूसरी स्ट्रीम, जिसे क्वेरी स्ट्रीम कहा जाता है, पहले से भविष्यवाणी किए गए टोकन के संदर्भ में प्रत्येक टोकन की सामग्री को एन्कोड करती है, जिसमें एक मास्क्ड क्रॉस-अटेंशन का उपयोग किया जाता है जहाँ क्वेरी क्वेरी स्ट्रीम से आती हैं और की-वैल्यू जोड़े कंटेंट स्ट्रीम से आते हैं। यह डिज़ाइन मॉडल को अपनी स्वयं की सामग्री को देखे बिना एक टोकन की भविष्यवाणी करने की अनुमति देता है, जबकि क्रमचयित क्रम में अन्य टोकन की सामग्री का लाभ उठाता है।
प्रशिक्षण और प्रदर्शन
XLNet को 33 बिलियन शब्दों के एक बड़े कोर्पस पर प्रशिक्षित किया गया था, जिसमें 340 मिलियन पैरामीटर वाले मॉडल का उपयोग किया गया था। प्रशिक्षण प्रक्रिया में क्रमचय भाषा मॉडलिंग और एक खंड-पुनर्क्रमण उद्देश्य (segment-reordering objective) दोनों शामिल थे, जिसने मॉडल को वाक्यों के बीच संबंध सीखने में मदद की। रिलीज़ पर, XLNet ने कई बेंचमार्कों पर BERT से बेहतर प्रदर्शन किया, जिसमें स्टैनफोर्ड प्रश्न उत्तरण डेटासेट (SQuAD), जनरल लैंग्वेज अंडरस्टैंडिंग इवैलुएशन (GLUE) बेंचमार्क, और कई पठन समझ कार्य शामिल हैं। इसकी सफलता ने क्रमचय-आधारित प्रीट्रेनिंग की प्रभावशीलता को प्रदर्शित किया और Generative AI और Machine learning में बाद के कार्यों को प्रभावित किया।
प्रभाव और विरासत
XLNet ने स्वतःप्रतिगामी और स्वतःएन्कोडिंग दृष्टिकोणों के बीच व्यापार-नापसंद (trade-offs) को उजागर करके पूर्व-प्रशिक्षित भाषा मॉडलों के विकास में योगदान दिया। जबकि BERT की मास्किंग रणनीति ने द्विदिशात्मक संदर्भ को सक्षम किया, इसने एक प्रीट्रेन-फाइनट्यून विसंगति पेश की; XLNet के क्रमचय दृष्टिकोण ने स्वतःप्रतिगामी गुण को बनाए रखते हुए द्विदिशात्मक संदर्भ प्राप्त करने का एक तरीका पेश किया। यह विचार बाद के मॉडलों, जैसे Transformer-XL और अन्य प्रकारों में शामिल किया गया है। हालाँकि नई वास्तुकलाओं ने तब से प्रदर्शन में XLNet को पीछे छोड़ दिया है, यह Artificial intelligence और Neural network अनुसंधान के इतिहास में एक महत्वपूर्ण मील का पत्थर बना हुआ है।
यह भी देखें
- BERT (प्रदान किए गए स्लग में नहीं है, लेकिन Transformer (architecture) के रूप में लिंक किया जा सकता है)
- Large language model
- Deep learning
- Machine learning