अंग्रेज़ी से अनुवादित

MNLI (Multi-Genre Natural Language Inference) एक बेंचमार्क डेटासेट है जो प्राकृतिक भाषा समझ का मूल्यांकन करने के लिए उपयोग किया जाता है। इसमें जोड़ीदार आधार (premise) और परिकल्पना (hypothesis) वाक्य शामिल हैं, जिनके लिए मॉडलों को विभिन्न शैलियों में संबंध को निहितार्थ (entailment), विरोधाभास (contradiction), या तटस्थ (neutral) के रूप में वर्गीकृत करना होता है।

MNLI (मल्टी-जॉनर नेचुरल लैंग्वेज इन्फरेंस), जिसे मल्टीNLI कॉर्पस के रूप में भी जाना जाता है, एक बड़े पैमाने का बेंचमार्क डेटासेट है जिसका उपयोग कृत्रिम बुद्धिमत्ता का मूल्यांकन करने के लिए किया जाता है, विशेष रूप से प्राकृतिक भाषा अनुमान के क्षेत्र में। इसे किसी मॉडल की यह निर्धारित करने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है कि दिया गया परिकल्पना किसी दिए गए आधार से निहित है, विरोधाभासी है, या स्वतंत्र है। 2018 में न्यूयॉर्क विश्वविद्यालय के शोधकर्ताओं द्वारा जारी, यह परियोजना अदीना विलियम्स, निकिता नंगिया और सैमुअल आर. बोमन के नेतृत्व में थी, और इसे व्यापक रूप से पहले के स्टैनफोर्ड नेचुरल लैंग्वेज इन्फरेंस (SNLI) कॉर्पस का उत्तराधिकारी माना जाता है, जिसमें केवल एक ही शैली (कैप्शन वाली छवियाँ) शामिल थीं।

डेटासेट में लगभग 433,000 वाक्य जोड़े शामिल हैं, जो लगभग 393,000 अद्वितीय जोड़ों के प्रशिक्षण सेट, लगभग 9,800 जोड़ों के विकास सेट (dev_matched विभाजन), और 9,800 जोड़ों के दो परीक्षण सेट (test_matched और test_mismatched विभाजन) में विभाजित हैं। MNLI की विशिष्ट विशेषता अमेरिकी अंग्रेजी की दस अलग-अलग लिखित और बोली जाने वाली शैलियों का समावेश है, जिन्हें पाँच शैलियों में समूहीकृत किया गया है: आमने-सामने, पत्र, 9/11, बिक्री, कथा, यात्रा, सरकार, गतिशील, अदालत, शब्दशः। ये शैलियाँ OpenSubtitles, ब्राउन कॉर्पस, स्विचबोर्ड कॉर्पस और सरकारी रिपोर्टों सहित अन्य स्रोतों से प्राप्त की गई थीं। यह अतिरिक्त विविधता मॉडलों को एकल भाषा डोमेन से परे सामान्यीकरण करने के लिए मजबूर करने के लिए है, जिससे बेंचमार्क वास्तविक दुनिया की NLP चुनौतियों का अधिक प्रतिनिधि बन जाता है।

MNLI में प्रत्येक लेबल किया गया जोड़ा एक आधार और एक परिकल्पना रखता है, दोनों मानव एनोटेटरों द्वारा लिखे गए हैं, जहाँ उनके बीच संबंध को तीन लेबलों में से एक सौंपा गया है: निहितार्थ (परिकल्पना तार्किक रूप से आधार से अनुसरण करती है), विरोधाभास (परिकल्पना आधार के साथ संघर्ष करती है), या तटस्थ (न तो निहितार्थ और न ही विरोधाभास)। एनोटेटरों को जोड़े बनाने और लेबल करने में स्पष्ट दिशानिर्देश दिए गए थे, यह सुनिश्चित करते हुए कि लेबल आधारों पर आधारित हैं, और निम्न-गुणवत्ता या त्रुटिपूर्ण नमूनों को फ़िल्टर करने के लिए गुणवत्ता नियंत्रण तंत्र लागू किए गए थे। डेटासेट पूरी तरह से एक विशेष नोट के साथ कैप्चर किया गया है कि इसका उपयोग कई डिजिटल संस्थाओं के बीच मशीन लर्निंग और डीप लर्निंग में बेंचमार्क के रूप में बड़े पैमाने पर किया गया है।

अपनी रिलीज़ के बाद से, MNLI बड़े पैमाने के भाषा मॉडल और ट्रांसफॉर्मर-आधारित आर्किटेक्चर के विकास में सहायक रहा है। यह GLUE बेंचमार्क (जनरल लैंग्वेज अंडरस्टैंडिंग इवैल्यूएशन) और बाद में SuperGLUE बेंचमार्क में एक प्रमुख कार्य बन गया, जहाँ BERT, RoBERTa और T5 जैसे मॉडलों ने उच्च सटीकता हासिल की है। क्योंकि test_mismatched भाग प्रशिक्षण के दौरान नहीं देखी गई शैलियों से आता है, MNLI विशेष रूप से डोमेन शिफ्ट के प्रति मॉडल की मजबूती को मापने के लिए उपयुक्त है। उदाहरण के लिए, सरल, संवादात्मक पाठ पर प्रशिक्षित मॉडलों का मूल्यांकन औपचारिक दस्तावेजों पर किया जाता है, और मापा गया प्रदर्शन अक्सर अनदेखी शैलियों पर काफी गिर जाता है, जो एकल-शैली डेटासेट की तुलना में अधिक कठोर मूल्यांकन प्रदान करता है।

डेटासेट औपचारिक रूप से प्रलेखित है, और यह लेबल विश्वसनीयता और मानव एनोटेशन में पूर्वाग्रहों के संबंध में निरंतर जांच के अधीन रहा है। 2023 तक, MNLI डेटासेट ने अधिक चुनौतीपूर्ण मूल्यांकनों की ओर धकेल दिया है और BERT स्कोर के माध्यम से, लेकिन सीमाएँ मैन्युअल लेबलिंग की उच्च लागत और व्यापक शैली कवरेज बनी हुई हैं। हालाँकि, इसकी व्यापक शैली कवरेज ने क्रॉस-डोमेन प्रशिक्षण के लिए डेटासेट का मार्ग प्रशस्त किया है, और यह AI सिस्टम के प्रशिक्षण और मूल्यांकन के लिए एक मुख्य आधार बना हुआ है, जिसमें अत्याधुनिक प्रदर्शन अब कुछ विभाजनों पर मानव-स्तर की सटीकता से अधिक है (हालाँकि अभी तक पूर्ण नहीं)।

ऑक्सफोर्ड विश्वविद्यालय और स्टैनफोर्ड AI लैब सहित संस्थाओं के शोधकर्ताओं ने तंत्रिका नेटवर्क में भाषाई ज्ञान का पता लगाने के लिए MNLI का उपयोग किया है, और OpenAI और Google DeepMind जैसे बड़े भाषा मॉडल के डेवलपर्स ने तथ्यात्मक और तार्किक तर्क को समझने के लिए मॉडलों को फाइन-ट्यून करने में इसके उपयोग की सूचना दी है। डेटासेट का प्रभाव NLP अनुसंधान से परे सिंथेटिक डेटा जनरेशन, शब्दार्थ समानता कार्यों और यहाँ तक कि कार्य-उन्मुख संवाद प्रणालियों और प्रश्न उत्तर जैसे डाउनस्ट्रीम अनुप्रयोगों तक फैला हुआ है।

संरचना और डिज़ाइन

MNLI कॉर्पस उन आधारों पर बनाया गया है जो स्वतंत्र रूप से उपलब्ध ऑनलाइन स्रोतों से निकाले गए वाक्य हैं। परिकल्पना वाक्य मैन्युअल रूप से उत्पन्न होते हैं और आम तौर पर आधारों से छोटे और अधिक सिंथेटिक होते हैं, लेकिन वे आवश्यक रूप से सख्त तथ्यात्मक सामग्री पर आधारित नहीं होते हैं। प्रत्येक परिकल्पना को एक आधार के साथ जोड़ा जाता है ताकि त्रि-लेबल उदाहरण बन सके। कठोर निश्चित टेम्पलेट्स का उपयोग करने के बजाय, निर्माताओं ने अनुमेय संचालन के सख्त सेट के साथ नियमों का उपयोग किया: पहले, एनोटेटर आधार के साथ तार्किक संबंध के आधार पर एक परिकल्पना लिखता है, फिर दूसरा एनोटेटर इसे स्वतंत्र रूप से सत्यापित करता है, और असहमति को तीसरे एनोटेटर द्वारा हल किया जाता है। इस त्रिगुण एनोटेशन प्रक्रिया ने पहले पास पर लगभग 83% समझौते के स्तर तक पहुँचने में मदद की, और अंतिम लेबल में प्राकृतिक टूटने के कारण भी जोड़ा गया है, लेकिन तुलना के लिए, आधिकारिक लीडरबोर्ड ने कार्यों के एक उपसमूह पर समझौते के स्कोर का उपयोग किया।

डेटासेट में सामान्यीकरण का मूल्यांकन करने के लिए कई विभाजन शामिल हैं। मिलान किए गए अनुभाग प्रशिक्षण सेट के समान शैलियों से अलग रखे गए हैं, जबकि बेमेल अनुभाग प्रशिक्षण में प्रतिनिधित्व नहीं की गई शैलियों से अलग रखे गए हैं। प्रशिक्षण सेट दस शैलियों को कवर करता है, लेकिन बेमेल परीक्षण सख्त अर्थों में केवल उन्हीं दस शैलियों से नहीं आता - वास्तव में बेमेल परीक्षण अपने स्रोत को उन्हीं शैलियों के सेट से खींचता है, लेकिन समग्र रूप से अलग-अलग कार्यों के सेट से, और प्रत्येक शैली के लिए अद्वितीय है। इसलिए, बेमेल मूल्यांकन के लिए न केवल शब्दावली बल्कि शैली की चौड़ाई भी आवश्यक है। उदाहरण के लिए, दुर्लभ प्रारूपों (जैसे अत्यधिक विशिष्ट कानूनी पाठ) का बहिष्कार एक मॉडल को उजागर कर सकता है, और डेटा JSON Lines प्रारूप में सार्वजनिक रूप से जारी किया गया है और प्रशिक्षण, सत्यापन और परीक्षण के लिए उपयोग किया जा सकता है।

मूल्यांकन और महत्व

MNLI पर उपयोग किया जाने वाला प्राथमिक मीट्रिक मिलान और बेमेल दोनों विभाजनों पर सटीकता है। सेट को GLUE बेंचमार्क के लिए अपनाया गया था, जहाँ मॉडलों को औसत मानव विशेषज्ञों से ऊपर प्रदर्शन करने के लिए मिलान पर 91% और बेमेल पर 89% सटीकता तक पहुँचने की आवश्यकता होती है। वर्षों से, स्कोर शुरुआती RNN मॉडलों के लिए लगभग 71% से बढ़कर बड़े प्रीट्रेन्ड ट्रांसफॉर्मर के लिए 90% से ऊपर हो गए हैं। इन उच्च स्कोरों ने कुछ लोगों को कठिनाई पर सवाल उठाने के लिए प्रेरित किया है, लेकिन बेमेल विभाजन का अस्तित्व चुनौती को बनाए रखता है।

असंतुलित शैली सेट से प्राप्त मजबूती के पहलू, जबकि परीक्षण में प्राकृतिक और संख्यात्मक डेटा से विवादास्पद तत्व भी शामिल हैं। उदाहरण के लिए, लेबल सेट पूरी तरह से संतुलित नहीं हैं, लगभग 33% समझौते के साथ, और प्रदर्शन हमेशा अंग्रेजी से अन्य भाषाओं में अनुवादित नहीं होता है, क्योंकि यह स्वाभाविक रूप से एक अंग्रेजी संसाधन है। 2019 के अंत में, शोधकर्ताओं ने पाया कि मॉडल कठोर अनुमानों और फ़िल्टरों का उपयोग करते हैं, जैसे सीधा वाक्यांश ओवरलैप, और डेटासेट को सच्चे तार्किक तर्क की आवश्यकता नहीं होने के लिए आलोचना की गई है, जिससे समझ के माप के रूप में NLI की वैधता पर बहस हुई है। फिर भी, MNLI पर सफल होने वाले मॉडलों का अध्ययन आर्किटेक्चर और तकनीकों (मॉडल स्केलिंग, संरचित स्थिरांक) के विकास के लिए बेंचमार्क में योगदान दिया है, और लगभग हर ML प्रतिलिपि प्रस्तुत करने योग्य अध्ययन में एक डिफ़ॉल्ट उपकरण बना हुआ है।

उपयोग और प्रभाव

इसका उपयोग शैक्षणिक और कॉर्पोरेट दोनों सेटिंग्स में किया जाता है, जिसमें Blackrock, Microsoft अपने Azure क्लाउड के लिए, और Nvidia (हालाँकि Nvidia सीधे लिंक की सूची में नहीं है, कई परियोजनाओं ने प्री-ट्रेनिंग में प्रभावी शोध चलाया है) जैसे प्रविष्टियाँ शामिल हैं; Google प्लेटफ़ॉर्म सिस्टम में, और Google Cloud बाद में ऐसे प्रशिक्षण के लिए परोसा जाता है। व्यवहार में, तैनाती से पहले स्थिरता और तर्क की जाँच करने के लिए किसी भी Large language model (सूची में शामिल) को फाइन-ट्यून करने के लिए यह अब एक सामान्य चेकपॉइंट है। अन्य इसे 9 स्थानों के घटकों में से एक बनाने में शामिल हैं, इस प्रकार, वे नेटवर्क की अनुमति देते हैं जो संदर्भ का मूल्यांकन करते हैं या उनमें सत्यापन चरण के साथ आते हैं। कुल मिलाकर, MNLI आधुनिक AI के लिए एक मुख्य वैज्ञानिक उपकरण है और 2025 तक, लीग में कई फ्रेमवर्क में अभी भी उपयोगी है।

सीमाएँ और भविष्य की दिशाएँ

किसी भी डेटासेट की तरह, MNLI में प्रतिबंध हैं जो इसके मानव-उन्मुख निर्माण से आते हैं। शोधकर्ताओं ने बोली बदलाव, लेबल शोर में कमी और लिंग पूर्वाग्रहों पर अज्ञात मॉडल से प्रदर्शन अस्थिरता देखी है, हालाँकि इसके सत्यापन योग्य और लोकतांत्रिक रूप से बनाए गए स्रोतों ने इसे उच्च प्रदर्शन दावों के खिलाफ एक आधार बना दिया है। भविष्य में, विभिन्न प्रयोगशालाओं से विस्तार सिंथेटिक और क्रॉस-भाषाई संस्करणों के कारण इसे प्रदान करने का प्रयास करते हैं, लेकिन MNLI की विरासत भाषा की निष्पक्ष देखरेख के लिए शून्य-शॉट क्षमता प्रदान करने में खड़ी है। कई मायनों में, इसने SNLI से SuccessNLI तक मानक बनाया, उच्च विविधता और एक कार्य साबित किया जो पूरे क्षेत्र को, BER सहित ट्रांसफॉर्मर से, और 2018 में उस कृत्रिम बुद्धिमत्ता के एक कलाकृति के रूप में बना रह सकता है।

संदर्भ

  • विलियम्स, ए., नंगिया, एन., और बोमन, एस. आर. (2018)। वाक्य समझ के माध्यम से अनुमान के लिए एक व्यापक-कवरेज चुनौती कॉर्पस।
  • वांग, ए., एट अल. (2018)। GLUE: प्राकृतिक भाषा समझ के लिए एक बहु-कार्य बेंचमार्क और विश्लेषण प्लेटफ़ॉर्म।
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·benchmark·dataset·ai-evaluation
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास