WNLI, जिसे विनोग्राद नेचुरल लैंग्वेज इन्फरेंस के रूप में संक्षिप्त किया जाता है, प्राकृतिक भाषा प्रसंस्करण में एक बेंचमार्क कार्य है जो विनोग्राद स्कीमा पर प्राकृतिक भाषा अनुमान करने की एक AI प्रणाली की क्षमता का मूल्यांकन करता है। एक विनोग्राद स्कीमा वाक्यों की एक जोड़ी है जो केवल एक शब्द या वाक्यांश में भिन्न होती है, फिर भी एक सर्वनाम या अन्य अस्पष्ट संदर्भ के विभिन्न समाधानों की आवश्यकता होती है। यह कार्य पूछता है कि क्या एक दिया गया परिकल्पना एक आधार के संबंध में निहित है, विरोधाभासी है, या तटस्थ है, जहां सही उत्तर सरल शाब्दिक पैटर्न के बजाय वास्तविक-विश्व संदर्भ को समझने पर निर्भर करता है।
यह बेंचमार्क GLUE (सामान्य भाषा समझ मूल्यांकन) सुइट के हिस्से के रूप में पेश किया गया था, जो मशीन लर्निंग मॉडल की सामान्य क्षमताओं को मापने के लिए डिज़ाइन किए गए नौ प्राकृतिक भाषा समझ कार्यों का एक संग्रह है। WNLI को विशेष रूप से सामान्य ज्ञान तर्क और सहसंदर्भ समाधान की जांच के लिए शामिल किया गया था, ऐसे क्षेत्र जहां प्रारंभिक तंत्रिका मॉडल अक्सर अन्य कार्यों पर मजबूत प्रदर्शन के बावजूद विफल रहे। डेटासेट मूल विनोग्राद स्कीमा चैलेंज से लिया गया है, जिसे 2011 में हेक्टर लेवेस्क द्वारा ट्यूरिंग परीक्षण के विकल्प के रूप में प्रस्तावित किया गया था, जो उन समस्याओं पर केंद्रित था जो मनुष्यों के लिए आसान हैं लेकिन मशीनों के लिए कठिन हैं।
संरचना और उदाहरण
प्रत्येक WNLI उदाहरण में एक आधार वाक्य, एक परिकल्पना वाक्य, और एक लेबल होता है जो दर्शाता है कि परिकल्पना आधार से अनुसरण करती है (निहितार्थ), इसका विरोध करती है (विरोधाभास), या असंबंधित है (तटस्थ)। आधार में आमतौर पर एक अस्पष्ट सर्वनाम होता है, और परिकल्पना उस सर्वनाम को दो संभावित तरीकों में से एक में हल करती है। उदाहरण के लिए, आधार "ट्रॉफी भूरे सूटकेस में फिट नहीं होती क्योंकि यह बहुत छोटा है" को परिकल्पना "ट्रॉफी बहुत छोटी है" (निहितार्थ) या "सूटकेस बहुत छोटा है" (विरोधाभास) के साथ जोड़ा जा सकता है। सही लेबल के लिए भौतिक आकार संबंधों और विशिष्ट वस्तु गुणों को समझने की आवश्यकता होती है।
मूल विनोग्राद स्कीमा चैलेंज में ऐसे 273 उदाहरण हैं, लेकिन GLUE संस्करण में WNLI इनमें से एक उपसमुच्चय शामिल करता है, जिसे प्राकृतिक भाषा अनुमान प्रारूप में पुनः स्वरूपित किया गया है। यह कार्य जानबूझकर इस तरह से निर्मित किया गया है कि सांख्यिकीय संकेत, जैसे शब्द आवृत्ति या सह-घटना, इसे विश्वसनीय रूप से हल करने के लिए अपर्याप्त हैं। यह WNLI को एक मजबूत परीक्षण बनाता है कि क्या एक मॉडल रोजमर्रा की स्थितियों के बारे में वास्तविक तर्क कर सकता है।
ऐतिहासिक प्रदर्शन और चुनौतियाँ
जब GLUE 2018 में जारी किया गया था, WNLI समकालीन मॉडलों के लिए सबसे कठिन कार्यों में से एक साबित हुआ। कई प्रारंभिक प्रणालियाँ, जिनमें आवर्ती तंत्रिका नेटवर्क और प्रारंभिक ट्रांसफार्मर आर्किटेक्चर पर आधारित शामिल थे, ने यादृच्छिक अनुमान से मुश्किल से अधिक सटीकता हासिल की। एक उल्लेखनीय मुद्दा यह था कि WNLI के लिए प्रशिक्षण सेट बहुत छोटा था, जिसमें केवल 634 प्रशिक्षण उदाहरण थे, और सत्यापन सेट और भी छोटा था। इस सीमित डेटा ने मॉडलों के लिए सामान्यीकरण योग्य पैटर्न सीखना कठिन बना दिया।
एक महत्वपूर्ण जटिलता इस तथ्य से उत्पन्न हुई कि मूल विनोग्राद स्कीमा चैलेंज उदाहरण प्राकृतिक भाषा अनुमान प्रारूप के लिए डिज़ाइन नहीं किए गए थे। कई शोधकर्ताओं ने देखा कि रूपांतरण प्रक्रिया ने असंगतियाँ पेश कीं, और कुछ उदाहरणों में अस्पष्ट या विवादास्पद लेबल थे। 2019 में, वाशिंगटन विश्वविद्यालय की एक टीम के एक पेपर ने दिखाया कि कई WNLI उदाहरण सरल अनुमानों द्वारा हल किए जा सकते हैं, जैसे कि कुछ वाक्य संरचनाओं के लिए हमेशा "निहितार्थ" की भविष्यवाणी करना, जिसने बेंचमार्क के इच्छित कठिनाई को कमजोर कर दिया। इससे आलोचना हुई कि WNLI सामान्य ज्ञान तर्क का विश्वसनीय माप नहीं था।
आधुनिक AI प्रणालियों से संबंध
OpenAI, Anthropic, और Google DeepMind द्वारा विकसित बड़े भाषा मॉडल के आगमन के साथ, WNLI पर प्रदर्शन में नाटकीय रूप से सुधार हुआ है। अरबों मापदंडों वाले आधुनिक ट्रांसफार्मर-आधारित मॉडल, जिनमें शामिल हैं, बेंचमार्क पर लगभग पूर्ण सटीकता प्राप्त कर सकते हैं। हालांकि, यह सुधार आंशिक रूप से मॉडलों के प्रीट्रेनिंग के दौरान पाठ की विशाल मात्रा के संपर्क के लिए जिम्मेदार है, जिसमें विनोग्राद स्कीमा के पर्यायवाची शामिल हो सकते हैं। परिणामस्वरूप, कुछ शोधकर्ताओं का तर्क है कि WNLI पर उच्च स्कोर अब वास्तविक तर्क क्षमता का प्रदर्शन नहीं करते हैं, बल्कि प्रशिक्षण डेटा से स्मरण या पैटर्न मिलान करते हैं।
बेंचमार्क को व्यापक मूल्यांकन सुइट्स में भी शामिल किया गया है, जैसे कि SuperGLUE, जिसने WNLI को Winogrande नामक एक अधिक मजबूत संस्करण के साथ बदल दिया। Winogrande डेटासेट को 44,000 से अधिक उदाहरणों तक विस्तारित करता है और प्राकृतिक भाषा अनुमान के बजाय एक द्विआधारी विकल्प प्रारूप का उपयोग करता है, जो मूल कार्य की कुछ कमजोरियों को संबोधित करता है। इन परिवर्तनों के बावजूद, WNLI प्राकृतिक भाषा समझ बेंचमार्क के विकास में एक ऐतिहासिक रूप से महत्वपूर्ण संदर्भ बिंदु बना हुआ है।
आलोचनाएँ और विरासत
WNLI व्यापक पद्धतिगत आलोचना का विषय रहा है। डेटासेट का छोटा आकार, असंगत लेबलिंग, और सतह-स्तरीय पैटर्न का शोषण करने में मॉडलों की आसानी सभी दस्तावेजित किए गए हैं। 2021 में, एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा एक विश्लेषण में पाया गया कि एक सरल नियम-आधारित प्रणाली WNLI पर 70% से अधिक सटीकता प्राप्त कर सकती है, जो उस समय कई तंत्रिका मॉडलों के प्रदर्शन से कहीं अधिक है। इस खोज ने सावधानीपूर्वक बेंचमार्क डिज़ाइन के महत्व और प्रतिकूल मूल्यांकन विधियों की आवश्यकता पर प्रकाश डाला।
इन मुद्दों के बावजूद, WNLI ने सहसंदर्भ समाधान और सामान्य ज्ञान तर्क पर शोध को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई। इसने नए आर्किटेक्चर और प्रशिक्षण तकनीकों के विकास को प्रेरित किया, जैसे कि स्पैन-आधारित भविष्यवाणी और ज्ञान-वर्धित मॉडल। WNLI से सीखे गए पाठों ने बाद के बेंचमार्क के डिज़ाइन को प्रभावित किया, जिसमें Winogrande और व्यापक GLUE और SuperGLUE सुइट्स शामिल हैं, जो बड़े भाषा मॉडल के मूल्यांकन में व्यापक रूप से उपयोग किए जाते हैं।
वर्तमान स्थिति
2020 के दशक की शुरुआत तक, WNLI शायद ही कभी एक स्वतंत्र मूल्यांकन मीट्रिक के रूप में उपयोग किया जाता है, जिसे अधिक मजबूत डेटासेट द्वारा प्रतिस्थापित किया गया है। हालांकि, यह ऐतिहासिक विश्लेषणों और शोध पत्रों में एक आधार रेखा के रूप में दिखाई देता रहता है। कार्य की विरासत उन बेंचमार्क बनाने के चल रहे प्रयास में बनी हुई है जो वास्तव में स्मरण के बजाय तर्क का परीक्षण करते हैं, एक चुनौती जो Artificial intelligence के क्षेत्र में केंद्रीय बनी हुई है। मूल विनोग्राद स्कीमा चैलेंज, जिससे WNLI प्राप्त होता है, सांख्यिकीय शिक्षण की सीमाओं और प्रतीकात्मक तर्क क्षमताओं की आवश्यकता के बारे में चर्चाओं में अभी भी संदर्भित है।