अंग्रेज़ी से अनुवादित

SQuAD v2.0 एक पठन समझ डेटासेट है जो SQuAD 1.1 का विस्तार करता है, जिसमें अनुत्तरित प्रश्न शामिल हैं, जो मॉडलों की क्षमता का परीक्षण करता है कि जब कोई उत्तर मौजूद न हो तो वे उत्तर देने से बचें। इसमें विकिपीडिया लेखों से 100,000 उत्तर देने योग्य और 50,000 अनुत्तरित प्रश्न शामिल हैं, जिसे 2018 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था।

SQuAD v2.0 (स्टैनफोर्ड प्रश्नोत्तर डेटासेट संस्करण 2.0) मशीन रीडिंग कॉम्प्रिहेंशन और प्रश्नोत्तर के लिए एक बेंचमार्क डेटासेट है। यह मूल SQuAD 1.1 डेटासेट का विस्तार करता है, जिसमें अनुत्तरित प्रश्नों का एक महत्वपूर्ण सेट जोड़ा गया है, जिसके लिए मॉडलों को न केवल सही उत्तर स्पैन निकालने की आवश्यकता होती है, बल्कि यह भी पहचानना होता है कि कोई प्रश्न दिए गए संदर्भ से उत्तरित नहीं किया जा सकता। यह डिज़ाइन पहले के डेटासेट की एक प्रमुख सीमा को संबोधित करता है, जहाँ मॉडल पाठ को वास्तव में समझे बिना उत्तर स्पैन का अनुमान लगाकर उच्च स्कोर प्राप्त कर सकते थे।

यह डेटासेट जून 2018 में स्टैनफोर्ड विश्वविद्यालय की एक टीम द्वारा पेश किया गया था, जिसका नेतृत्व प्रणव राजपुरकर, रॉबिन जिया और पर्सी लियांग ने किया था। इसमें 100,000 उत्तरित प्रश्न और 50,000 अनुत्तरित प्रश्न शामिल हैं, जो सभी SQuAD 1.1 में उपयोग किए गए विकिपीडिया लेखों के समान सेट से लिए गए हैं। अनुत्तरित प्रश्न मानव एनोटेटरों द्वारा तैयार किए गए हैं, जो ऐसे प्रश्नों का अनुवाद करते हैं जो लेख पाठ द्वारा वास्तव में समर्थित नहीं हैं, जिससे उन्हें उत्तरित प्रश्नों से अलग करना चुनौतीपूर्ण हो जाता है।

प्रेरणा और डिज़ाइन

SQuAD v2.0 का प्राथमिक उद्देश्य रीडिंग कॉम्प्रिहेंशन सिस्टम में "अति-आत्मविश्वास" की समस्या को हल करना था। SQuAD 1.1 में, हर प्रश्न का संदर्भ में एक गारंटीकृत उत्तर स्पैन होता था, इसलिए मॉडल को हमेशा कुछ न कुछ निकालने के लिए प्रशिक्षित किया जा सकता था, भले ही वह गलत हो। इससे ऐसी प्रणालियाँ बनीं जो बेंचमार्क पर अच्छा प्रदर्शन करती थीं, लेकिन वास्तविक दुनिया के अनुप्रयोगों में विफल रहीं, जहाँ अक्सर प्रश्नों का कोई उत्तर नहीं होता। अनुत्तरित प्रश्नों को शामिल करके, SQuAD v2.0 मॉडलों को एक अधिक मजबूत कौशल सीखने के लिए मजबूर करता है: स्पैन निकालने से पहले उत्तरितता का निर्धारण करना।

निर्माण प्रक्रिया में क्राउडवर्कर शामिल थे, जिन्होंने पहले एक पैराग्राफ के आधार पर उत्तरित प्रश्न लिखे, फिर अतिरिक्त प्रश्न लिखे जो संभावित लेकिन अनुत्तरित हैं, अक्सर संस्थाओं, संख्याओं या संबंधों को बदलकर। यह सुनिश्चित करता है कि अनुत्तरित प्रश्न उत्तरित प्रश्नों के समानार्थक रूप से समान हों, जिससे कार्य वास्तव में कठिन हो जाता है।

मूल्यांकन मेट्रिक्स

SQuAD v2.0 दो प्राथमिक मेट्रिक्स का उपयोग करता है: एक्सेक्ट मैच (EM) और F1 स्कोर। हालाँकि, SQuAD 1.1 के विपरीत, स्कोरिंग अनुत्तरित प्रश्नों को विशेष रूप से मानती है। अनुत्तरित प्रश्नों के लिए, एक मॉडल को पूर्ण क्रेडिट (EM=1, F1=1) मिलता है यदि वह "कोई उत्तर नहीं" (एक खाली स्पैन) की भविष्यवाणी करता है। यदि यह कोई गैर-खाली स्पैन की भविष्यवाणी करता है, तो उसे दोनों मेट्रिक्स में शून्य मिलता है। उत्तरित प्रश्नों के लिए, मानक स्पैन-स्तरीय EM और F1 की गणना की जाती है। समग्र स्कोर सभी प्रश्नों का औसत है, जो उत्तरित और अनुत्तरित उदाहरणों को समान महत्व देता है।

यह स्कोरिंग योजना मॉडलों को रूढ़िवादी होने के लिए प्रोत्साहित करती है: उन्हें उत्तरित प्रश्नों का उत्तर देने में सटीकता और अनुत्तरित प्रश्नों का गलत उत्तर देने के जोखिम के बीच संतुलन बनाना होता है। एक मॉडल जो हमेशा उत्तर का अनुमान लगाता है, वह अनुत्तरित आधे पर लगभग शून्य स्कोर करेगा, जबकि एक मॉडल जो हमेशा परहेज करता है, वह उत्तरित आधे पर शून्य स्कोर करेगा।

अनुसंधान पर प्रभाव

SQuAD v2.0 जल्दी ही एनएलपी समुदाय में अपने पूर्ववर्ती के साथ एक मानक बेंचमार्क बन गया। इसने अधिक परिष्कृत मॉडलों के विकास को प्रेरित किया जो उत्तरितता भविष्यवाणी को एक स्पष्ट घटक के रूप में शामिल करते हैं। कई शुरुआती गहन शिक्षण दृष्टिकोण, जैसे कि ट्रांसफार्मर पर आधारित, इस डेटासेट पर मूल्यांकन किए गए, जिससे तेजी से सुधार हुए।

डेटासेट ने बाद के बेंचमार्क जैसे Natural Questions और TriviaQA के डिज़ाइन को भी प्रभावित किया, जिनमें स्वाभाविक रूप से अनुत्तरित प्रश्न शामिल हैं। इसने प्रश्नोत्तर में कैलिब्रेशन और परहेज के महत्व को उजागर किया, एक विषय जो आधुनिक बड़े भाषा मॉडल में प्रासंगिक बना हुआ है।

लीडरबोर्ड और स्टेट ऑफ द आर्ट

रिलीज़ के समय, सर्वश्रेष्ठ मॉडलों ने लगभग 60-65% का EM स्कोर हासिल किया, जो SQuAD 1.1 पर 80%+ स्कोर से काफी कम था, जो अतिरिक्त कठिनाई को दर्शाता है। समय के साथ, मॉडलों में काफी सुधार हुआ। 2019 तक, BERT और इसके वेरिएंट का उपयोग करने वाली प्रणालियों ने 80% से अधिक EM स्कोर हासिल किया। 2023 तक, आधिकारिक लीडरबोर्ड पर शीर्ष प्रविष्टियाँ 90% से अधिक EM स्कोर प्राप्त करती हैं, अक्सर एन्सेम्बल विधियों और बाहरी ज्ञान का उपयोग करके।

इन उच्च स्कोरों के बावजूद, शोधकर्ता ध्यान देते हैं कि SQuAD v2.0 में अभी भी सीमाएँ हैं, जैसे कि विकिपीडिया पर इसकी निर्भरता और तथ्य यह कि अनुत्तरित प्रश्न कृत्रिम रूप से निर्मित हैं। फिर भी, यह रीडिंग कॉम्प्रिहेंशन मजबूती का मूल्यांकन करने के लिए एक मूल्यवान उपकरण बना हुआ है।

संबंधित कार्य और विस्तार

SQuAD v2.0 ने कई अनुवर्ती डेटासेट और कार्यों को प्रेरित किया है। उदाहरण के लिए, squad-shift ने सामान्यीकरण का परीक्षण करने के लिए वितरण बदलाव पेश किए, जबकि अन्य कार्यों ने विरोधी गड़बड़ी का पता लगाया है। उत्तरितता की अवधारणा को कई प्रश्नोत्तर प्रणालियों में शामिल किया गया है, जिनमें गूगल क्लाउड और अमेज़न वेब सर्विसेज जैसी कंपनियों द्वारा उत्पादन में उपयोग की जाने वाली प्रणालियाँ शामिल हैं।

डेटासेट अनुसंधान के लिए स्वतंत्र रूप से उपलब्ध है और आधिकारिक SQuAD वेबसाइट पर होस्ट किया गया है, साथ ही मूल्यांकन स्क्रिप्ट और एक सार्वजनिक लीडरबोर्ड के साथ। यह मशीन कॉम्प्रिहेंशन के क्षेत्र में नई वास्तुकला और प्रशिक्षण तकनीकों की तुलना करने के लिए एक संदर्भ बिंदु बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·question-answering·dataset·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास