अंग्रेज़ी से अनुवादित

SQuAD 2.0 एक प्रश्न उत्तर डेटासेट है जो 100,000 उत्तर योग्य प्रश्नों को 50,000 अनुत्तर योग्य प्रश्नों के साथ जोड़ता है, जिसमें मॉडलों को उत्तर न होने पर उत्तर देने से परहेज करना आवश्यक होता है। इसे 2018 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा पढ़ने की समझ और मजबूती का परीक्षण करने के लिए पेश किया गया था।

SQuAD 2.0 (स्टैनफोर्ड प्रश्नोत्तर डेटासेट 2.0) एक मशीन रीडिंग कॉम्प्रिहेंशन बेंचमार्क है जो मूल SQuAD 1.1 डेटासेट में 50,000 अनुत्तरित प्रश्न जोड़कर उसका विस्तार करता है। ये अनुत्तरित प्रश्न प्रशंसनीय होने के लिए डिज़ाइन किए गए हैं, लेकिन संबंधित विकिपीडिया लेख में उनका कोई मान्य उत्तर नहीं होता, जिससे मॉडलों को यह निर्धारित करने के लिए मजबूर किया जाता है कि कोई उत्तर मौजूद नहीं है, बजाय हमेशा एक स्पैन निकालने के। डेटासेट में कुल 150,000 से अधिक प्रश्न हैं, जो 10 विकिपीडिया श्रेणियों के 536 लेखों से लिए गए हैं, और इसे जून 2018 में प्रणव राजपुरकर, रॉबिन जिया और पर्सी लियांग द्वारा स्टैनफोर्ड एआई लैब में जारी किया गया था।

SQuAD 2.0 का प्राथमिक उद्देश्य पहले के रीडिंग कॉम्प्रिहेंशन डेटासेट की एक सीमा को संबोधित करना था, जहां मॉडल हमेशा पाठ का कुछ स्पैन चुनकर उच्च स्कोर प्राप्त कर सकते थे, भले ही प्रश्न अनुत्तरित हो। अनुत्तरित प्रश्नों को शामिल करके, डेटासेट के लिए सिस्टम को पहले यह तय करना आवश्यक होता है कि उत्तर मौजूद है या नहीं, और यदि है तो सही स्पैन निकालना होता है। यह कार्य को व्यावहारिक अनुप्रयोगों जैसे बड़े भाषा मॉडल जो खोज इंजन और आभासी सहायकों में उपयोग होते हैं, के लिए अधिक यथार्थवादी बनाता है, जहां प्रश्नों में अक्सर निश्चित उत्तर नहीं होते।

डेटासेट निर्माण

SQuAD 2.0 में अनुत्तरित प्रश्न क्राउडवर्कर्स द्वारा बनाए गए थे, जिन्हें विकिपीडिया लेख से एक अनुच्छेद दिखाया गया और उनसे ऐसे प्रश्न लिखने को कहा गया जो केवल उस अनुच्छेद से उत्तर नहीं दिए जा सकते थे, लेकिन एक मानव पाठक उचित रूप से पूछ सकता था। प्रत्येक अनुत्तरित प्रश्न को एक उत्तरित प्रश्न के साथ जोड़ा गया था जो विषय और वाक्यांश में समान था, यह सुनिश्चित करते हुए कि अनुत्तरित प्रश्न पहचानने में तुच्छ नहीं थे। अंतिम डेटासेट में SQuAD 1.1 से 100,000 उत्तरित प्रश्न और 50,000 नए अनुत्तरित प्रश्न शामिल हैं, जिनमें कुल 150,000 प्रश्न-उत्तर जोड़े हैं। डेटा को प्रशिक्षण (130,000 प्रश्न), विकास (11,873) और परीक्षण सेट (8,862) में विभाजित किया गया है, जिसमें आधिकारिक मूल्यांकन के लिए परीक्षण सेट छिपा हुआ है।

मूल्यांकन मेट्रिक्स

SQuAD 2.0 दो प्राथमिक मेट्रिक्स का उपयोग करता है: एक्सैक्ट मैच (EM) और F1 स्कोर। EM उन भविष्यवाणियों का प्रतिशत मापता है जो ग्राउंड ट्रुथ उत्तरों में से एक से बिल्कुल मेल खाती हैं, जबकि F1 भविष्यवाणी और ग्राउंड ट्रुथ के बीच टोकन ओवरलैप पर प्रेसिजन और रिकॉल का हार्मोनिक माध्य गणना करता है। अनुत्तरित प्रश्नों के लिए, एक मॉडल को क्रेडिट प्राप्त करने के लिए "कोई उत्तर नहीं" आउटपुट करना होगा; कोई भी स्पैन भविष्यवाणी गलत मानी जाती है। आधिकारिक लीडरबोर्ड सिस्टम को EM और F1 के औसत से रैंक करता है, जिसमें हमेशा "कोई उत्तर नहीं" भविष्यवाणी करने वाला बेसलाइन F1 0.0 प्राप्त करता है, जो कार्य की कठिनाई को प्रदर्शित करता है।

एनएलपी अनुसंधान पर प्रभाव

SQuAD 2.0 रीडिंग कॉम्प्रिहेंशन और प्रश्नोत्तर प्रणालियों के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया, जिसने कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में महत्वपूर्ण अनुसंधान को बढ़ावा दिया। इसने तंत्रिका नेटवर्क मॉडलों में परहेज और आत्मविश्वास अनुमान के महत्व को उजागर किया, जिससे ऐसे आर्किटेक्चर का विकास हुआ जो उत्तर सत्यापन या अस्वीकृति तंत्र को शामिल करते हैं। लीडरबोर्ड पर कई शीर्ष प्रदर्शन करने वाले सिस्टम ने ट्रांसफॉर्मर-आधारित मॉडल जैसे BERT, RoBERTa और ALBERT का उपयोग किया है, जो बड़े कॉर्पोरा पर पूर्व-प्रशिक्षित थे और SQuAD 2.0 पर फाइन-ट्यून किए गए थे। डेटासेट ने बाद के बेंचमार्क जैसे नेचुरल क्वेश्चन और TyDi QA को भी प्रभावित किया, जिनमें अनुत्तरित उदाहरण एक मुख्य घटक के रूप में शामिल हैं।

सीमाएं और आलोचनाएं

व्यापक रूप से अपनाए जाने के बावजूद, SQuAD 2.0 की कुछ सीमाओं के लिए आलोचना की गई है। अनुत्तरित प्रश्न क्राउडवर्कर्स द्वारा कृत्रिम रूप से उत्पन्न किए गए हैं और वास्तविक दुनिया के अनुत्तरित प्रश्नों के वितरण को प्रतिबिंबित नहीं कर सकते हैं, जिनमें अक्सर अस्पष्टता या संदर्भ की कमी शामिल होती है। इसके अतिरिक्त, डेटासेट विकिपीडिया लेखों पर आधारित है, जो अपेक्षाकृत अच्छी तरह से संरचित और तथ्यात्मक हैं, जिससे मॉडलों के लिए विरोधाभासों या लापता जानकारी की पहचान करना आसान हो जाता है। कुछ शोधकर्ताओं ने नोट किया है कि SQuAD 2.0 पर उच्च प्रदर्शन आवश्यक रूप से ओपन-डोमेन प्रश्नोत्तर में मजबूत प्रदर्शन में अनुवाद नहीं करता है, जहां मॉडल को बड़े कॉर्पस से प्रासंगिक अनुच्छेदों को पुनर्प्राप्त करना होता है। 2025 तक, लीडरबोर्ड संतृप्त हो गया है, जिसमें शीर्ष मॉडल 95 से ऊपर F1 स्कोर प्राप्त कर रहे हैं, लेकिन डेटासेट मॉडल मजबूती और कैलिब्रेशन के मूल्यांकन के लिए एक मूल्यवान उपकरण बना हुआ है।

संबंधित कार्य और विस्तार

SQuAD 2.0 ने कई विस्तार और विविधताओं को प्रेरित किया है। SQuAD 2.0 चैलेंज EMNLP 2018 कार्यशाला में प्रदर्शित किया गया था, और डेटासेट का उपयोग प्राकृतिक भाषा प्रसंस्करण सिखाने के लिए शैक्षिक सेटिंग्स में किया गया है। इसे मल्टी-टास्क लर्निंग बेंचमार्क में भी शामिल किया गया है और गहन शिक्षण मॉडल की तर्क क्षमताओं का मूल्यांकन करने के लिए उपयोग किया गया है। अनुत्तरित प्रश्नों की अवधारणा को अन्य डोमेन में अपनाया गया है, जैसे दृश्य प्रश्नोत्तर और संवादी एआई, जहां मॉडलों को स्पष्टीकरण मांगना या यह बताना सीखना होता है कि वे उत्तर नहीं जानते हैं। डेटासेट रीडिंग कॉम्प्रिहेंशन का अध्ययन करने वाले शोधकर्ताओं के लिए एक प्रमुख संसाधन बना हुआ है, और इसके डिजाइन सिद्धांत अधिक चुनौतीपूर्ण बेंचमार्क के निर्माण को सूचित करते रहते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·question-answering·dataset·reading-comprehension
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास