SQuAD 2.0 (स्टैनफोर्ड प्रश्नोत्तर डेटासेट 2.0) एक मशीन रीडिंग कॉम्प्रिहेंशन बेंचमार्क है जो मूल SQuAD 1.1 डेटासेट में 50,000 अनुत्तरित प्रश्न जोड़कर उसका विस्तार करता है। ये अनुत्तरित प्रश्न प्रशंसनीय होने के लिए डिज़ाइन किए गए हैं, लेकिन संबंधित विकिपीडिया लेख में उनका कोई मान्य उत्तर नहीं होता, जिससे मॉडलों को यह निर्धारित करने के लिए मजबूर किया जाता है कि कोई उत्तर मौजूद नहीं है, बजाय हमेशा एक स्पैन निकालने के। डेटासेट में कुल 150,000 से अधिक प्रश्न हैं, जो 10 विकिपीडिया श्रेणियों के 536 लेखों से लिए गए हैं, और इसे जून 2018 में प्रणव राजपुरकर, रॉबिन जिया और पर्सी लियांग द्वारा स्टैनफोर्ड एआई लैब में जारी किया गया था।
SQuAD 2.0 का प्राथमिक उद्देश्य पहले के रीडिंग कॉम्प्रिहेंशन डेटासेट की एक सीमा को संबोधित करना था, जहां मॉडल हमेशा पाठ का कुछ स्पैन चुनकर उच्च स्कोर प्राप्त कर सकते थे, भले ही प्रश्न अनुत्तरित हो। अनुत्तरित प्रश्नों को शामिल करके, डेटासेट के लिए सिस्टम को पहले यह तय करना आवश्यक होता है कि उत्तर मौजूद है या नहीं, और यदि है तो सही स्पैन निकालना होता है। यह कार्य को व्यावहारिक अनुप्रयोगों जैसे बड़े भाषा मॉडल जो खोज इंजन और आभासी सहायकों में उपयोग होते हैं, के लिए अधिक यथार्थवादी बनाता है, जहां प्रश्नों में अक्सर निश्चित उत्तर नहीं होते।
डेटासेट निर्माण
SQuAD 2.0 में अनुत्तरित प्रश्न क्राउडवर्कर्स द्वारा बनाए गए थे, जिन्हें विकिपीडिया लेख से एक अनुच्छेद दिखाया गया और उनसे ऐसे प्रश्न लिखने को कहा गया जो केवल उस अनुच्छेद से उत्तर नहीं दिए जा सकते थे, लेकिन एक मानव पाठक उचित रूप से पूछ सकता था। प्रत्येक अनुत्तरित प्रश्न को एक उत्तरित प्रश्न के साथ जोड़ा गया था जो विषय और वाक्यांश में समान था, यह सुनिश्चित करते हुए कि अनुत्तरित प्रश्न पहचानने में तुच्छ नहीं थे। अंतिम डेटासेट में SQuAD 1.1 से 100,000 उत्तरित प्रश्न और 50,000 नए अनुत्तरित प्रश्न शामिल हैं, जिनमें कुल 150,000 प्रश्न-उत्तर जोड़े हैं। डेटा को प्रशिक्षण (130,000 प्रश्न), विकास (11,873) और परीक्षण सेट (8,862) में विभाजित किया गया है, जिसमें आधिकारिक मूल्यांकन के लिए परीक्षण सेट छिपा हुआ है।
मूल्यांकन मेट्रिक्स
SQuAD 2.0 दो प्राथमिक मेट्रिक्स का उपयोग करता है: एक्सैक्ट मैच (EM) और F1 स्कोर। EM उन भविष्यवाणियों का प्रतिशत मापता है जो ग्राउंड ट्रुथ उत्तरों में से एक से बिल्कुल मेल खाती हैं, जबकि F1 भविष्यवाणी और ग्राउंड ट्रुथ के बीच टोकन ओवरलैप पर प्रेसिजन और रिकॉल का हार्मोनिक माध्य गणना करता है। अनुत्तरित प्रश्नों के लिए, एक मॉडल को क्रेडिट प्राप्त करने के लिए "कोई उत्तर नहीं" आउटपुट करना होगा; कोई भी स्पैन भविष्यवाणी गलत मानी जाती है। आधिकारिक लीडरबोर्ड सिस्टम को EM और F1 के औसत से रैंक करता है, जिसमें हमेशा "कोई उत्तर नहीं" भविष्यवाणी करने वाला बेसलाइन F1 0.0 प्राप्त करता है, जो कार्य की कठिनाई को प्रदर्शित करता है।
एनएलपी अनुसंधान पर प्रभाव
SQuAD 2.0 रीडिंग कॉम्प्रिहेंशन और प्रश्नोत्तर प्रणालियों के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया, जिसने कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में महत्वपूर्ण अनुसंधान को बढ़ावा दिया। इसने तंत्रिका नेटवर्क मॉडलों में परहेज और आत्मविश्वास अनुमान के महत्व को उजागर किया, जिससे ऐसे आर्किटेक्चर का विकास हुआ जो उत्तर सत्यापन या अस्वीकृति तंत्र को शामिल करते हैं। लीडरबोर्ड पर कई शीर्ष प्रदर्शन करने वाले सिस्टम ने ट्रांसफॉर्मर-आधारित मॉडल जैसे BERT, RoBERTa और ALBERT का उपयोग किया है, जो बड़े कॉर्पोरा पर पूर्व-प्रशिक्षित थे और SQuAD 2.0 पर फाइन-ट्यून किए गए थे। डेटासेट ने बाद के बेंचमार्क जैसे नेचुरल क्वेश्चन और TyDi QA को भी प्रभावित किया, जिनमें अनुत्तरित उदाहरण एक मुख्य घटक के रूप में शामिल हैं।
सीमाएं और आलोचनाएं
व्यापक रूप से अपनाए जाने के बावजूद, SQuAD 2.0 की कुछ सीमाओं के लिए आलोचना की गई है। अनुत्तरित प्रश्न क्राउडवर्कर्स द्वारा कृत्रिम रूप से उत्पन्न किए गए हैं और वास्तविक दुनिया के अनुत्तरित प्रश्नों के वितरण को प्रतिबिंबित नहीं कर सकते हैं, जिनमें अक्सर अस्पष्टता या संदर्भ की कमी शामिल होती है। इसके अतिरिक्त, डेटासेट विकिपीडिया लेखों पर आधारित है, जो अपेक्षाकृत अच्छी तरह से संरचित और तथ्यात्मक हैं, जिससे मॉडलों के लिए विरोधाभासों या लापता जानकारी की पहचान करना आसान हो जाता है। कुछ शोधकर्ताओं ने नोट किया है कि SQuAD 2.0 पर उच्च प्रदर्शन आवश्यक रूप से ओपन-डोमेन प्रश्नोत्तर में मजबूत प्रदर्शन में अनुवाद नहीं करता है, जहां मॉडल को बड़े कॉर्पस से प्रासंगिक अनुच्छेदों को पुनर्प्राप्त करना होता है। 2025 तक, लीडरबोर्ड संतृप्त हो गया है, जिसमें शीर्ष मॉडल 95 से ऊपर F1 स्कोर प्राप्त कर रहे हैं, लेकिन डेटासेट मॉडल मजबूती और कैलिब्रेशन के मूल्यांकन के लिए एक मूल्यवान उपकरण बना हुआ है।
संबंधित कार्य और विस्तार
SQuAD 2.0 ने कई विस्तार और विविधताओं को प्रेरित किया है। SQuAD 2.0 चैलेंज EMNLP 2018 कार्यशाला में प्रदर्शित किया गया था, और डेटासेट का उपयोग प्राकृतिक भाषा प्रसंस्करण सिखाने के लिए शैक्षिक सेटिंग्स में किया गया है। इसे मल्टी-टास्क लर्निंग बेंचमार्क में भी शामिल किया गया है और गहन शिक्षण मॉडल की तर्क क्षमताओं का मूल्यांकन करने के लिए उपयोग किया गया है। अनुत्तरित प्रश्नों की अवधारणा को अन्य डोमेन में अपनाया गया है, जैसे दृश्य प्रश्नोत्तर और संवादी एआई, जहां मॉडलों को स्पष्टीकरण मांगना या यह बताना सीखना होता है कि वे उत्तर नहीं जानते हैं। डेटासेट रीडिंग कॉम्प्रिहेंशन का अध्ययन करने वाले शोधकर्ताओं के लिए एक प्रमुख संसाधन बना हुआ है, और इसके डिजाइन सिद्धांत अधिक चुनौतीपूर्ण बेंचमार्क के निर्माण को सूचित करते रहते हैं।