स्टैनफोर्ड प्रश्नोत्तर डेटासेट, जिसे आमतौर पर SQuAD के नाम से जाना जाता है, मशीन लर्निंग मॉडलों के पठन समझ और प्रश्नोत्तर पर मूल्यांकन के लिए एक बेंचमार्क डेटासेट है। इसमें क्राउडवर्कर्स द्वारा विकिपीडिया लेखों के एक समूह पर पूछे गए प्रश्न शामिल हैं, जहां प्रत्येक प्रश्न का उत्तर संबंधित लेख से पाठ का एक खंड (एक स्पैन) होता है। SQuAD का व्यापक रूप से प्राकृतिक भाषा प्रसंस्करण अनुसंधान में उपयोग किया जाता है ताकि यह मापा जा सके कि मॉडल किसी दिए गए अनुच्छेद को कितनी अच्छी तरह समझ सकते हैं और सटीक उत्तर खोज सकते हैं, जो आधुनिक प्रश्नोत्तर प्रणालियों के विकास में एक प्रमुख मील का पत्थर के रूप में कार्य करता है।
SQuAD को स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था और पहली बार 2016 में जारी किया गया था। प्रारंभिक संस्करण, जिसे बाद में SQuAD1.1 नाम दिया गया, में 536 विकिपीडिया लेखों से प्राप्त 100,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं। एक अनुवर्ती संस्करण, SQuAD2.0, 2018 में जारी किया गया था और इसमें 50,000 से अधिक अनुत्तरित प्रश्न जोड़े गए थे, जो एक मॉडल की उत्तर देने से परहेज करने की क्षमता का परीक्षण करने के लिए डिज़ाइन किए गए थे जब अनुच्छेद में जानकारी मौजूद नहीं होती है। डेटासेट की लोकप्रियता इसके साफ प्रारूप, स्पैन-आधारित उत्तरों की वस्तुनिष्ठता, और मॉडल प्रदर्शन की तुलना के लिए एक सीधा मीट्रिक प्रदान करने की क्षमता से उपजी है।
डेटासेट संरचना और निर्माण
SQuAD के निर्माण में क्राउडवर्कर्स शामिल थे, जिन्हें अमेज़न मैकेनिकल तुर्क के माध्यम से भर्ती किया गया था, और उन्हें एक विकिपीडिया लेख पढ़ने और फिर ऐसे प्रश्न उत्पन्न करने के लिए कहा गया था जिनका उत्तर पाठ का एक सतत स्पैन था। लेखों को उच्च-गुणवत्ता वाली प्रविष्टियों की एक क्यूरेटेड सूची से चुना गया था, जिसमें इतिहास, विज्ञान और भूगोल सहित विषयों की एक श्रृंखला शामिल थी। प्रत्येक प्रश्न को एक एकल सटीक उत्तर स्पैन के साथ जोड़ा गया था, और वैकल्पिक मान्य वाक्यांशों को ध्यान में रखने के लिए अतिरिक्त उत्तर एकत्र किए गए थे। मूल SQuAD1.1 डेटासेट को लगभग 87,000 प्रश्नों के प्रशिक्षण सेट और लगभग 10,000 प्रश्नों के विकास सेट में विभाजित किया गया था, जिसमें आधिकारिक मूल्यांकन के लिए एक छिपा परीक्षण सेट था।
SQuAD2.0 ने मूल प्रश्नों को नए अनुत्तरित प्रश्नों के साथ जोड़कर एक महत्वपूर्ण चुनौती पेश की। ये प्रतिकूल उदाहरण क्राउडवर्कर्स द्वारा उन अनुच्छेदों के आधार पर लिखे गए थे जो डेटासेट के समान थे लेकिन विशिशष्ट तथ्यों को बदलने के लिए संशोधित किए गए थे (उदाहरण के लिए, एक तारीख या नाम क0 बदलन)। लकष्य मॉडलों क0 आवशयकता थी कि वे न केवल सही ढंग से उत्तर दें जब कोई स्पैन मौजूद हो, बल्कि उन प्रश्नों को भी अस्वीकार करें जब कोई उत्तर मौजूद न हो। इस विकास क0 बड़ा परभाव पड़ा, कयोंकि कई पहले क0 सिसटम अबसटेंशन आवशयकता क0 सांभाल नहीं पाते थे, जिससस नए बेंचमार्क पर परदरशन मेें महतवपूण गिरावट आई।
मूल्यांकन मीट्रिक्स
SQuAD के लिए प्राथमिक मीट्रिक एकसैकट मैच (EM) स्कोर है, जो परीकषण क0 उन भविषयवाणियों क0 परतिशत क0 मापता है जो सामान्यीकरण (जैसे विराम चिह्न और लेख हटाना) के बाद ग्राउंड-ट्रुथ उत्तरों में से एक से बिलकुल मेल खाते हैं। एक दवितीयक मीट्रिक, F1 स्कोर, परवभवित और गराउंड-ट्रुथ टोकन्स क0 बीच ओवरलैप क0 गणना करता है, जो आंशिक मेल क0 शरय देता हुआ एक अधिक कषमाशील माप परदान करता है। ये मीट्रिक्स विकास सेट पर गणना किए जाते हैं, और आधिकारिक लीडरबोर्ड क0 उपयोग ऐैतिहक सबमिशनों क0 रैंक करने क0 लिए ऐैतिहकस किए जाता रहा है। लीडरबोर्ड क0 मेजबानी स्टैनफोर्ड एनएलपी ग्रुप द्वारा चलाई जाने वाली एक समरपित वेबसाईट पर की गई थी, और यह परतियोगी शोध क0 लिए एक केंद्र बिंदु क0 रूप मेें कार्य करता रहा जब तक उसका अंतिम अपडेट नहीं हुआ।
एनएलपी रीसरैच पर परभाव
SQuAD ने प्राकृतिक भाषा प्रसंस्करण क0 विकास मेें एक महतवपूण भिूमिका निभाई, जो गहरा अधययन और टरांसफोर्ामर-आधारित आरकिटेक्चरों क0 उदय क0 साथ सांगति था। 2016 मेें शीष सिसटम रिकरंट नेयूरल नेटवर्ाक और अटेंशन तंतरों पर निरभर थे, लेकिन 2017 मेें टरांसफोर्मर मॉडल क0 परिचाग और उसके बाद क0 परेतरेनड भाषा मॉडलों ने परिदृशय क0 मूल रूप से बदल दिया। विशेष रूप से, ओपनएआई और अनय लैबस ने BERT जैसे मॉडल जारी किए (गूगल का एक वेरिएंट) जिसन SQuAD1.1 पर मानव-सीमा से अधिक परदरशन हािसल किया, और बाद क0 मॉडलों न SQuAD2.0 पर सुधार किया। SQuAD नई आरकिटेक्चरों क0 लिए एक मानक परीकषण आधार बन गया, जिसमें बड़े भाषा मॉडल जैस GPT और एनथरोपिक क0 Clude शामिल ह, जिनहें विकास क0 दौरान अकसर बेंचमार्क क0 खिलाफ परीकषि किया जाता ह।
डेटासेट क0 परभाव लीडरबोर्ड से परे आगे तक ह। SQuAD न वयुतपन डेटासेट और कार्यों क0 निरमाण क0 लिए परेरित किया, जैस अनय भाषाओं मेें निष्कषण-आधारित प्रशनोततर और मल्टी-डोकयुमेंट QA। इसन बाद क0 बेंचमार्कों जैस Natural Questions और TriviaQA क0 डिजजाइन क0 भी सूचिा दी, जो एकल-पैसेज निष्कषण क0 बजाय ओपन-डोमेन सेटिंग पर धान केंदरित करते ह। एमआईटी सीएसएआईएल, बरकली एआई रीसरैच, और अनय सांस्ानों क0 शोधकर्ाताओं न SQuAD क0 उपयोग मॉडल क0 मजबूती, अंशांकन, और निष्कषण-आधारित तकर् क0 सीमाओं क0 अधययन क0 लिए किया ह।
सीमाएं और आलोचनाएं
अपनी सफलता के बावजूद, SQuAD क0 उललेखनीय सीमाएं ह। उततर पारूप एक सतत पाठ सपैन तक सीमित ह, जो हां/नहीं परशन, गणना, या वाकयों क0 बीच सांशलेषण क0 आवशयकता वाल उततरों क0 बाहर करता ह। विकीपीडिया-वयुतपन अनुच्छेद अपेकषाकर छोटे और सव-निहहित ह, इसलिए बेंचमार्क बहु-होप तकर या शोर-भरा वासतविक-दुनिया क0 पाठ क0 सांभालन जैसी कषमताओं क0 परीकषण नहीं करता। कराउडवर्ाकर-जनरेत परशन भी शबद-मेल क0 ओर झाीस तरह क0 होते ह, जिसका मतलब ह क मॉडल वासतव मेें सामग्री क0 समझन क0 बजाय परशन शबदों क0 समान सपैनों क0 पहचानन सीखकर उचच स्कोर हािसल कर सकते ह। इन आलोचनाओं क0 कारण अधिक चुनौतीपूण बेंचमार्कों क0 विकास हुआ ह, लेकिन SQuAD मशीन रीडिंग और परशनोततर मेें परगति क0 मापन क0 लिए एक मौलिक सांदभ भविषय बना हुआ ह।
विरासत और वतमान उपयोग
SQuAD आज भी शैक्षणिक पेपरों मेें अकसर उधृत किया जाता ह और कृटििम बुधि क0 वयापक कषेत्र मेें बेसलाइन मूल्यांकन क0 रूप मेें उपयोग किया जाता ह। कई आधुनिक मशीन लर्निंग फ्रेमवर्क अपनी लाइब्रेरी में SQuAD को एक मानक डेटासेट के रूप में शामिल करते हैं, और यह प्राकृतिक भाषा प्रसंस्करण पर विश्वविद्यालय पाठ्यक्रमों में एक सामान्य अभ्यास है। जबकि नए मॉडल अक्सर SQuAD1.1 पर 90% से अधिक EM स्कोर प्राप्त करते हैं, बेंचमार्क का ऐतिहासिक महत्व संरचित पठन कार्यों पर परिशिकषित पणालियों की शकति को परदरशित करने मेें इसकी भिूमिका पर निरभर करता ह। 2020 क0 दशक क0 शुरुआत क0 अनुसार, SQuAD सामान्य-उद्देश्य भाषा मॉडलों की तुलना क0 लिए एक संदभ बिंदु बना हुआ ह, हालांकि GLUE और SuperGLUE जैसी मूल्यांकन सूिटे अधिक परभुत ह0 गए ह।