SQuAD v1.1 (स्टैनफोर्ड प्रश्न उत्तर डेटासेट) एक व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है जो निष्कर्षणात्मक पठन समझ और प्रश्न उत्तर देने के लिए है। इसमें 536 विकिपीडिया लेखों के सेट के आधार पर क्राउडवर्कर्स द्वारा उत्पन्न 100,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं। कार्य के लिए मॉडल को दिए गए अनुच्छेद के भीतर पाठ के सन्निहित खंड के रूप में सही उत्तर की पहचान करने की आवश्यकता होती है, जिससे यह प्राकृतिक भाषा समझ प्रणालियों के लिए एक मौलिक मूल्यांकन बन जाता है।
डेटासेट को 2016 में स्टैनफोर्ड एआई लैब के शोधकर्ताओं द्वारा पेश किया गया था, जिसका प्रारंभिक संस्करण जून 2016 में जारी किया गया था और v1.1 अपडेट दिसंबर 2016 में प्रकाशित हुआ था। इसे ऐसे मॉडलों के विकास को प्रोत्साहित करने के लिए डिज़ाइन किया गया था जो मानव प्रदर्शन के करीब स्तर पर पाठ पढ़ और समझ सकें। प्रश्नों को केवल दिए गए अनुच्छेद से उत्तर देने योग्य बनाने के लिए डिज़ाइन किया गया है, बिना बाहरी ज्ञान की आवश्यकता के, और प्रत्येक प्रश्न का एक ही सही उत्तर खंड होता है।
संरचना और निर्माण
SQuAD v1.1 का निर्माण अंग्रेजी विकिपीडिया से 536 लेखों का चयन करके किया गया था, जिसमें विज्ञान, इतिहास और जीवनी सहित विविध विषयों की श्रेणी शामिल थी। अमेज़न मैकेनिकल टर्क पर क्राउडवर्कर्स को प्रत्येक अनुच्छेद पढ़ने और प्रश्न और संबंधित उत्तर उत्पन्न करने के लिए कहा गया था। प्रत्येक उत्तर को अनुच्छेद का एक शब्दशः खंड होना आवश्यक था, जिससे यह सुनिश्चित हो सके कि डेटासेट का उपयोग निष्कर्षणात्मक क्यूए कार्यों के लिए किया जा सके। अंतिम डेटासेट में 107,785 प्रश्न-उत्तर जोड़े हैं, जो 87,599 जोड़े के प्रशिक्षण सेट, 10,570 जोड़े के विकास सेट, और आधिकारिक मूल्यांकन के लिए उपयोग किए जाने वाले छिपे हुए परीक्षण सेट में विभाजित हैं।
डेटासेट में विभिन्न प्रकार के प्रश्न शामिल हैं, जैसे कि कौन, क्या, कब, कहाँ, क्यों और कैसे प्रश्न। यह विविधता मॉडलों को विभिन्न प्रकार के तर्क करने की चुनौती देती है, जिसमें इकाई पहचान, लौकिक तर्क और कारणात्मक अनुमान शामिल हैं। उत्तर खंड एकल टोकन से लेकर बहु-वाक्य अनुच्छेदों तक होते हैं, हालांकि अधिकांश छोटे वाक्यांश होते हैं।
मूल्यांकन मेट्रिक्स
मॉडलों का मूल्यांकन दो प्राथमिक मेट्रिक्स पर किया जाता है: एक्सेक्ट मैच (ईएम) और एफ1 स्कोर। ईएम उन भविष्यवाणियों का प्रतिशत मापता है जो विराम चिह्न और लेखों को अनदेखा करते हुए ग्राउंड ट्रुथ उत्तर से बिल्कुल मेल खाती हैं। एफ1 स्कोर भविष्यवाणी और ग्राउंड ट्रुथ टोकन के बीच सटीकता और पुनर्प्राप्ति का हार्मोनिक माध्य गणना करता है, जो आंशिक मिलानों को पुरस्कृत करने वाला अधिक उदार उपाय प्रदान करता है। ये मेट्रिक्स पठन समझ के क्षेत्र में मानक बन गए हैं और कई बाद के डेटासेट में उपयोग किए जाते हैं।
SQuAD v1.1 पर मानव प्रदर्शन 82.3 ईएम और 91.2 एफ1 अनुमानित है, जो मॉडल तुलना के लिए एक संदर्भ बिंदु प्रदान करता है। प्रारंभिक मॉडल 50% एफ1 से अधिक होने में संघर्ष करते थे, लेकिन डीप लर्निंग और न्यूरल नेटवर्क आर्किटेक्चर में तेजी से प्रगति ने कुछ वर्षों के भीतर महत्वपूर्ण सुधार किए।
प्रभाव और विरासत
SQuAD v1.1 ने मशीन लर्निंग और आर्टिफिशियल इंटेलिजेंस में अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई। इसने एक मानकीकृत, बड़े पैमाने का बेंचमार्क प्रदान किया जिसने शोधकर्ताओं को मॉडल प्रदर्शन की निष्पक्ष रूप से तुलना करने की अनुमति दी। डेटासेट ने कई प्रभावशाली आर्किटेक्चर के विकास को प्रेरित किया, जिसमें ट्रांसफॉर्मर-आधारित मॉडल शामिल हैं जो बाद में आधुनिक बड़े भाषा मॉडल की नींव बने।
विशेष रूप से, SQuAD v1.1 की रिलीज़ प्राकृतिक भाषा प्रसंस्करण में ध्यान तंत्र और मल्टी-हेड अटेंशन के उदय के साथ मेल खाती थी। बीआईडीएएफ (द्विदिशात्मक ध्यान प्रवाह) और बाद में बीईआरटी जैसे मॉडलों ने इस बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए, जो प्रीट्रेनिंग और फाइन-ट्यूनिंग प्रतिमानों की शक्ति का प्रदर्शन करते हैं। SQuAD v1.1 पर इन मॉडलों की सफलता ने एनकोडर-डिकोडर और सीक्वेंस-टू-सीक्वेंस फ्रेमवर्क की प्रभावशीलता को मान्य करने में मदद की।
डेटासेट ने बाद के बेंचमार्क के निर्माण को भी प्रभावित किया, जिसमें SQuAD v2.0 शामिल है, जिसने मॉडल मजबूती का परीक्षण करने के लिए अनुत्तरित प्रश्न जोड़े। कई अन्य पठन समझ डेटासेट, जैसे कि आरएसीई और ट्रिवियाक्यूए, समान सिद्धांतों के साथ डिज़ाइन किए गए थे, लेकिन SQuAD v1.1 क्षेत्र में सबसे अधिक उद्धृत और व्यापक रूप से उपयोग किए जाने वाले बेंचमार्क में से एक बना हुआ है।
सीमाएँ और आलोचनाएँ
इसकी सफलता के बावजूद, SQuAD v1.1 की कई सीमाएँ हैं। कार्य की निष्कर्षणात्मक प्रकृति का मतलब है कि मॉडलों को केवल पाठ के एक खंड की पहचान करने की आवश्यकता है, न कि नए उत्तर उत्पन्न करने की। इससे ऐसे मॉडल बन सकते हैं जो जानकारी का पता लगाने में अच्छे हैं लेकिन इसके बारे में संश्लेषण या तर्क करने में कम सक्षम हैं। डेटासेट विकिपीडिया लेखों पर भी निर्भर करता है, जो विषय कवरेज और लेखन शैली में पूर्वाग्रह पेश कर सकता है।
इसके अतिरिक्त, क्राउड-सोर्स किए गए प्रश्नों में कभी-कभी अस्पष्टताएँ होती हैं या सामान्य ज्ञान तर्क की आवश्यकता होती है जो अनुच्छेद में स्पष्ट रूप से नहीं बताया गया है। जैसे-जैसे मॉडलों में सुधार हुआ, मानव और मशीन प्रदर्शन के बीच का अंतर कम हो गया, जिससे शीर्ष-प्रदर्शन प्रणालियों के बीच अंतर करने की डेटासेट की क्षमता के बारे में चिंताएँ पैदा हुईं। इन मुद्दों ने अधिक चुनौतीपूर्ण बेंचमार्क के निर्माण और निष्कर्षणात्मक उत्तर देने से परे जाने वाले जनरेटिव एआई दृष्टिकोणों की खोज को प्रेरित किया।