स्टैनफोर्ड प्रश्न उत्तर डेटासेट (SQuAD) एक व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क है जो कृत्रिम बुद्धिमत्ता प्रणालियों की पाठ को समझने और प्रश्नों के उत्तर देने की क्षमता का मूल्यांकन करने के लिए उपयोग किया जाता है। स्टैनफोर्ड एआई लैब के शोधकर्ताओं द्वारा विकसित, SQuAD में विकिपीडिया लेखों के एक सेट पर क्राउडवर्कर्स द्वारा पूछे गए प्रश्नों का एक बड़ा संग्रह शामिल है। प्रत्येक प्रश्न का एक संबंधित उत्तर होता है जो संबंधित लेख से सीधे निकाला गया पाठ का एक खंड होता है, एक प्रारूप जिसे निष्कर्षण-आधारित प्रश्न उत्तर के रूप में जाना जाता है। यह डेटासेट मशीन लर्निंग और डीप लर्निंग मॉडल के लिए प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक मानक परीक्षण मंच के रूप में कार्य करता है, जो कृत्रिम बुद्धिमत्ता अनुसंधान का एक मुख्य क्षेत्र है।
पहली बार 2016 में जारी किया गया, SQuAD ने एक कठोर मूल्यांकन प्रक्रिया पेश की जो पूर्वानुमानित उत्तर स्ट्रिंग्स की सटीक मिलान (EM) को जमीनी सत्य उत्तरों के साथ और टोकन-स्तरीय F1 स्कोर को मापती है, जो आंशिक मिलान को ध्यान में रखता है। यह दोहरी मेट्रिक प्रश्न उत्तर अनुसंधान के लिए एक डे फैक्टो मानक बन गई है। प्रारंभिक संस्करण, जिसे अक्सर SQuAD1.1 कहा जाता है, में 500 से अधिक लेखों से प्राप्त 100,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं। एक बाद का संस्करण, SQuAD2.0, 2018 में जारी किया गया, जिसमें 50,000 से अधिक अनुत्तरित प्रश्न जोड़े गए जो एक मॉडल की यह पहचानने की क्षमता का परीक्षण करने के लिए डिजाइन किए गए थे कि जब कोई उत्तर मौजूद नहीं ह, जिसससे कार्य अधिक चुनौतीपूर्ण और यथार्थथवादी बन गय।
संरचना और सामग्री
डेटासेट विकीपीडिया के लेखों से निर्माण किया गय ह, मुख्य रूप से उन परसिद्ध हस् तियों, घटनाओं और विषयों को कवर करन वाल। क्राउडवर्कर प् रत् येक लेख को पढ़ते हैं और ऐसे प्रश्न उत्पन्न करते हैं जिनका उत्तर लेख के भीतर पाठ के एक खंड से दिया जा सकता ह। उदाहरण क लिए, एक प्रश्न ह सकता ह "ट्यूरिंग मशीन किस कंपनी ने विकसित की?" जिसका उत्तर पाठ में उल्लिखित विशिष्ट कंपनी का नाम होगा। प्रत्येक प्रश्न-उत्तर जोड़ी लेख के एक संदर्भ पैराग्राफ के साथ जोड़ी जाती है, और उत्तर को उस पैराग्राफ में उसकी प्रारंभ और समाप्ति स्थितियों के साथ एनोटेट किया जाता है। यह डिज़ाइन सुनिश्चित करता है कि कार्य पूरी तरह से निष्कर्षण-आधारित है, जो उत्पादक उत्तर देने के बजाय पढ़ने की समझ पर केंद्रित है।
SQuAD डेटासेट लेखों को प्रशिक्षण, विकास और परीक्षण सेटों में विभाजित करता है। परीक्षण सेट सार्वजनिक रूप से जारी नहीं किया जाता है; इसके बजाय, प्रतिभागी स्कोरिंग के लिए अपने मॉडल की भविष्यवाणियों को एक सर्वर पर जमा करते हैं, जो परीक्षण डेटा पर ओवरफिटिंग को रोकने में मदद करता है। इस सेटअप ने विभिन्न दृष्टिकोणों के बीच निष्पक्ष तुलना को प्रोत्साहित किया है, प्रारंभिक तंत्रिका नेटवर्क मॉडल से लेकर आधुनिक ट्रांसफॉर्मर-आधारित आर्किटेक्चर तक।
मॉडल विकास पर प्रभाव
SQuAD प्रश्न उत्तर मॉडल के तेजी से उन्नति में सहायक रहा है। अपने प्रारंभिक वर्षों में, सर्वोत् तम प्रदर्शन करने वाली पर्नालियां अनुक्रम-से-अनुक्रम मॉडल और ध्यान तंत्र पर निर्भर थीं, जो मामूली स्कोर प्राप्त करती थीं। 2018 में BERT जैसे पूर्व-प्रशिक्षित भाषा मॉडल की शुरुआत ने नाटकीय सुधार किया, जिसससे मॉडल SQuAD1.1 पर मनुष्यों के प्रदर्शन को महीनों के भीतर पार कर गए। इस प्रगति ने बड़े कोर्पोरा पर पूर्व-प्रशिक्षण की शक्ति को उजागर किया, जो आधुनिक बड़े भाषा मॉडल विकास की आधारशिला है।
बाद के आर्किटेक्चर, जिनमें एनकोडर-डिकोडर डिज़ाइन और मल्टी-हेड अटेंशन पर आधारित शामिल हैं, ने राज्य की कला को आगे बढ़ाना जारी रखा है। SQuAD2.0, अपने अनुत्तरित प्रश्नों के साथ, अधिक चुनौतीपूर्ण साबित हुआ, और मॉडलों को परहेज करने के लिए तंत्र शामिल करने पड़े, जैसे कि भविष्यवाणी किए गए उत्तरों को कम आत्मविश्वास स्कोर सौंपना। इस चुनौती ने अनिश्चितता अनुमान और मजबूत तर्क में अनुसंधान को प्रेरित किया है, जो सक्रिय अध्ययन के क्षेत्र बने हुए हैं।
बेंचमार्क ने वाणिज्यिक AI उत्पादों के विकास को भी प्रभावित किया है। ओपनएआई और गूगल डीपमाइंड जैसी कंपनियों ने अपने मॉडल का मूल्यांकन और परिष्कृत करने के लिए SQuAD-शैली के कार्यों का उपयोग किया है, और डेटासेट शैक्षणिक पेपरों और उद्योग रिपोर्टों में संदर्भ का एक सामान्य बिंदु बना हुआ है।
मूल्यांकन मेट्रिक्स और लीडरबोर्ड
SQuAD क लिए प् रामुख मेट्रिक्स सटीक्ट मिलान (EM) और F1 स्कोर हैं। EM एक सख्त मेट्रिक है जिसके लिए भविष्यवाणी किए गए उत्तर को जमीनी सत्य से बिल्कुल मेल खाना चाहिए, जिसमें विराम चिह्न और केस शामिल हैं (लेकिन 'a', 'an', 'the' जैसे लेखों को छोड़कर)। F1 उत्तर को टोकन के बैग के रूप में मानता है और सटीकता और रिकॉल का हार्मोनिक माध्य की गणना करता है, जो ओवरलैपिंग शब्दों के लिए आंशिक क्रेडिट देता है। SQuAD1.1 पर मानव प्रदर्शन लगभग 82.3 EM और 91.2 F1 है, जबकि शीर्ष मॉडल ने 90 EM और 95 F1 से ऊपर स्कोर हासिल किए हैं। SQuAD2.0 पर, मानव प्रदर्शन लगभग 86.8 EM और 89.5 F1 है, जबकि सर्वश्रेष्ठ मॉडल लगभग मानव-स्तर तक पहुंच गए हैं।
स्टैनफोर्ड द्वारा होस्ट किए गए आधिकारिक लीडरबोर्ड, समय के साथ इन मेट्रिक्स को ट्रैक करते हैं; हालांकि, वर्तमान में कोई आधिकारिक लीडरबोर्ड नहीं है, लेकिन शोध पत्र अपनी स्वयं की तालिकाएं बनाए रखते हैं। डेटासेट का उपयोग पढ़ने की समझ में प्रगति को मापने के लिए जारी है, और इसके परिणाम नियमित रूप से सम्मेलनों में प्रस्तुतियों में उद्धृत किए जाते हैं।
सीमाएं और आलोचनाएं
अपनी सफलता के बावजूद, SQuAD में उल्लेखनीय सीमाएं हैं। निष्कर्षण प्रारूप उत्तर कों पाठ में मौजूद खंडों तक सीमित करता है, जो वास्तविक उपयोगकर्ताओं द्वारा पूछे जाने वाले खुले-अंत प्रश्नों की पूरी श्रृंखला को प्रतिबिंबित नहीं करता है। डेटासेट में पूर्वाग्रह भी हैं, जैसे कि प्रश्नों का इकाइयों और तारीखों पर केंद्रित होंने की प् रवृत्ति, और क्राउड-सोर्स किए गए प्रश्न हमेशा प्राकृतिक नहीं हो सकते हैं। आलोचकों ने बताया है कि उच्च स्कोर हासिल करने वाले मॉडल सु पर्फिशियल संकेतों (जैसे कि प्रश्न में शब्दों को संदर्भ से मिलाना) पर भरोसा कर सकते हैं, न कि गहरी समझ पर।
SQuAD2.0 ने अनुत्तरित प्रश्नों को जोड़कर कुछ मुद्दों को संबोधित किया, लेकिन यह अभी भी एक बंद-पुस्तक सेटिंग में एक प्रश्न के लिए एक दस्तावेज के साथ काम करता है। यह ओपन-डोमेन प्रश्न उत्तर से काफी अलग है, जहां सिस्टम को बड़े कोर्पोरा से प्रासंगिक जानकारी प्राप्त करनी होती है। परिणामस्वरूप, शोधकर्ताओं ने मल्टी-हॉप और ओपन-डोमेन चुनौतियों का पता लगाने के लिए Natural Questions और HotpotQA जैसे वैकल्पिक बेंचमार्क विकसित किए हैं। फिर भी, SQuAD क्षेत्र में एक प्रामाणिक संदर्भ बना हुआ है।
विरासत और निरंतर उपयोग
SQuAD की विरासत एक मौलिक संसाधन के रूप में विस्तारित है। यह डीप लर्निंग अवधारणाओं कौ सिखाने क लिए एक शिक्षणात्मक उपकरण क रूप में कार्य करता है - उत्तर निष्कर्षण-आधारित है। डेटासेट सुतंत्र रूप से उपलब्ध है और लोकप् रिय मशीन लर्ननिंग लाइ़ेरियों और शिक्षा प् लेटफॉर्मों में एकीकृत किया गय है। इसके डिज़ाइ़ाइ़ाइ़ाइ़ाइ़ाइ़ाइ़ाइ़ाइ़ाइन सिद्धांत - बड़े पैमाने पर, क्राउडसोर्स किए गए प्रश्न, और स्पष्ट मूल्यांकन मेट्रिक्स - ने कई अनुवर्ती डेटासेट को प्रेरित किया है।
2025 तक, SQuAD का उपयोग चालू शोध में जारी है, विशेष रूप से ट्रांसफॉर्मर-आधारित आर्किटेक्चर जैसे नए मॉडल के साथ संयोजन में और मॉडल व्याख्या पर अध्ययन में। जबकि जनरेटिव बड़े भाषा मॉडल क उदय क साथ इसक प्रभुत्व कम हुआ है, यह पढ़ने की समझ क्षमताओं के लिए एक मूल्यवान सैनिटी चेक बना हुआ है। AI के इतिहास में बेंचमार्क की भूमिका सुरक्षित है, जिसने एक दशक की प्रगति को उत्प्रेरित किया है और शोधकर्ताओं को अपने काम की तुलना करने के लिए एक सामान्य भाषा प्रदान की है।