अंग्रेज़ी से अनुवादित

SQuAD v1.1 एक पठन समझ डेटासेट है जिसमें विकिपीडिया लेखों से प्राप्त 100,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनका उपयोग निष्कर्षण-आधारित प्रश्न उत्तर प्रणालियों के मूल्यांकन के लिए किया जाता है। इसे 2016 में स्टैनफोर्ड विश्वविद्यालय द्वारा प्रस्तुत किया गया था।

SQuAD v1.1 (स्टैनफोर्ड प्रश्न उत्तर डेटासेट) एक व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है जो निष्कर्षणात्मक पठन समझ और प्रश्न उत्तर देने के लिए है। इसमें 536 विकिपीडिया लेखों के सेट के आधार पर क्राउडवर्कर्स द्वारा उत्पन्न 100,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं। कार्य के लिए मॉडल को दिए गए अनुच्छेद के भीतर पाठ के सन्निहित खंड के रूप में सही उत्तर की पहचान करने की आवश्यकता होती है, जिससे यह प्राकृतिक भाषा समझ प्रणालियों के लिए एक मौलिक मूल्यांकन बन जाता है।

डेटासेट को 2016 में स्टैनफोर्ड एआई लैब के शोधकर्ताओं द्वारा पेश किया गया था, जिसका प्रारंभिक संस्करण जून 2016 में जारी किया गया था और v1.1 अपडेट दिसंबर 2016 में प्रकाशित हुआ था। इसे ऐसे मॉडलों के विकास को प्रोत्साहित करने के लिए डिज़ाइन किया गया था जो मानव प्रदर्शन के करीब स्तर पर पाठ पढ़ और समझ सकें। प्रश्नों को केवल दिए गए अनुच्छेद से उत्तर देने योग्य बनाने के लिए डिज़ाइन किया गया है, बिना बाहरी ज्ञान की आवश्यकता के, और प्रत्येक प्रश्न का एक ही सही उत्तर खंड होता है।

संरचना और निर्माण

SQuAD v1.1 का निर्माण अंग्रेजी विकिपीडिया से 536 लेखों का चयन करके किया गया था, जिसमें विज्ञान, इतिहास और जीवनी सहित विविध विषयों की श्रेणी शामिल थी। अमेज़न मैकेनिकल टर्क पर क्राउडवर्कर्स को प्रत्येक अनुच्छेद पढ़ने और प्रश्न और संबंधित उत्तर उत्पन्न करने के लिए कहा गया था। प्रत्येक उत्तर को अनुच्छेद का एक शब्दशः खंड होना आवश्यक था, जिससे यह सुनिश्चित हो सके कि डेटासेट का उपयोग निष्कर्षणात्मक क्यूए कार्यों के लिए किया जा सके। अंतिम डेटासेट में 107,785 प्रश्न-उत्तर जोड़े हैं, जो 87,599 जोड़े के प्रशिक्षण सेट, 10,570 जोड़े के विकास सेट, और आधिकारिक मूल्यांकन के लिए उपयोग किए जाने वाले छिपे हुए परीक्षण सेट में विभाजित हैं।

डेटासेट में विभिन्न प्रकार के प्रश्न शामिल हैं, जैसे कि कौन, क्या, कब, कहाँ, क्यों और कैसे प्रश्न। यह विविधता मॉडलों को विभिन्न प्रकार के तर्क करने की चुनौती देती है, जिसमें इकाई पहचान, लौकिक तर्क और कारणात्मक अनुमान शामिल हैं। उत्तर खंड एकल टोकन से लेकर बहु-वाक्य अनुच्छेदों तक होते हैं, हालांकि अधिकांश छोटे वाक्यांश होते हैं।

मूल्यांकन मेट्रिक्स

मॉडलों का मूल्यांकन दो प्राथमिक मेट्रिक्स पर किया जाता है: एक्सेक्ट मैच (ईएम) और एफ1 स्कोर। ईएम उन भविष्यवाणियों का प्रतिशत मापता है जो विराम चिह्न और लेखों को अनदेखा करते हुए ग्राउंड ट्रुथ उत्तर से बिल्कुल मेल खाती हैं। एफ1 स्कोर भविष्यवाणी और ग्राउंड ट्रुथ टोकन के बीच सटीकता और पुनर्प्राप्ति का हार्मोनिक माध्य गणना करता है, जो आंशिक मिलानों को पुरस्कृत करने वाला अधिक उदार उपाय प्रदान करता है। ये मेट्रिक्स पठन समझ के क्षेत्र में मानक बन गए हैं और कई बाद के डेटासेट में उपयोग किए जाते हैं।

SQuAD v1.1 पर मानव प्रदर्शन 82.3 ईएम और 91.2 एफ1 अनुमानित है, जो मॉडल तुलना के लिए एक संदर्भ बिंदु प्रदान करता है। प्रारंभिक मॉडल 50% एफ1 से अधिक होने में संघर्ष करते थे, लेकिन डीप लर्निंग और न्यूरल नेटवर्क आर्किटेक्चर में तेजी से प्रगति ने कुछ वर्षों के भीतर महत्वपूर्ण सुधार किए।

प्रभाव और विरासत

SQuAD v1.1 ने मशीन लर्निंग और आर्टिफिशियल इंटेलिजेंस में अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई। इसने एक मानकीकृत, बड़े पैमाने का बेंचमार्क प्रदान किया जिसने शोधकर्ताओं को मॉडल प्रदर्शन की निष्पक्ष रूप से तुलना करने की अनुमति दी। डेटासेट ने कई प्रभावशाली आर्किटेक्चर के विकास को प्रेरित किया, जिसमें ट्रांसफॉर्मर-आधारित मॉडल शामिल हैं जो बाद में आधुनिक बड़े भाषा मॉडल की नींव बने।

विशेष रूप से, SQuAD v1.1 की रिलीज़ प्राकृतिक भाषा प्रसंस्करण में ध्यान तंत्र और मल्टी-हेड अटेंशन के उदय के साथ मेल खाती थी। बीआईडीएएफ (द्विदिशात्मक ध्यान प्रवाह) और बाद में बीईआरटी जैसे मॉडलों ने इस बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए, जो प्रीट्रेनिंग और फाइन-ट्यूनिंग प्रतिमानों की शक्ति का प्रदर्शन करते हैं। SQuAD v1.1 पर इन मॉडलों की सफलता ने एनकोडर-डिकोडर और सीक्वेंस-टू-सीक्वेंस फ्रेमवर्क की प्रभावशीलता को मान्य करने में मदद की।

डेटासेट ने बाद के बेंचमार्क के निर्माण को भी प्रभावित किया, जिसमें SQuAD v2.0 शामिल है, जिसने मॉडल मजबूती का परीक्षण करने के लिए अनुत्तरित प्रश्न जोड़े। कई अन्य पठन समझ डेटासेट, जैसे कि आरएसीई और ट्रिवियाक्यूए, समान सिद्धांतों के साथ डिज़ाइन किए गए थे, लेकिन SQuAD v1.1 क्षेत्र में सबसे अधिक उद्धृत और व्यापक रूप से उपयोग किए जाने वाले बेंचमार्क में से एक बना हुआ है।

सीमाएँ और आलोचनाएँ

इसकी सफलता के बावजूद, SQuAD v1.1 की कई सीमाएँ हैं। कार्य की निष्कर्षणात्मक प्रकृति का मतलब है कि मॉडलों को केवल पाठ के एक खंड की पहचान करने की आवश्यकता है, न कि नए उत्तर उत्पन्न करने की। इससे ऐसे मॉडल बन सकते हैं जो जानकारी का पता लगाने में अच्छे हैं लेकिन इसके बारे में संश्लेषण या तर्क करने में कम सक्षम हैं। डेटासेट विकिपीडिया लेखों पर भी निर्भर करता है, जो विषय कवरेज और लेखन शैली में पूर्वाग्रह पेश कर सकता है।

इसके अतिरिक्त, क्राउड-सोर्स किए गए प्रश्नों में कभी-कभी अस्पष्टताएँ होती हैं या सामान्य ज्ञान तर्क की आवश्यकता होती है जो अनुच्छेद में स्पष्ट रूप से नहीं बताया गया है। जैसे-जैसे मॉडलों में सुधार हुआ, मानव और मशीन प्रदर्शन के बीच का अंतर कम हो गया, जिससे शीर्ष-प्रदर्शन प्रणालियों के बीच अंतर करने की डेटासेट की क्षमता के बारे में चिंताएँ पैदा हुईं। इन मुद्दों ने अधिक चुनौतीपूर्ण बेंचमार्क के निर्माण और निष्कर्षणात्मक उत्तर देने से परे जाने वाले जनरेटिव एआई दृष्टिकोणों की खोज को प्रेरित किया।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·dataset·question-answering·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास