अंग्रेज़ी से अनुवादित

SQuAD डेटासेट, जिसे 2016 में स्टैनफोर्ड विश्वविद्यालय द्वारा पेश किया गया था, मशीन रीडिंग कॉम्प्रिहेंशन के लिए एक बेंचमार्क है, जिसमें विकिपीडिया लेखों से लिए गए 100,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिसने प्राकृतिक भाषा प्रसंस्करण में महत्वपूर्ण प्रगति को बढ़ावा दिया है।

SQuAD डेटासेट (स्टैनफोर्ड प्रश्न उत्तर डेटासेट) Machine learning मॉडलों की पढ़ने की समझ और प्रश्न उत्तर देने की क्षमता का मूल्यांकन करने के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क है। 2016 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया, यह डेटासेट 500 से अधिक विकिपीडिया लेखों के सेट पर आधारित 100,000 से अधिक प्रश्न-उत्तर जोड़ों से बना है। कार्य के लिए एक मॉडल को दिए गए अनुच्छेद को पढ़ना और अनुच्छेद से पाठ के सन्निहित खंड को निकालकर प्रश्न का उत्तर देना आवश्यक है, यह प्रारूप प्राकृतिक भाषा समझ प्रणालियों के लिए एक मानक परीक्षण बन गया है।

SQuAD के निर्माण ने Artificial intelligence के क्षेत्र में एक महत्वपूर्ण बदलाव को चिह्नित किया, जो छोटे, सिंथेटिक डेटासेट से बड़े पैमाने पर, क्राउड-सोर्स्ड बेंचमार्क की ओर बढ़ा जो वास्तविक दुनिया की भाषा जटिलता को दर्शाते हैं। प्रश्न क्राउड वर्कर्स द्वारा उत्पन्न किए गए थे, जिन्हें विकिपीडिया लेखों के छोटे अंशों के आधार पर प्रश्न लिखने के लिए कहा गया था, यह सुनिश्चित करते हुए कि उत्तर हमेशा पाठ में मौजूद थे। इस डिज़ाइन ने सटीक मिलान और F1 स्कोर का उपयोग करके स्वचालित मूल्यांकन की अनुमति दी, जो विभिन्न मॉडलों की तुलना के लिए एक स्पष्ट और प्रतिलिपि प्रस्तुत करने योग्य मीट्रिक प्रदान करता है।

डेटासेट डिज़ाइन और संग्रह

SQuAD डेटासेट का निर्माण दो-चरणीय प्रक्रिया के माध्यम से किया गया था। पहले, 536 विकिपीडिया लेखों का एक सेट चुना गया, जिसमें इतिहास और विज्ञान से लेकर मनोरंजन और भूगोल तक विविध विषयों को शामिल किया गया। प्रत्येक लेख के लिए, क्राउड वर्कर्स को एक अनुच्छेद दिखाया गया और उनसे पांच तक प्रश्न बनाने के लिए कहा गया, इस बाधा के साथ कि उत्तर उस अनुच्छेद के भीतर पाठ का एक खंड होना चाहिए। इस प्रक्रिया से मूल संस्करण, जिसे SQuAD 1.1 के रूप में जाना जाता है, में 107,785 प्रश्न-उत्तर जोड़े प्राप्त हुए।

SQuAD 1.1 की एक प्रमुख विशेषता यह है कि सभी प्रश्न उत्तर योग्य हैं, जिसका अर्थ है कि उत्तर हमेशा संबंधित अनुच्छेद में मौजूद होता है। यह मूल्यांकन को सरल बनाता है लेकिन किसी मॉडल की यह पहचानने की क्षमता का परीक्षण नहीं करता कि दिए गए पाठ से प्रश्न का उत्तर कब नहीं दिया जा सकता। इस सीमा को संबोधित करने के लिए, एक अनुवर्ती संस्करण, SQuAD 2.0, 2018 में जारी किया गया था, जिसमें 50,000 से अधिक अनुत्तरित प्रश्न जोड़े गए थे जो प्रशंसनीय होने के लिए डिज़ाइन किए गए हैं लेकिन अनुच्छेद में कोई वैध उत्तर नहीं है। इस विस्तार ने बेंचमार्क को अधिक चुनौतीपूर्ण और यथार्थवादी बना दिया, क्योंकि इसके लिए मॉडलों को जानकारी उपलब्ध न होने पर उत्तर देने से परहेज करने की आवश्यकता होती है।

प्राकृतिक भाषा प्रसंस्करण पर प्रभाव

SQuAD जल्दी ही प्राकृतिक भाषा प्रसंस्करण (NLP) के क्षेत्र में एक आधारशिला बेंचमार्क बन गया। इसके जारी होने से पहले, पढ़ने की समझ के डेटासेट अक्सर छोटे या कृत्रिम रूप से निर्मित होते थे, जो प्रगति को आगे बढ़ाने की उनकी क्षमता को सीमित करते थे। SQuAD के पैमाने और गुणवत्ता, इसके सीधे मूल्यांकन मेट्रिक्स के साथ मिलकर, मॉडलों के तेजी से पुनरावृत्ति और तुलना को सक्षम बनाती है। यह तंत्रिका नेटवर्क आर्किटेक्चर के विकास के लिए एक प्राथमिक परीक्षण मंच के रूप में कार्य करता था, विशेष रूप से ध्यान तंत्र और ट्रांसफार्मर पर आधारित।

डेटासेट ने प्रश्न उत्तर देने के लिए गहन शिक्षण दृष्टिकोण के उदय में महत्वपूर्ण भूमिका निभाई। प्रारंभिक मॉडल आवर्तक तंत्रिका नेटवर्क और Sequence-to-Sequence (Seq2Seq) आर्किटेक्चर पर निर्भर थे, लेकिन 2017 में ट्रांसफार्मर आर्किटेक्चर की शुरुआत, जो आंशिक रूप से बेहतर पढ़ने की समझ की आवश्यकता से प्रेरित थी, ने SQuAD पर नाटकीय सुधार किए। Google में विकसित BERT जैसे मॉडलों ने 2018 में SQuAD 1.1 पर मानव प्रदर्शन को पार करते हुए 91.2% सटीक मिलान के मानव आधार रेखा को पीछे छोड़ दिया। इस मील के पत्थर ने पूर्व-प्रशिक्षित भाषा मॉडल की शक्ति को उजागर किया और पूरे क्षेत्र में बड़े भाषा मॉडल को अपनाने में तेजी लाई।

मूल्यांकन मेट्रिक्स और लीडरबोर्ड

SQuAD का आधिकारिक मूल्यांकन दो प्राथमिक मेट्रिक्स का उपयोग करता है: सटीक मिलान (EM) और F1 स्कोर। EM उन भविष्यवाणियों का प्रतिशत मापता है जो ग्राउंड ट्रुथ उत्तर से बिल्कुल मेल खाती हैं, जबकि F1 पूर्वानुमानित और सही उत्तर स्पैन के बीच टोकन ओवरलैप के आधार पर सटीकता और पुनर्प्राप्ति के हार्मोनिक माध्य की गणना करता है। ये मेट्रिक्स गणना और व्याख्या करने में आसान हैं, जो उन्हें बेंचमार्किंग के लिए आदर्श बनाते हैं। डेटासेट के साथ एक आधिकारिक लीडरबोर्ड भी है, जो स्टैनफोर्ड द्वारा होस्ट किया गया है, जहां शोध टीमें अपने मॉडल की भविष्यवाणियां जमा कर सकती हैं और दूसरों के खिलाफ प्रदर्शन की तुलना कर सकती हैं।

लीडरबोर्ड प्रतिस्पर्धा और नवाचार के लिए उत्प्रेरक रहा है। अपनी शुरुआत के बाद से, हजारों सबमिशन किए गए हैं, जिनमें स्कोर 2016 की शुरुआत में लगभग 50% EM से बढ़कर 2019 तक 90% से अधिक हो गए। प्रतियोगिता ने एन्सेम्बल विधियों और डेटा वृद्धि तकनीकों के विकास को भी प्रेरित किया, क्योंकि टीमें मामूली लाभ प्राप्त करने का प्रयास कर रही थीं। हालांकि, जैसे-जैसे मॉडल मानव प्रदर्शन से अधिक होने लगे, डेटासेट की सीमाओं के बारे में प्रश्न उठे, जैसे कि निष्कर्षणात्मक उत्तरों पर इसकी निर्भरता और सच्ची समझ के बजाय सतही संकेतों का शोषण करने की मॉडलों की क्षमता।

सीमाएं और विस्तार

अपनी सफलता के बावजूद, SQuAD में कई ज्ञात सीमाएं हैं। कार्य की निष्कर्षणात्मक प्रकृति का अर्थ है कि मॉडलों को नए उत्तर उत्पन्न करने या कई वाक्यों से जानकारी को संश्लेषित करने की आवश्यकता नहीं है। इसके अतिरिक्त, डेटासेट मुख्य रूप से अंग्रेजी में है और विकिपीडिया से लिया गया है, जो विश्वकोशीय, अच्छी तरह से संरचित पाठ की ओर पूर्वाग्रह पेश करता है। इन बाधाओं ने अधिक जटिल बेंचमार्क के विकास को जन्म दिया है, जैसे कि SQuAD 2.0, जिसमें अनुत्तरित प्रश्न शामिल हैं, और RACE और Natural Questions जैसे अन्य डेटासेट, जो अधिक उन्नत तर्क कौशल का परीक्षण करते हैं।

शोधकर्ताओं ने SQuAD को स्थानांतरण शिक्षण और डोमेन अनुकूलन के लिए एक प्रारंभिक बिंदु के रूप में भी उपयोग किया है। डेटासेट का कई भाषाओं में अनुवाद किया गया है, और इसके प्रारूप को चिकित्सा और कानून जैसे विशेष डोमेन में मशीन पढ़ने की समझ जैसे कार्यों के लिए अनुकूलित किया गया है। इसके अलावा, SQuAD पुनर्प्राप्ति-वर्धित पीढ़ी प्रणालियों के विकास में सहायक रहा है, जहां एक मॉडल पहले प्रासंगिक अनुच्छेदों को पुनर्प्राप्त करता है और फिर उत्तर निकालता है, एक तकनीक जो अब आधुनिक जनरेटिव AI अनुप्रयोगों में व्यापक रूप से उपयोग की जाती है।

विरासत और निरंतर प्रासंगिकता

SQuAD डेटासेट NLP अनुसंधान में एक मानक संदर्भ बना हुआ है, भले ही नए बेंचमार्क उभरे हैं। इसके डिज़ाइन सिद्धांत - बड़े पैमाने पर, क्राउड-सोर्स्ड, और आसानी से मूल्यांकन योग्य - ने कई बाद के डेटासेट के निर्माण को प्रभावित किया है। चिकित्सकों के लिए, SQuAD नए मॉडल आर्किटेक्चर और प्रशिक्षण तकनीकों के लिए एक सैनिटी चेक के रूप में कार्य करता है। व्यापक क्षेत्र के लिए, इसने वैज्ञानिक प्रगति को आगे बढ़ाने में कठोर, प्रतिलिपि प्रस्तुत करने योग्य बेंचमार्क के मूल्य का प्रदर्शन किया।

2020 के दशक की शुरुआत तक, SQuAD अभी भी अक्सर शोध पत्रों में उद्धृत किया जाता है और शैक्षिक सेटिंग्स में प्रश्न उत्तर और पढ़ने की समझ सिखाने के लिए उपयोग किया जाता है। जबकि OpenAI और Anthropic जैसे आधुनिक बड़े भाषा मॉडल मूल डेटासेट पर लगभग पूर्ण स्कोर प्राप्त कर सकते हैं, SQuAD से सीखे गए पाठ अधिक जटिल कार्यों, जैसे ओपन-डोमेन प्रश्न उत्तर और मल्टी-हॉप तर्क के लिए मूल्यांकन विधियों के डिजाइन को सूचित करना जारी रखते हैं। डेटासेट की विरासत न केवल इसके प्रत्यक्ष योगदान में निहित है, बल्कि अनुभवजन्य मूल्यांकन की संस्कृति में भी है जिसे इसने Machine learning समुदाय के भीतर बढ़ावा देने में मदद की।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·natural-language-processing·benchmark·question-answering
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास