SQuAD डेटासेट (स्टैनफोर्ड प्रश्न उत्तर डेटासेट) Machine learning मॉडलों की पढ़ने की समझ और प्रश्न उत्तर देने की क्षमता का मूल्यांकन करने के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क है। 2016 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया, यह डेटासेट 500 से अधिक विकिपीडिया लेखों के सेट पर आधारित 100,000 से अधिक प्रश्न-उत्तर जोड़ों से बना है। कार्य के लिए एक मॉडल को दिए गए अनुच्छेद को पढ़ना और अनुच्छेद से पाठ के सन्निहित खंड को निकालकर प्रश्न का उत्तर देना आवश्यक है, यह प्रारूप प्राकृतिक भाषा समझ प्रणालियों के लिए एक मानक परीक्षण बन गया है।
SQuAD के निर्माण ने Artificial intelligence के क्षेत्र में एक महत्वपूर्ण बदलाव को चिह्नित किया, जो छोटे, सिंथेटिक डेटासेट से बड़े पैमाने पर, क्राउड-सोर्स्ड बेंचमार्क की ओर बढ़ा जो वास्तविक दुनिया की भाषा जटिलता को दर्शाते हैं। प्रश्न क्राउड वर्कर्स द्वारा उत्पन्न किए गए थे, जिन्हें विकिपीडिया लेखों के छोटे अंशों के आधार पर प्रश्न लिखने के लिए कहा गया था, यह सुनिश्चित करते हुए कि उत्तर हमेशा पाठ में मौजूद थे। इस डिज़ाइन ने सटीक मिलान और F1 स्कोर का उपयोग करके स्वचालित मूल्यांकन की अनुमति दी, जो विभिन्न मॉडलों की तुलना के लिए एक स्पष्ट और प्रतिलिपि प्रस्तुत करने योग्य मीट्रिक प्रदान करता है।
डेटासेट डिज़ाइन और संग्रह
SQuAD डेटासेट का निर्माण दो-चरणीय प्रक्रिया के माध्यम से किया गया था। पहले, 536 विकिपीडिया लेखों का एक सेट चुना गया, जिसमें इतिहास और विज्ञान से लेकर मनोरंजन और भूगोल तक विविध विषयों को शामिल किया गया। प्रत्येक लेख के लिए, क्राउड वर्कर्स को एक अनुच्छेद दिखाया गया और उनसे पांच तक प्रश्न बनाने के लिए कहा गया, इस बाधा के साथ कि उत्तर उस अनुच्छेद के भीतर पाठ का एक खंड होना चाहिए। इस प्रक्रिया से मूल संस्करण, जिसे SQuAD 1.1 के रूप में जाना जाता है, में 107,785 प्रश्न-उत्तर जोड़े प्राप्त हुए।
SQuAD 1.1 की एक प्रमुख विशेषता यह है कि सभी प्रश्न उत्तर योग्य हैं, जिसका अर्थ है कि उत्तर हमेशा संबंधित अनुच्छेद में मौजूद होता है। यह मूल्यांकन को सरल बनाता है लेकिन किसी मॉडल की यह पहचानने की क्षमता का परीक्षण नहीं करता कि दिए गए पाठ से प्रश्न का उत्तर कब नहीं दिया जा सकता। इस सीमा को संबोधित करने के लिए, एक अनुवर्ती संस्करण, SQuAD 2.0, 2018 में जारी किया गया था, जिसमें 50,000 से अधिक अनुत्तरित प्रश्न जोड़े गए थे जो प्रशंसनीय होने के लिए डिज़ाइन किए गए हैं लेकिन अनुच्छेद में कोई वैध उत्तर नहीं है। इस विस्तार ने बेंचमार्क को अधिक चुनौतीपूर्ण और यथार्थवादी बना दिया, क्योंकि इसके लिए मॉडलों को जानकारी उपलब्ध न होने पर उत्तर देने से परहेज करने की आवश्यकता होती है।
प्राकृतिक भाषा प्रसंस्करण पर प्रभाव
SQuAD जल्दी ही प्राकृतिक भाषा प्रसंस्करण (NLP) के क्षेत्र में एक आधारशिला बेंचमार्क बन गया। इसके जारी होने से पहले, पढ़ने की समझ के डेटासेट अक्सर छोटे या कृत्रिम रूप से निर्मित होते थे, जो प्रगति को आगे बढ़ाने की उनकी क्षमता को सीमित करते थे। SQuAD के पैमाने और गुणवत्ता, इसके सीधे मूल्यांकन मेट्रिक्स के साथ मिलकर, मॉडलों के तेजी से पुनरावृत्ति और तुलना को सक्षम बनाती है। यह तंत्रिका नेटवर्क आर्किटेक्चर के विकास के लिए एक प्राथमिक परीक्षण मंच के रूप में कार्य करता था, विशेष रूप से ध्यान तंत्र और ट्रांसफार्मर पर आधारित।
डेटासेट ने प्रश्न उत्तर देने के लिए गहन शिक्षण दृष्टिकोण के उदय में महत्वपूर्ण भूमिका निभाई। प्रारंभिक मॉडल आवर्तक तंत्रिका नेटवर्क और Sequence-to-Sequence (Seq2Seq) आर्किटेक्चर पर निर्भर थे, लेकिन 2017 में ट्रांसफार्मर आर्किटेक्चर की शुरुआत, जो आंशिक रूप से बेहतर पढ़ने की समझ की आवश्यकता से प्रेरित थी, ने SQuAD पर नाटकीय सुधार किए। Google में विकसित BERT जैसे मॉडलों ने 2018 में SQuAD 1.1 पर मानव प्रदर्शन को पार करते हुए 91.2% सटीक मिलान के मानव आधार रेखा को पीछे छोड़ दिया। इस मील के पत्थर ने पूर्व-प्रशिक्षित भाषा मॉडल की शक्ति को उजागर किया और पूरे क्षेत्र में बड़े भाषा मॉडल को अपनाने में तेजी लाई।
मूल्यांकन मेट्रिक्स और लीडरबोर्ड
SQuAD का आधिकारिक मूल्यांकन दो प्राथमिक मेट्रिक्स का उपयोग करता है: सटीक मिलान (EM) और F1 स्कोर। EM उन भविष्यवाणियों का प्रतिशत मापता है जो ग्राउंड ट्रुथ उत्तर से बिल्कुल मेल खाती हैं, जबकि F1 पूर्वानुमानित और सही उत्तर स्पैन के बीच टोकन ओवरलैप के आधार पर सटीकता और पुनर्प्राप्ति के हार्मोनिक माध्य की गणना करता है। ये मेट्रिक्स गणना और व्याख्या करने में आसान हैं, जो उन्हें बेंचमार्किंग के लिए आदर्श बनाते हैं। डेटासेट के साथ एक आधिकारिक लीडरबोर्ड भी है, जो स्टैनफोर्ड द्वारा होस्ट किया गया है, जहां शोध टीमें अपने मॉडल की भविष्यवाणियां जमा कर सकती हैं और दूसरों के खिलाफ प्रदर्शन की तुलना कर सकती हैं।
लीडरबोर्ड प्रतिस्पर्धा और नवाचार के लिए उत्प्रेरक रहा है। अपनी शुरुआत के बाद से, हजारों सबमिशन किए गए हैं, जिनमें स्कोर 2016 की शुरुआत में लगभग 50% EM से बढ़कर 2019 तक 90% से अधिक हो गए। प्रतियोगिता ने एन्सेम्बल विधियों और डेटा वृद्धि तकनीकों के विकास को भी प्रेरित किया, क्योंकि टीमें मामूली लाभ प्राप्त करने का प्रयास कर रही थीं। हालांकि, जैसे-जैसे मॉडल मानव प्रदर्शन से अधिक होने लगे, डेटासेट की सीमाओं के बारे में प्रश्न उठे, जैसे कि निष्कर्षणात्मक उत्तरों पर इसकी निर्भरता और सच्ची समझ के बजाय सतही संकेतों का शोषण करने की मॉडलों की क्षमता।
सीमाएं और विस्तार
अपनी सफलता के बावजूद, SQuAD में कई ज्ञात सीमाएं हैं। कार्य की निष्कर्षणात्मक प्रकृति का अर्थ है कि मॉडलों को नए उत्तर उत्पन्न करने या कई वाक्यों से जानकारी को संश्लेषित करने की आवश्यकता नहीं है। इसके अतिरिक्त, डेटासेट मुख्य रूप से अंग्रेजी में है और विकिपीडिया से लिया गया है, जो विश्वकोशीय, अच्छी तरह से संरचित पाठ की ओर पूर्वाग्रह पेश करता है। इन बाधाओं ने अधिक जटिल बेंचमार्क के विकास को जन्म दिया है, जैसे कि SQuAD 2.0, जिसमें अनुत्तरित प्रश्न शामिल हैं, और RACE और Natural Questions जैसे अन्य डेटासेट, जो अधिक उन्नत तर्क कौशल का परीक्षण करते हैं।
शोधकर्ताओं ने SQuAD को स्थानांतरण शिक्षण और डोमेन अनुकूलन के लिए एक प्रारंभिक बिंदु के रूप में भी उपयोग किया है। डेटासेट का कई भाषाओं में अनुवाद किया गया है, और इसके प्रारूप को चिकित्सा और कानून जैसे विशेष डोमेन में मशीन पढ़ने की समझ जैसे कार्यों के लिए अनुकूलित किया गया है। इसके अलावा, SQuAD पुनर्प्राप्ति-वर्धित पीढ़ी प्रणालियों के विकास में सहायक रहा है, जहां एक मॉडल पहले प्रासंगिक अनुच्छेदों को पुनर्प्राप्त करता है और फिर उत्तर निकालता है, एक तकनीक जो अब आधुनिक जनरेटिव AI अनुप्रयोगों में व्यापक रूप से उपयोग की जाती है।
विरासत और निरंतर प्रासंगिकता
SQuAD डेटासेट NLP अनुसंधान में एक मानक संदर्भ बना हुआ है, भले ही नए बेंचमार्क उभरे हैं। इसके डिज़ाइन सिद्धांत - बड़े पैमाने पर, क्राउड-सोर्स्ड, और आसानी से मूल्यांकन योग्य - ने कई बाद के डेटासेट के निर्माण को प्रभावित किया है। चिकित्सकों के लिए, SQuAD नए मॉडल आर्किटेक्चर और प्रशिक्षण तकनीकों के लिए एक सैनिटी चेक के रूप में कार्य करता है। व्यापक क्षेत्र के लिए, इसने वैज्ञानिक प्रगति को आगे बढ़ाने में कठोर, प्रतिलिपि प्रस्तुत करने योग्य बेंचमार्क के मूल्य का प्रदर्शन किया।
2020 के दशक की शुरुआत तक, SQuAD अभी भी अक्सर शोध पत्रों में उद्धृत किया जाता है और शैक्षिक सेटिंग्स में प्रश्न उत्तर और पढ़ने की समझ सिखाने के लिए उपयोग किया जाता है। जबकि OpenAI और Anthropic जैसे आधुनिक बड़े भाषा मॉडल मूल डेटासेट पर लगभग पूर्ण स्कोर प्राप्त कर सकते हैं, SQuAD से सीखे गए पाठ अधिक जटिल कार्यों, जैसे ओपन-डोमेन प्रश्न उत्तर और मल्टी-हॉप तर्क के लिए मूल्यांकन विधियों के डिजाइन को सूचित करना जारी रखते हैं। डेटासेट की विरासत न केवल इसके प्रत्यक्ष योगदान में निहित है, बल्कि अनुभवजन्य मूल्यांकन की संस्कृति में भी है जिसे इसने Machine learning समुदाय के भीतर बढ़ावा देने में मदद की।