SQuAD 1.1 (स्टैनफोर्ड प्रश्न उत्तर डेटासेट) प्राकृतिक भाषा प्रसंस्करण में पठन बोधन और प्रश्न-उत्तर प्रणालियों के मूल्यांकन के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क है। यह डेटासेट विकिपीडिया लेखों के एक समूह के आधार पर क्राउडवर्कर्स द्वारा उत्पन्न 100,000 से अधिक प्रश्न-उत्तर जोड़े से बना है। प्रत्येक प्रश्न का उत्तर संबंधित लेख से पाठ के सन्निहित खंड को निकालकर दिया जा सकता है, जिससे SQuAD 1.1 एक स्पैन-निष्कर्षण कार्य बन जाता है। इसे 2016 में स्टैनफोर्ड एआई लैब के शोधकर्ताओं द्वारा पेश किया गया था और तब से यह मशीन रीडिंग में प्रगति को मापने के लिए एक मानक संदर्भ बिंदु बन गया है।
SQuAD 1.1 का प्राथमिक उद्देश्य यह परीक्षण करना है कि क्या कोई मॉडल किसी दिए गए अनुच्छेद को समझ सकता है और उसके भीतर किसी प्रश्न का सटीक उत्तर ढूँढ सकता है। जनरेटिव प्रश्न-उत्तर कार्यों के विपरीत, SQuAD 1.1 के लिए मॉडल को प्रदान किए गए संदर्भ का एक उपस्ट्रिंग आउटपुट करना आवश्यक है। यह डिज़ाइन मूल्यांकन को सरल बनाता है और सटीक मिलान और F1 स्कोर के आधार पर स्वचालित स्कोरिंग की अनुमति देता है। डेटासेट विकिपीडिया से इतिहास, विज्ञान और जीवनी सहित विविध विषयों को कवर करता है, जिससे तथ्यात्मक ज्ञान का व्यापक कवरेज सुनिश्चित होता है।
डेटासेट निर्माण
SQuAD 1.1 के निर्माण में दो मुख्य चरण शामिल थे: लेख चयन और प्रश्न-उत्तर निर्माण। रचनाकारों ने विकिपीडिया से 536 लेखों का चयन किया, जिसमें भूगोल, खेल और मनोरंजन जैसी विभिन्न श्रेणियाँ शामिल थीं। फिर क्राउडवर्कर्स को प्रत्येक लेख को पढ़ने और ऐसे प्रश्न उत्पन्न करने के लिए कहा गया जिनका उत्तर पाठ के किसी विशिष्ट वाक्य या वाक्यांश का उपयोग करके दिया जा सके। उन्होंने सटीक उत्तर स्पैन भी प्रदान किया, जिसे बाद में अतिरिक्त कार्यकर्ताओं द्वारा मान्य किया गया। इस प्रक्रिया के परिणामस्वरूप 107,785 प्रश्न-उत्तर जोड़े बने, जिनमें प्रति लेख औसतन लगभग 200 प्रश्न थे।
SQuAD 1.1 में प्रत्येक प्रश्न एक एकल उत्तर स्पैन से जुड़ा है, हालाँकि यदि लेख में समानार्थी वाक्यांश शामिल हैं तो कुछ प्रश्नों के कई मान्य उत्तर हो सकते हैं। डेटासेट को 87,599 प्रश्नों के प्रशिक्षण सेट और 10,570 प्रश्नों के विकास सेट में विभाजित किया गया था, शेष प्रश्न छिपे हुए परीक्षण मूल्यांकन के लिए उपयोग किए गए थे। विकास सेट आमतौर पर मॉडल ट्यूनिंग के लिए उपयोग किया जाता है, जबकि परीक्षण सेट आधिकारिक लीडरबोर्ड सबमिशन के लिए आरक्षित है।
मूल्यांकन मेट्रिक्स
SQuAD 1.1 का मूल्यांकन दो प्राथमिक मेट्रिक्स का उपयोग करके किया जाता है: सटीक मिलान (EM) और F1 स्कोर। EM उन भविष्यवाणियों का प्रतिशत मापता है जो विराम चिह्न और लेखों को अनदेखा करते हुए ग्राउंड ट्रुथ उत्तर से बिल्कुल मेल खाती हैं। F1 स्कोर भविष्यवाणी और सही उत्तर टोकन के बीच परिशुद्धता और पुनर्प्राप्ति के हार्मोनिक माध्य की गणना करता है, जो आंशिक मिलानों को ध्यान में रखते हुए अधिक क्षमाशील माप प्रदान करता है। दोनों मेट्रिक्स डेटासेट के सभी प्रश्नों पर औसत हैं।
उदाहरण के लिए, यदि सही उत्तर "बराक ओबामा" है और कोई मॉडल "ओबामा" की भविष्यवाणी करता है, तो उस प्रश्न के लिए EM स्कोर 0 होगा, लेकिन F1 स्कोर 0.5 होगा (क्योंकि चार में से दो टोकन मेल खाते हैं)। ये मेट्रिक्स क्षेत्र में मानक बन गए हैं, और कई बाद के बेंचमार्क ने समान मूल्यांकन प्रोटोकॉल अपनाए हैं। तंत्रिका नेटवर्क का उपयोग करने वाले प्रारंभिक बेसलाइन मॉडल ने लगभग 70% F1 स्कोर हासिल किया, जबकि मानव प्रदर्शन 91.2% F1 और 82.3% EM अनुमानित है।
अनुसंधान पर प्रभाव
SQuAD 1.1 ने प्राकृतिक भाषा प्रसंस्करण अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई, विशेष रूप से पठन बोधन के लिए गहन शिक्षण मॉडल के विकास में। इसके जारी होने से पहले, अधिकांश प्रश्न-उत्तर प्रणालियाँ हस्तनिर्मित सुविधाओं और पारंपरिक मशीन लर्निंग तकनीकों पर निर्भर थीं। डेटासेट ने एक बड़े पैमाने पर, मानकीकृत परीक्षण मंच प्रदान किया जिसने ध्यान तंत्र और ट्रांसफॉर्मर-आधारित मॉडल सहित अधिक परिष्कृत तंत्रिका नेटवर्क आर्किटेक्चर के विकास को प्रोत्साहित किया।
कई प्रभावशाली मॉडलों को SQuAD 1.1 पर बेंचमार्क किया गया, जैसे कि BiDAF (द्विदिशात्मक ध्यान प्रवाह) मॉडल और बाद में BERT-शैली के पूर्व-प्रशिक्षित भाषा मॉडल। SQuAD 1.1 पर इन मॉडलों की सफलता ने संदर्भ को समझने में स्थानांतरण सीखने और बड़े भाषा मॉडल की प्रभावशीलता को प्रदर्शित किया। डेटासेट ने प्रदर्शन और दक्षता में सुधार के लिए डेटा संवर्धन और मॉडल प्रूनिंग तकनीकों में अनुसंधान को भी प्रेरित किया।
सीमाएँ और विरासत
अपनी लोकप्रियता के बावजूद, SQuAD 1.1 में ज्ञात सीमाएँ हैं। स्पैन-निष्कर्षण प्रारूप उत्तरों को सन्निहित पाठ तक सीमित करता है, जो वास्तविक दुनिया के सभी प्रश्न-उत्तर परिदृश्यों को प्रतिबिंबित नहीं करता है जहाँ उत्तरों के लिए कई वाक्यों में संश्लेषण या तर्क की आवश्यकता हो सकती है। इसके अतिरिक्त, डेटासेट में कुछ पूर्वाग्रह हैं, जैसे कि नामित संस्थाओं और तिथियों पर ध्यान केंद्रित करने की प्रवृत्ति, जो मॉडल को गहरी समझ के बजाय सतही पैटर्न पर निर्भर कर सकती है।
इन मुद्दों को संबोधित करने के लिए, SQuAD 2.0 जैसे बाद के संस्करणों ने अनुत्तरित प्रश्न पेश किए, और नेचुरल क्वेश्चन और ट्रिवियाQA जैसे अन्य बेंचमार्क ने दायरे का विस्तार किया। फिर भी, SQuAD 1.1 क्षेत्र में एक मौलिक संसाधन बना हुआ है। इसका उपयोग अक्सर बड़े भाषा मॉडल के लिए पूर्व-प्रशिक्षण या फाइन-ट्यूनिंग कार्य के रूप में किया जाता है और यह नए आर्किटेक्चर के मूल्यांकन के लिए आधार रेखा के रूप में काम करना जारी रखता है। इसका प्रभाव शिक्षा से परे फैला हुआ है, क्योंकि गूगल डीपमाइंड और ओपनएआई सहित कई उद्योग टीमों ने अपने सिस्टम को मान्य करने के लिए इसका उपयोग किया है।
निष्कर्ष
SQuAD 1.1 एक ऐतिहासिक डेटासेट है जिसने आधुनिक पठन बोधन प्रणालियों के विकास को आकार दिया। एक बड़े, उच्च-गुणवत्ता वाले कॉर्पस और स्पष्ट मूल्यांकन मेट्रिक्स प्रदान करके, इसने कृत्रिम बुद्धिमत्ता में तीव्र प्रगति को सक्षम किया और शोधकर्ताओं और चिकित्सकों के लिए एक प्रमुख संदर्भ बना हुआ है। जबकि नए बेंचमार्क उभरे हैं, SQuAD 1.1 की सरलता और मजबूती क्षेत्र में इसकी निरंतर प्रासंगिकता सुनिश्चित करती है।