SQuAD-Adversarial (SQuAD-Adversarial) एक बेंचमार्क डेटासेट है जो पठन समझ मॉडल की मजबूती का मूल्यांकन करने के लिए उपयोग किया जाता है। इसे मूल स्टैनफोर्ड प्रश्न उत्तर डेटासेट (SQuAD) में प्रतिकूल परिवर्तन (adversarial perturbations) जोड़कर निर्मित किया गया था, जो विकिपीडिया लेखों से प्राप्त प्रश्न-उत्तर जोड़ों का एक व्यापक रूप से उपयोग किया जाने वाला संग्रह है। SQuAD-Adversarial का प्राथमिक उद्देश्य उन मॉडलों की कमजोरियों को उजागर करना है जो मानक बेंचमार्क पर अच्छा प्रदर्शन करते हैं, लेकिन इनपुट प्रश्नों में सूक्ष्म, मानव-निर्मित संशोधनों का सामना करने पर विफल हो जाते हैं। ये परिवर्तन मूल प्रश्नों के अर्थ के समकक्ष होने के लिए डिज़ाइन किए गए हैं, लेकिन इनमें भटकाने वाले वाक्यांश या उपवाक्य शामिल होते हैं जो उन मॉडलों को गुमराह कर सकते हैं जो गहरी समझ के बजाय सतही शाब्दिक संकेतों पर निर्भर करते हैं।
इस डेटासेट को 2018 में कार्नेगी मेलन विश्वविद्यालय और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जिसका नेतृत्व रॉबिन जिया और पर्सी लियांग ने किया था। यह कार्य 2017 के एम्पिरिकल मेथड्स इन नेचुरल लैंग्वेज प्रोसेसिंग (EMNLP) सम्मेलन में प्रस्तुत किया गया था, जिसमें पेपर का शीर्षक "Adversarial Examples for Evaluating Reading Comprehension Systems" था। निर्माण प्रक्रिया में मानव एनोटेटर शामिल थे, जिन्हें मूल SQuAD प्रश्नों में अर्थ या उत्तर को बदले बिना अप्रासंगिक वाक्य जोड़ने के लिए कहा गया था। उदाहरण के लिए, "आकाश का रंग क्या है?" जैसे प्रश्न को "आकाश का रंग क्या है, यह देखते हुए कि घास हरी है?" में बदला जा सकता है। जोड़ा गया पाठ व्याकरणिक रूप से सही और विषयगत रूप से संबंधित होता है, जिससे मॉडलों के लिए इसे अनदेखा करना कठिन हो जाता है।
निर्माण और डिज़ाइन
SQuAD-Adversarial का निर्माण एक व्यवस्थित प्रक्रिया का पालन करता है। एनोटेटरों को मूल SQuAD प्रश्न और संबंधित संदर्भ अनुच्छेद दिए गए थे। उनका कार्य प्रश्न में एक छोटा, प्रशंसनीय वाक्य जोड़ना था जो इच्छित उत्तर को नहीं बदलता। जोड़े गए वाक्य अक्सर संदर्भ से संस्थाओं या तथ्यों का संदर्भ देते थे, जिससे एक प्रकार का भटकाने वाला तत्व बनता था जो पैटर्न मिलान या कीवर्ड ओवरलैप पर निर्भर मॉडलों को भ्रमित कर सकता था। अंतिम डेटासेट में 9,537 प्रतिकूल प्रश्न हैं, जिनमें से प्रत्येक SQuAD से मूल संदर्भ और उत्तर के साथ जोड़ा गया है। परिवर्तनों को सत्यापित किया गया ताकि यह सुनिश्चित हो सके कि मानव पाठक अभी भी प्रश्नों का सही उत्तर दे सकते हैं, जिससे पुष्टि होती है कि कठिनाई विशेष रूप से स्वचालित प्रणालियों के लिए थी।
मॉडल मूल्यांकन पर प्रभाव
SQuAD-Adversarial जल्दी ही पठन समझ मॉडलों के लिए एक मानक तनाव परीक्षण बन गया। मूल SQuAD बेंचमार्क पर, कई मॉडलों ने लगभग मानव-स्तर का प्रदर्शन हासिल किया, जिसमें F1 स्कोर 90% से अधिक था। हालांकि, जब SQuAD-Adversarial पर मूल्यांकन किया गया, तो उन्हीं मॉडलों ने महत्वपूर्ण प्रदर्शन में गिरावट दिखाई, अक्सर F1 स्कोर में 20 से 30 प्रतिशत अंकों की गिरावट आई। यह विसंगति तंत्रिका पठन समझ प्रणालियों की भंगुरता को उजागर करती है, विशेष रूप से Deep learning आर्किटेक्चर जैसे Transformer (architecture) मॉडल पर आधारित। डेटासेट ने प्रदर्शित किया कि मॉडल अक्सर अंतर्निहित शब्दार्थ को पकड़ने के बजाय सतही स्तर की विशेषताओं, जैसे प्रश्न और संदर्भ के बीच सटीक शब्द मिलान, पर निर्भर करते थे।
प्रतिकूल मजबूती से संबंध
SQuAD-Adversarial का निर्माण Machine learning में प्रतिकूल मजबूती को समझने और सुधारने के व्यापक शोध प्रयास का हिस्सा है। छवि वर्गीकरण में प्रतिकूल उदाहरणों के विपरीत, जिनमें अक्सर अगोचर पिक्सेल परिवर्तन शामिल होते हैं, SQuAD-Adversarial में परिवर्तन प्राकृतिक भाषा के जोड़ हैं जो मनुष्यों द्वारा आसानी से देखे जा सकते हैं। यह बेंचमार्क को Large language model और वास्तविक दुनिया के अनुप्रयोगों जैसे प्रश्न उत्तर और संवादी AI में उपयोग की जाने वाली अन्य प्रणालियों के मूल्यांकन के लिए विशेष रूप से प्रासंगिक बनाता है। SQuAD-Adversarial के निष्कर्षों ने डेटा संवर्धन और प्रशिक्षण रणनीतियों पर बाद के कार्यों को प्रभावित किया है, जैसे सामान्यीकरण में सुधार के लिए प्रशिक्षण के दौरान प्रतिकूल उदाहरणों को शामिल करना।
बाद के विकास और विरासत
SQuAD-Adversarial की रिलीज़ के बाद, कई संबंधित बेंचमार्क विकसित किए गए, जिनमें SQuAD 2.0 शामिल है, जिसने अनुत्तरित प्रश्न जोड़े, और प्राकृतिक भाषा अनुमान और मशीन अनुवाद के लिए अन्य प्रतिकूल डेटासेट शामिल हैं। मानव-इन-द-लूप प्रतिकूल परिवर्तन की पद्धति को अन्य शोध समूहों द्वारा अधिक चुनौतीपूर्ण मूल्यांकन सेट बनाने के लिए अपनाया गया है। डेटासेट मजबूत पठन समझ में प्रगति को मापने के लिए एक संदर्भ बिंदु बना हुआ है, और इसे अक्सर Neural network व्याख्यात्मकता और मजबूती पर पेपरों में उद्धृत किया जाता है। 2020 के दशक की शुरुआत तक, आधुनिक Large language model, जैसे कि OpenAI और Google DeepMind द्वारा विकसित, ने SQuAD-Adversarial पर बेहतर प्रदर्शन दिखाया है, लेकिन बेंचमार्क अभी भी जटिल भाषाई भटकाने वाले तत्वों को संभालने में अंतराल को उजागर करता है।
सीमाएं और आलोचनाएं
कुछ शोधकर्ताओं ने नोट किया है कि SQuAD-Adversarial एक विशिष्ट प्रकार के परिवर्तन - अप्रासंगिक उपवाक्य जोड़ने - पर केंद्रित है और अन्य प्रकार के प्रतिकूल हमलों, जैसे पैराफ्रेज़िंग या शब्द-स्तरीय प्रतिस्थापन, को शामिल नहीं कर सकता है। इसके अतिरिक्त, डेटासेट विकिपीडिया लेखों से लिया गया है, जो इसकी डोमेन कवरेज को सीमित करता है। इन सीमाओं के बावजूद, SQuAD-Adversarial मॉडल कमजोरियों का निदान करने और अधिक मजबूत Artificial intelligence प्रणालियों के विकास का मार्गदर्शन करने के लिए एक मूल्यवान उपकरण बना हुआ है। इसका प्रभाव शिक्षा जगत से परे फैला हुआ है, क्योंकि प्रश्न उत्तर उत्पाद बनाने वाली कंपनियां तैनाती से पहले अपनी प्रणालियों का परीक्षण करने के लिए समान प्रतिकूल मूल्यांकन तकनीकों का उपयोग करती हैं।