Stanford Natural Language Inference corpus (SNLI) एक बेंचमार्क डेटासेट है जो प्राकृतिक भाषा अनुमान (NLI) के लिए है, जिसे पाठ्य तात्पर्य पहचान के रूप में भी जाना जाता है। इसे 2015 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा जारी किया गया था, और यह 570,000 मानव-एनोटेटेड वाक्य जोड़े प्रदान करता है, जिनमें से प्रत्येक को तात्पर्य, विरोधाभास या तटस्थ के रूप में लेबल किया गया है। यह डेटासेट मशीन-लर्निंग और डीप-लर्निंग मॉडलों के लिए एक मानक मूल्यांकन उपकरण बन गया, विशेष रूप से उन मॉडलों के लिए जो तंत्रिका-नेटवर्क आर्किटेक्चर का उपयोग करते हैं, और यह कृत्रिम-बुद्धिमत्ता के क्षेत्र में व्यापक रूप से उद्धृत बना हुआ है। मुख्य रूप से स्टैनफोर्ड एआई लैब में विकसित, SNLI को सैमुअल बोमन, गैबोर एंजेली, क्रिस्टोफर पॉट्स और क्रिस्टोफर डी. मैनिंग द्वारा पेश किया गया था, जिनके पेपर "A large annotated corpus for learning natural language inference" ने इसे 2015 के एम्पिरिकल मेथड्स इन नेचुरल लैंग्वेज प्रोसेसिंग (EMNLP) सम्मेलन में प्रस्तुत किया। इस कोर्पस को फ़्लिकर30k इमेज विवरण डेटासेट से कैप्शन को क्राउडसोर्स करके बनाया गया था, जिसने प्राकृतिक और विविध जोड़े प्रदान किए। कार्यकर्ताओं से कहा गया कि वे एक वाक्य लिखें जो किसी दिए गए आधार के सापेक्ष तात्पर्य, विरोधाभास या तटस्थ हो। इस प्रक्रिया ने 570,000 से अधिक जोड़ों के साथ एक उच्च-गुणवत्ता वाला प्रशिक्षण सेट तैयार किया, साथ ही लगभग 10,000 सत्यापन और परीक्षण उदाहरण प्रत्येक, सभी की स्वतंत्र रूप से समीक्षा की गई। टीम ने जानबूझकर SNLI को अति-शाब्दिक पूर्वाग्रहों से बचाने के लिए डिज़ाइन किया, यह सुनिश्चित करते हुए कि निर्णयों के लिए केवल शब्द मिलान के बजाय अर्थ के बारे में वास्तविक तर्क की आवश्यकता हो। अपनी रिलीज़ के बाद से, SNLI ने NLI में बड़ी प्रगति को बढ़ावा दिया है, जिससे MultiNLI जैसे वेरिएंट उत्पन्न हुए हैं और यह ट्रांसफॉर्मर आर्किटेक्चर पर आधारित मॉडलों के लिए प्रशिक्षण आधार के रूप में कार्य करता है।
Dataset Structure and Annotation
SNLI में प्रत्येक जोड़े में एक आधार (एक छोटा कैप्शन, जैसे, "Two women are embracing while holding to go packages") और एक परिकल्पना (एक अतिरिक्त वाक्य) शामिल है। लेबल 'entailment' (तात्पर्य, जहां परिकल्पना आधार से निकलती है), 'contradiction' (विरोधाभास, जहां दोनों सत्य नहीं हो सकते), या 'neutral' (तटस्थ, जहां कोई भी तार्किक रूप से दूसरे को सुनिश्चित नहीं करता) हो सकता है। मूल एनोटेशन योजना में एक 'contradiction' श्रेणी भी शामिल थी जिसे बाद में परिष्कृत किया गया। डेटा को प्रशिक्षण, विकास और परीक्षण सेटों में विभाजित किया गया है, जिनमें से बाद के दो को स्मृति के माध्यम से धोखाधड़ी को रोकने के लिए कठिन बनाया गया है। एनोटेशन प्रक्रिया में कई चरण शामिल थे: प्रारंभिक लेखन, फिर गुणवत्ता नियंत्रण के लिए दूसरा एनोटेशन, और अंत में कठिन मामलों को फ़िल्टर करने के लिए स्वचालित सत्यापन। इस बहु-पास दृष्टिकोण का उद्देश्य शोर-युक्त लेबल को कम करना था और इसने लगभग 73% की अंतर-एनोटेटर सहमति उत्पन्न की, जिसे एक अर्थ संबंधी कार्य के लिए उच्च माना जाता है।
Role in Model Evaluation
SNLI अर्थ संबंधी समझ में गहन शिक्षण मॉडलों के लिए एक प्रारंभिक कसौटी बन गया। इसकी रिलीज़ से पहले, प्राकृतिक भाषा अनुमान को अधिकतर हस्त-निर्मित विशेषताओं और पारंपरिक क्लासिफायरों के साथ संबोधित किया जाता था। डेटासेट के आकार ने बड़े सशर्त मॉडलों के प्रशिक्षण को सक्षम किया, जैसे कि आवर्तक तंत्रिका नेटवर्क (RNN), लंबी अल्पकालिक स्मृति (LSTM) नेटवर्क, और अंततः ध्यान-आधारित तंत्र। उदाहरण के लिए, 2016 में, ध्यान के साथ एक द्विदिश LSTM-आधारित मॉडल ने SNLI पर लगभग 86% सटीकता हासिल की, जो पहले के आधार रेखाओं की तुलना में एक महत्वपूर्ण सुधार था। बाद में, व्यापक पाठ कोर्पस पर प्रशिक्षित बड़े-भाषा-मॉडल ने 90% से अधिक सटीकता हासिल की है, जो डेटासेट की निरंतर प्रासंगिकता और एक निश्चित बेंचमार्क के रूप में SNLI की सीमाओं दोनों को दर्शाता है। शोधकर्ताओं ने सामान्यीकरण की जांच के लिए SNLI का भी उपयोग किया है, यह देखते हुए कि मॉडल अक्सर वास्तविक अनुमान के बजाय शाब्दिक ओवरलैप जैसे सांख्यिकीय शॉर्टकट का शोषण करते हैं।
Challenges and Limitations
अपने प्रभाव के बावजूद, SNLI में ज्ञात कमजोरियां हैं। परिकल्पनाएं कैप्शन से उत्पन्न की गई थीं, इसलिए डेटा ठोस, दृश्य परिदृश्यों की ओर झुका हुआ है, जिससे विज्ञान या चिकित्सा जैसे क्षेत्रों में विविधता सीमित हो जाती है। इसके अतिरिक्त, क्राउडसोर्स किए गए लेबल व्यक्तिपरक हो सकते हैं; जो एक एनोटेटर विरोधाभास मानता है वह दूसरे के लिए तटस्थ हो सकता है। मैरी-कैथरीन डी मार्नेफ और अन्य जैसे शोधकर्ताओं द्वारा विश्लेषण से पता चला है कि कई उदाहरण उथले ह्यूरिस्टिक्स (जैसे, शब्द मिलान) द्वारा उत्तर देने योग्य हैं, जिसका अर्थ है कि उच्च सटीकता मजबूत तर्क को प्रतिबिंबित नहीं कर सकती है। डेटासेट वर्ग असंतुलन से भी ग्रस्त है: तात्पर्य और तटस्थ विरोधाभास की तुलना में अधिक सामान्य हैं, हालांकि निर्माताओं ने वितरण को लगभग एक-तिहाई प्रत्येक में तय किया। इन मुद्दों ने Multi-Genre NLI (MultiNLI) और प्रतिकूल NLI जैसे नए डेटासेट को प्रेरित किया है, जो व्यापक कवरेज और कठिन उदाहरण प्रदान करते हैं।
Legacy and Influence
SNLI प्राकृतिक भाषा अनुमान के उपक्षेत्र को आगे बढ़ाने में सहायक रहा है, जैसे ImageNet ने कंप्यूटर दृष्टि को बदल दिया। इसने शब्दार्थ के लिए बड़े मानव-एनोटेटेड डेटासेट के उपयोग को लोकप्रिय बनाया और प्रतिलिपि प्रस्तुत करने योग्यता के लिए एक मानक स्थापित किया। कोर्पस स्टैनफोर्ड एआई लैब की वेबसाइट के माध्यम से स्वतंत्र रूप से उपलब्ध है और इसे Hugging Face के डेटासेट्स लाइब्रेरी जैसे प्रमुख टूलकिटों में एकीकृत किया गया है। 2025 तक, इसे हजारों बार उद्धृत किया गया है, और इसके डिजाइन सिद्धांतों को विभिन्न भाषाओं में अन्य तात्पर्य डेटासेट के लिए अपनाया गया है। हालांकि अधिक जटिल बेंचमार्क उभरे हैं, SNLI क्षेत्र में नए लोगों के लिए एक प्रारंभिक बिंदु और नए मॉडल आर्किटेक्चर के लिए एक सैनिटी चेक बना हुआ है।
Related Developments
SNLI की सफलता ने बेंचमार्किंग के लिए एक एकीकृत कार्य के रूप में व्यापक NLI प्राकृतिक भाषा अनुमान के निर्माण को प्रोत्साहित किया, जिससे 2018 में GLUE बेंचमार्क का विकास हुआ, जिसमें MultiNLI को एक मुख्य कार्य के रूप में शामिल किया गया। इसी तरह, XNLI डेटासेट ने SNLI-जैसे एनोटेशन को 15 भाषाओं में विस्तारित किया, जिससे बहुभाषी मॉडल मूल्यांकन सक्षम हुआ। बुनियादी ढांचे की ओर, अमेज़न-वेब-सर्विसेज और गूगल-क्लाउड जैसे प्रदाताओं ने SNLI को मशीन लर्निंग सेवाओं के लिए एक ट्यूटोरियल डेटासेट के रूप में होस्ट किया है, जिससे यह चिकित्सकों के लिए सुलभ हो गया है। शिक्षा जगत में, एमआईटी-सीएसएआईएल और बर्कले-एआई-रिसर्च ने प्रासंगिक प्रस्तुतियों की जांच के लिए SNLI का उपयोग किया है, और यह कार्नेगी-मेलन-विश्वविद्यालय और अन्य स्थानों पर पाठ्यक्रमों में एक मुख्य तत्व बना हुआ है।
See Also
- मशीन लर्निंग
- डीप लर्निंग
- natural-language-inference (यदि मौजूद हो)
- ट्रांसफॉर्मर
References
Bowman, S. R., Angeli, G., Potts, C., & Manning, C. D. (2015). A large annotated corpus for learning natural language inference. In Proceedings of EMNLP.
Stanford AI Lab official SNLI page.