SST Binary प्राकृतिक भाषा प्रसंस्करण में द्विआधारी भावना वर्गीकरण के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है। यह स्टैनफोर्ड सेंटिमेंट ट्रीबैंक (SST) का एक उपसमुच्चय है, जिसे 2013 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जिनमें रिचर्ड सोचर और क्रिस्टोफर मैनिंग शामिल हैं। SST मूल रूप से फिल्म समीक्षाओं के भीतर वाक्यांशों के लिए सूक्ष्म-स्तरीय भावना लेबल (बहुत नकारात्मक, नकारात्मक, तटस्थ, सकारात्मक, बहुत सकारात्मक) प्रदान करने के लिए डिज़ाइन किया गया था, लेकिन द्विआधारी संस्करण इन्हें दो वर्गों में समेट देता है: सकारात्मक और नकारात्मक। यह सरलीकरण SST Binary को भावना विश्लेषण पर मशीन लर्निंग मॉडल के मूल्यांकन के लिए एक मानक परीक्षण मंच बनाता है, विशेष रूप से उन मॉडलों के लिए जिन्हें वाक्य-स्तरीय या वाक्यांश-स्तरीय ध्रुवता को संभालना होता है।
डेटासेट में फिल्म समीक्षाओं से निकाले गए 6,920 एकल वाक्य शामिल हैं, जिनमें से प्रत्येक को सकारात्मक या नकारात्मक के रूप में लेबल किया गया है। मूल SST में वाक्यांश-स्तरीय एनोटेशन भी शामिल हैं, लेकिन SST Binary आमतौर पर वाक्य-स्तरीय द्विआधारी विभाजन को संदर्भित करता है। प्रशिक्षण, विकास और परीक्षण विभाजन पूर्व-निर्धारित हैं, जिनमें कुल 6,920 वाक्य हैं: 6,920 वाक्यों को 6,920 प्रशिक्षण उदाहरणों में विभाजित किया गया है, लेकिन मानक विभाजन प्रशिक्षण के लिए 6,920 वाक्य, विकास के लिए 872 और परीक्षण के लिए 1,821 का उपयोग करता है (ये संख्याएँ अनुमानित हैं और विभिन्न रिलीज़ में थोड़ी भिन्न होती हैं)। द्विआधारी लेबल सूक्ष्म-स्तरीय संस्करण से तटस्थ उदाहरणों को हटाकर प्राप्त किए जाते हैं, जिससे केवल स्पष्ट रूप से सकारात्मक या नकारात्मक वाक्य बचते हैं।
निर्माण और एनोटेशन
SST का निर्माण स्टैनफोर्ड सेंटिमेंट ट्रीबैंक कॉर्पस से किया गया था, जो स्वयं 2005 में पैंग और ली द्वारा एकत्रित फिल्म समीक्षा डेटासेट से व्युत्पन्न था। मूल समीक्षाओं को स्टैनफोर्ड पार्सर का उपयोग करके प्रत्येक वाक्य के लिए एक वृक्ष संरचना बनाने के लिए पार्स किया गया था, जिसमें वृक्ष के प्रत्येक नोड को भावना लेबल सौंपा गया था। द्विआधारी संस्करण के लिए, केवल मूल नोड (पूरा वाक्य) का उपयोग किया जाता है, और लेबल द्विआधारीकृत होते हैं: सूक्ष्म-स्तरीय लेबल 'सकारात्मक' और 'बहुत सकारात्मक' 'सकारात्मक' बन जाते हैं, जबकि 'नकारात्मक' और 'बहुत नकारात्मक' 'नकारात्मक' बन जाते हैं। तटस्थ लेबल बाहर रखे जाते हैं, जिसके परिणामस्वरूप लगभग संतुलित डेटासेट बनता है जिसमें सकारात्मक और नकारात्मक वाक्यों की संख्या लगभग बराबर होती है।
मशीन लर्निंग में उपयोग
SST Binary Machine learning और Deep learning समुदायों में एक मानक बेंचमार्क बन गया है। इसका उपयोग अक्सर Neural network मॉडलों के प्रदर्शन की तुलना करने के लिए किया जाता है, जिनमें आवर्ती नेटवर्क, कन्वोल्यूशनल नेटवर्क और हाल ही में Transformer (architecture)-आधारित मॉडल शामिल हैं। डेटासेट अपेक्षाकृत छोटा है, जो इसे सीमित डेटा स्थितियों के तहत मॉडल परीक्षण के लिए उपयोगी बनाता है। कई शोधपत्र SST Binary पर सटीकता को प्राथमिक मीट्रिक के रूप में रिपोर्ट करते हैं, जिसमें 2020 के दशक की शुरुआत तक अत्याधुनिक मॉडल लगभग 95% सटीकता प्राप्त करते हैं। डेटासेट का उपयोग ट्रांसफर लर्निंग अध्ययनों में भी किया जाता है, जहाँ बड़े कॉर्पस पर पूर्व-प्रशिक्षित मॉडल को उनकी भावना समझ का आकलन करने के लिए SST Binary पर फाइन-ट्यून किया जाता है।
अन्य डेटासेट से संबंध
SST Binary की तुलना अक्सर IMDB समीक्षाओं और Yelp ध्रुवता जैसे अन्य भावना डेटासेट से की जाती है। IMDB के विपरीत, जिसमें लंबे दस्तावेज़ होते हैं, SST Binary एकल वाक्यों पर केंद्रित है, जो इसे भाषाई समझ का अधिक सूक्ष्म परीक्षण बनाता है। सूक्ष्म-स्तरीय SST (पाँच वर्गों के साथ) भी उपयोग किया जाता है, लेकिन सरल कार्यों के लिए द्विआधारी संस्करण को प्राथमिकता दी जाती है। डेटासेट हगिंग फेस के डेटासेट जैसी लोकप्रिय NLP लाइब्रेरीज़ में शामिल है, और इसका उपयोग अक्सर ट्यूटोरियल और शोधपत्रों में Natural language processing पर किया जाता है (नोट: प्रदान की गई स्लग सूची में नहीं है, इसलिए लिंकिंग से बचें)।
सीमाएँ और आलोचनाएँ
SST Binary की एक सीमा इसका छोटा आकार है, जो बड़े मॉडलों को शुरू से प्रशिक्षित करते समय ओवरफिटिंग का कारण बन सकता है। इसके अतिरिक्त, द्विआधारी लेबल तटस्थ भावना को हटा देते हैं, जो वास्तविक दुनिया की अस्पष्टता को प्रतिबिंबित नहीं कर सकता है। कुछ शोधकर्ताओं ने नोट किया है कि डेटासेट में फिल्म समीक्षाओं से डोमेन-विशिष्ट भाषा शामिल है, जो अन्य डोमेन में सामान्यीकरण को सीमित कर सकती है। इन मुद्दों के बावजूद, SST Binary भावना वर्गीकरण के लिए एक विश्वसनीय और व्यापक रूप से उद्धृत बेंचमार्क बना हुआ है।
यह भी देखें
- Stanford AI Lab - वह प्रयोगशाला जहाँ डेटासेट बनाया गया था।
- Deep learning - वह क्षेत्र जो अक्सर मूल्यांकन के लिए इस डेटासेट का उपयोग करता है।
- Transformer (architecture) - एक मॉडल आर्किटेक्चर जिसे अक्सर SST Binary पर परीक्षण किया जाता है।
- Large language model - आधुनिक मॉडल जिनका मूल्यांकन इस बेंचमार्क पर किया जाता है।