अंग्रेज़ी से अनुवादित

SST-2 एक बाइनरी भावना वर्गीकरण बेंचमार्क है जो स्टैनफोर्ड सेंटिमेंट ट्रीबैंक से व्युत्पन्न है, जिसका उपयोग व्यापक रूप से एकल-वाक्य भावना विश्लेषण पर मशीन लर्निंग मॉडल का मूल्यांकन करने के लिए किया जाता है।

SST-2 (स्टैनफोर्ड सेंटिमेंट ट्रीबैंक बाइनरी) द्विआधारी भावना वर्गीकरण के लिए एक बेंचमार्क डेटासेट है, जहां प्रत्येक उदाहरण फिल्म समीक्षाओं का एक एकल वाक्य है जिसे या तो सकारात्मक या नकारात्मक के रूप में लेबल किया गया है। यह बड़े स्टैनफोर्ड सेंटिमेंट ट्रीबैंक (SST) का एक उपसमुच्चय है, जिसे 2013 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा सूक्ष्म-स्तरीय भावना विश्लेषण को सक्षम करने के लिए पेश किया गया था। SST-2 मूल पांच-वर्गीय लेबल (बहुत नकारात्मक, नकारात्मक, तटस्थ, सकारात्मक, बहुत सकारात्मक) को तटस्थ वाक्यों को हटाकर और शेष लेबलों को समूहित करके दो वर्गों में सरल बनाता है, जिससे यह वाक्य-स्तरीय समझ पर मशीन लर्निंग और डीप लर्निंग मॉडलों के मूल्यांकन के लिए एक मानक कार्य बन जाता है।

डेटासेट में प्रशिक्षण विभाजन में 6,920 वाक्य, विकास विभाजन में 872, और परीक्षण विभाजन में 1,821 वाक्य शामिल हैं। प्रत्येक वाक्य फिल्म समीक्षाओं से लिया गया है जो मूल रूप से रॉटेन टोमाटोज़ से एकत्र किए गए थे। द्विआधारी रूप को बाद के शोध द्वारा लोकप्रिय बनाया गया, विशेष रूप से तंत्रिका नेटवर्क आर्किटेक्चर के संदर्भ में, और यह प्राकृतिक भाषा प्रसंस्करण (NLP) में सबसे अधिक उद्धृत बेंचमार्क में से एक बन गया है। SST-2 अक्सर GLUE (जनरल लैंग्वेज अंडरस्टैंडिंग इवैलुएशन) बेंचमार्क में अन्य कार्यों के साथ प्रयोग किया जाता है, जिसे 2018 में नौ कार्यों में सामान्य-उद्देश्यीय भाषा समझ को मापने के लिए जारी किया गया था।

कार्य परिभाषा और मूल्यांकन

SST-2 में, लक्ष्य यह भविष्यवाणी करना है कि कोई दिया गया वाक्य सकारात्मक या नकारात्मक भावना व्यक्त करता है या नहीं। मूल्यांकन मीट्रिक सटीकता है, जिसे सही ढंग से वर्गीकृत वाक्यों के अनुपात के रूप में परिभाषित किया गया है। चूंकि लेबल संतुलित हैं (लगभग बराबर सकारात्मक और नकारात्मक उदाहरण), सटीकता मॉडल प्रदर्शन का एक सीधा माप है। यह कार्य एकल-वाक्य वर्गीकरण समस्या माना जाता है, जो प्राकृतिक भाषा अनुमान जैसे युग्म-आधारित कार्यों से अलग है। मॉडल आमतौर पर बड़े कोरपोरा पर पूर्व-प्रशिक्षित होते हैं और फिर SST-2 प्रशिक्षण सेट पर सूक्ष्म-ट्यून किए जाते हैं, जिसमें GLUE लीडरबोर्ड या अन्य मूल्यांकन हार्नेस के माध्यम से परीक्षण सेट पर प्रदर्शन की रिपोर्ट की जाती है।

ऐतिहासिक संदर्भ और निर्माण

मूल स्टैनफोर्ड सेंटिमेंट ट्रीबैंक रिचर्ड सोचर और सहयोगियों द्वारा स्टैनफोर्ड एआई लैब में बनाया गया था, जिसमें 2013 में प्रकाशित पेपर "रिकर्सिव डीप मॉडल्स फॉर सीमेंटिक कम्पोज़िशनैलिटी ओवर अ सेंटिमेंट ट्रीबैंक" शामिल था। ट्रीबैंक में प्रत्येक वाक्य के लिए पार्स ट्री शामिल हैं, जिसमें प्रत्येक नोड पर भावना लेबल होते हैं, जो कम्पोज़िशनल मॉडल को वाक्यांश-स्तरीय शब्दार्थ सीखने में सक्षम बनाता है। द्विआधारी संस्करण, SST-2, बाद में ओपनएआई और अन्य के शोधकर्ताओं द्वारा सरल मूल्यांकन के लिए निकाला गया था। डेटासेट के निर्माण में अमेज़न मैकेनिकल तुर्क के माध्यम से क्राउडसोर्सिंग लेबल शामिल थे, जिसमें प्रत्येक वाक्य को विश्वसनीयता सुनिश्चित करने के लिए कई एनोटेटर्स द्वारा लेबल किया गया था। मूल ट्रीबैंक में 239,232 अद्वितीय वाक्यांश हैं, लेकिन SST-2 केवल पूर्ण वाक्यों पर केंद्रित है, जो वाक्य-स्तरीय भावना के लिए एक स्वच्छ बेंचमार्क प्रदान करता है।

मॉडल विकास में भूमिका

SST-2 ने NLP में प्रगति को ट्रैक करने में महत्वपूर्ण भूमिका निभाई है। शुरुआती मॉडल, जैसे पुनरावर्ती तंत्रिका नेटवर्क और LSTM, ने 80-85% की सीमा में सटीकता हासिल की। 2018 में BERT के साथ शुरू हुए ट्रांसफॉर्मर-आधारित मॉडलों की शुरुआत ने सटीकता को 90% से ऊपर धकेल दिया, और बाद के मॉडल जैसे बड़े भाषा मॉडल ने लगभग मानव-स्तरीय प्रदर्शन हासिल किया है। उदाहरण के लिए, BERT-बेस ने SST-2 पर लगभग 92.7% सटीकता हासिल की, जबकि RoBERTa और T5 जैसे बाद के मॉडल 95% से अधिक हो गए हैं। बेंचमार्क का उपयोग मजबूती का परीक्षण करने के लिए भी किया जाता है, क्योंकि मॉडलों को विविध वाक्य संरचनाओं और शब्दावली के लिए सामान्यीकरण करना चाहिए। 2024 तक, अत्याधुनिक मॉडल 96% से अधिक सटीकता की रिपोर्ट करते हैं, हालांकि कार्य व्यावहारिक उद्देश्यों के लिए काफी हद तक हल माना जाता है, शेष त्रुटियां अक्सर व्यंग्य, बारीकियों या संदर्भ-निर्भर भावना के कारण होती हैं।

अन्य बेंचमार्क से संबंध

SST-2 GLUE बेंचमार्क का हिस्सा है, जिसमें CoLA (भाषाई स्वीकार्यता), MNLI (प्राकृतिक भाषा अनुमान), और QQP (प्रश्न परिभाषा) जैसे कार्य शामिल हैं। GLUE को 2018 में गूगल टीम द्वारा सामान्य-उद्देश्यीय भाषा समझ के लिए मानकीकृत मूल्यांकन प्रदान करने के लिए पेश किया गया था। SST-2 को SuperGLUE में भी शामिल किया गया है, जो एक अधिक चुनौतीपूर्ण उत्तराधिकारी है, हालांकि SuperGLUE एक अलग भावना कार्य (BoolQ) का उपयोग करता है। GLUE से परे, SST-2 का उपयोग अक्सर जनरेटिव एआई और कृत्रिम बुद्धिमत्ता सुरक्षा पर शोध में किया जाता है, क्योंकि यह मॉडल व्यवहार की जांच के लिए एक सरल परीक्षण मंच प्रदान करता है। कई मशीन लर्निंग फ्रेमवर्क, जैसे हगिंग फेस की डेटासेट्स लाइब्रेरी, में SST-2 अंतर्निहित डेटासेट के रूप में शामिल है, जो पुनरुत्पादन की सुविधा प्रदान करता है।

सीमाएं और आलोचनाएं

अपनी लोकप्रियता के बावजूद, SST-2 की ज्ञात सीमाएं हैं। द्विआधारी लेबलिंग तटस्थ वाक्यों को हटा देती है, जो वास्तविक दुनिया के अनुप्रयोगों में अस्पष्ट हो सकते हैं। डेटासेट फिल्म समीक्षाओं से प्राप्त है, जो डोमेन विविधता को सीमित करता है; SST-2 पर प्रशिक्षित मॉडल उत्पाद समीक्षाओं या सोशल मीडिया जैसे अन्य डोमेन में अच्छी तरह से सामान्यीकरण नहीं कर सकते हैं। इसके अतिरिक्त, मूल ट्रीबैंक के सूक्ष्म-स्तरीय लेबल द्विआधारी संस्करण में खो जाते हैं, जो तीव्रता के विश्लेषण को रोकता है। कुछ शोधकर्ताओं ने नोट किया है कि SST-2 सटीकता को कुछ विशेषणों की उपस्थिति जैसे सतही संकेतों का फायदा उठाने वाले मॉडल द्वारा बढ़ाया जा सकता है। फिर भी, SST-2 नई आर्किटेक्चर के लिए एक मानक आधार रेखा बना हुआ है, और इसकी सरलता इसे NLP के क्षेत्र में प्रवेश करने वाले छात्रों और अभ्यासकर्ताओं के लिए एक आदर्श शुरुआती बिंदु बनाती है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·benchmark·sentiment-analysis·dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास