STS-B (सिमेंटिक टेक्स्टुअल सिमिलैरिटी बेंचमार्क) प्राकृतिक भाषा प्रसंस्करण (NLP) में व्यापक रूप से उपयोग किया जाने वाला एक डेटासेट है, जिसका उपयोग कम्प्यूटेशनल मॉडलों की वाक्य-युग्मों की शब्दार्थ समानता का आकलन करने की क्षमता का मूल्यांकन करने के लिए किया जाता है। इसे 2017 में SemEval-2017 टास्क 1 के भाग के रूप में पेश किया गया था, जो 2012 से 2016 तक के पहले के सिमेंटिक टेक्स्टुअल सिमिलैरिटी (STS) साझा कार्यों पर आधारित था। इस बेंचमार्क में 8,628 अंग्रेजी वाक्य-युग्म शामिल हैं, जिनमें से प्रत्येक को 0 (पूरी तरह से असंबंधित) से 5 (शब्दार्थ रूप से समतुल्य) तक के मानव समानता स्कोर के साथ एनोटेट किया गया है। इन स्कोरों को आमतौर पर कई एनोटेटरों के बीच औसत करके एक स्वर्ण-मानक लेबल तैयार किया जाता है।
यह डेटासेट विभिन्न डोमेन से लिया गया है, जिसमें छवि कैप्शन, समाचार शीर्षक और उपयोगकर्ता-जनित फोरम पोस्ट शामिल हैं, जो इसे शब्दार्थ समझ के लिए एक विविध परीक्षण-क्षेत्र बनाता है। STS-B का उपयोग आमतौर पर वाक्य एम्बेडिंग, सिमेंटिक खोज और पैराफ्रेज़ डिटेक्शन जैसे कार्यों पर मॉडलों को प्रशिक्षित करने और मूल्यांकन करने के लिए किया जाता है। यह Machine learning और Artificial intelligence समुदायों में एक मानक बेंचमार्क बन गया है, जिसे अक्सर Large language model मूल्यांकन के लिए लीडरबोर्ड में शामिल किया जाता है।
कार्य परिभाषा और स्कोरिंग
STS-B कार्य में, एक मॉडल को वाक्यों की एक जोड़ी दी जाती है और उसे 0 से 5 के बीच एक सतत समानता स्कोर आउटपुट करना होता है। प्राथमिक मूल्यांकन मीट्रिक मॉडल के अनुमानित स्कोर और मानव-एनोटेटेड स्वर्ण स्कोर के बीच पियर्सन सहसंबंध है। कुछ मूल्यांकन स्पीयरमैन सहसंबंध की भी रिपोर्ट करते हैं। इस कार्य के लिए मॉडलों को सूक्ष्म शब्दार्थ भेदों को पकड़ने की आवश्यकता होती है, जैसे कि एंटेलमेंट, पैराफ्रेज़ और विरोधाभास के बीच का अंतर।
उदाहरण के लिए, "एक आदमी गिटार बजा रहा है" और "एक आदमी गिटार झंकृत कर रहा है" की जोड़ी को उच्च स्कोर (5 के करीब) मिलेगा, जबकि "एक आदमी गिटार बजा रहा है" और "एक कुत्ता भौंक रहा है" को कम स्कोर (0 के करीब) मिलेगा। बेंचमार्क की कठिनाई वाक्य-विन्यास विविधताओं, शाब्दिक अतिव्यापन और विश्व ज्ञान को संभालने में निहित है।
ऐतिहासिक संदर्भ
STS-B बेंचमार्क SemEval-2012 में STS पायलट कार्य से विकसित हुआ, जिसमें माइक्रोसॉफ्ट रिसर्च पैराफ्रेज़ कॉर्पस और अन्य स्रोतों के डेटा का उपयोग किया गया था। 2017 संस्करण, जिसे डैनियल सेर, मोना डियाब और अन्य शोधकर्ताओं द्वारा आयोजित किया गया था, ने पिछले वर्षों के डेटा को निश्चित प्रशिक्षण, सत्यापन और परीक्षण विभाजन के साथ एक एकल, पुन: प्रयोज्य बेंचमार्क में समेकित किया। परीक्षण सेट के लेबल शुरू में छिपाए गए थे और ओवरफिटिंग को रोकने के लिए बाद में जारी किए गए, जो साझा कार्यों में एक सामान्य प्रथा है।
अपनी रिलीज़ के बाद से, STS-B का उपयोग कई अध्ययनों में किया गया है। इसे विशेष रूप से 2018 में पेश किए गए GLUE बेंचमार्क (जनरल लैंग्वेज अंडरस्टैंडिंग इवैल्यूएशन) में शामिल किया गया था, जिसने सामान्य-उद्देश्यीय भाषा मॉडलों का मूल्यांकन करने के लिए नौ NLP कार्यों को एकत्रित किया था। STS-B GLUE और इसके उत्तराधिकारी SuperGLUE का एक घटक बना हुआ है, हालांकि SuperGLUE ने इसे अधिक चुनौतीपूर्ण कार्य के साथ बदल दिया।
मॉडल विकास में उपयोग
STS-B का उपयोग अक्सर वाक्य एम्बेडिंग मॉडलों को प्रशिक्षित करने के लिए किया जाता है, जैसे कि Transformer (architecture) आर्किटेक्चर पर आधारित मॉडल। Sentence-BERT (SBERT) और बाद के वेरिएंट जैसे मॉडल सियामी या ट्रिपलेट नेटवर्क के माध्यम से STS-B को एक प्रशिक्षण लक्ष्य के रूप में उपयोग करते हैं, जो एम्बेडिंग के बीच कोसाइन समानता को अनुकूलित करते हैं। बेंचमार्क का उपयोग Neural network मॉडलों के मूल्यांकन के लिए भी किया जाता है, जिसमें Deep learning सिस्टम और OpenAI, Anthropic और Google DeepMind द्वारा विकसित Large language model शामिल हैं।
बड़े पूर्व-प्रशिक्षित मॉडलों के युग में, STS-B का उपयोग अक्सर एक जांच कार्य के रूप में किया जाता है, यह आकलन करने के लिए कि क्या किसी मॉडल ने मजबूत शब्दार्थ प्रतिनिधित्व सीखा है। इसका उपयोग क्रॉस-भाषाई और बहुभाषी सेटिंग्स में भी किया जाता है, जहां मॉडलों का मूल्यांकन डेटासेट के अनुवादित संस्करणों पर किया जाता है।
सीमाएं और आलोचनाएं
अपनी लोकप्रियता के बावजूद, STS-B की ज्ञात सीमाएं हैं। डेटासेट अपेक्षाकृत छोटा है, और इसका एनोटेशन पैमाना (0-5) व्यक्तिपरक हो सकता है, जिससे अंतर-एनोटेटर परिवर्तनशीलता उत्पन्न होती है। यदि मॉडलों को डेटासेट के सार्वजनिक संस्करणों पर प्रशिक्षित किया जाता है, तो परीक्षण सेट डेटा लीकेज के लिए भी संवेदनशील है। इसके अतिरिक्त, बेंचमार्क अंग्रेजी पर केंद्रित है, जो अन्य भाषाओं में इसकी प्रयोज्यता को सीमित करता है। कुछ शोधकर्ताओं ने तर्क दिया है कि STS-B पर उच्च प्रदर्शन आवश्यक रूप से प्रश्न उत्तरण या सारांशीकरण जैसे डाउनस्ट्रीम कार्यों पर बेहतर प्रदर्शन में तब्दील नहीं होता है।
संबंधित बेंचमार्क और विस्तार
STS-B ने कई विस्तारों को प्रेरित किया है, जिसमें STS-B मल्टीलिंगुअल (STS-B-M) शामिल है, जो डेटासेट का कई भाषाओं में अनुवाद करता है, और अरबी STS बेंचमार्क। यह अन्य शब्दार्थ समानता कार्यों से भी संबंधित है, जैसे कि सिमेंटिक टेक्स्टुअल सिमिलैरिटी (STS) साझा कार्य, माइक्रोसॉफ्ट रिसर्च पैराफ्रेज़ कॉर्पस और क्वोरा क्वेश्चन पेयर्स डेटासेट। Generative AI के संदर्भ में, STS-B का उपयोग कभी-कभी उत्पन्न पाठ की स्थिरता का मूल्यांकन करने के लिए किया जाता है, हालांकि MT-Bench और चैटबॉट एरिना जैसे नए बेंचमार्क ने संवादी मॉडलों के लिए प्रमुखता प्राप्त की है।