अंग्रेज़ी से अनुवादित

STS-B (Semantic Textual Similarity Benchmark) एक व्यापक रूप से उपयोग किया जाने वाला डेटासेट है, जो मॉडलों की वाक्य जोड़ों की शब्दार्थ समानता का आकलन करने की क्षमता का मूल्यांकन करने के लिए उपयोग किया जाता है, जिसमें स्कोर 0-5 होता है। यह प्राकृतिक भाषा प्रसंस्करण और मशीन लर्निंग अनुसंधान में एक मानक बेंचमार्क है।

STS-B (सिमेंटिक टेक्स्टुअल सिमिलैरिटी बेंचमार्क) प्राकृतिक भाषा प्रसंस्करण (NLP) में व्यापक रूप से उपयोग किया जाने वाला एक डेटासेट है, जिसका उपयोग कम्प्यूटेशनल मॉडलों की वाक्य-युग्मों की शब्दार्थ समानता का आकलन करने की क्षमता का मूल्यांकन करने के लिए किया जाता है। इसे 2017 में SemEval-2017 टास्क 1 के भाग के रूप में पेश किया गया था, जो 2012 से 2016 तक के पहले के सिमेंटिक टेक्स्टुअल सिमिलैरिटी (STS) साझा कार्यों पर आधारित था। इस बेंचमार्क में 8,628 अंग्रेजी वाक्य-युग्म शामिल हैं, जिनमें से प्रत्येक को 0 (पूरी तरह से असंबंधित) से 5 (शब्दार्थ रूप से समतुल्य) तक के मानव समानता स्कोर के साथ एनोटेट किया गया है। इन स्कोरों को आमतौर पर कई एनोटेटरों के बीच औसत करके एक स्वर्ण-मानक लेबल तैयार किया जाता है।

यह डेटासेट विभिन्न डोमेन से लिया गया है, जिसमें छवि कैप्शन, समाचार शीर्षक और उपयोगकर्ता-जनित फोरम पोस्ट शामिल हैं, जो इसे शब्दार्थ समझ के लिए एक विविध परीक्षण-क्षेत्र बनाता है। STS-B का उपयोग आमतौर पर वाक्य एम्बेडिंग, सिमेंटिक खोज और पैराफ्रेज़ डिटेक्शन जैसे कार्यों पर मॉडलों को प्रशिक्षित करने और मूल्यांकन करने के लिए किया जाता है। यह Machine learning और Artificial intelligence समुदायों में एक मानक बेंचमार्क बन गया है, जिसे अक्सर Large language model मूल्यांकन के लिए लीडरबोर्ड में शामिल किया जाता है।

कार्य परिभाषा और स्कोरिंग

STS-B कार्य में, एक मॉडल को वाक्यों की एक जोड़ी दी जाती है और उसे 0 से 5 के बीच एक सतत समानता स्कोर आउटपुट करना होता है। प्राथमिक मूल्यांकन मीट्रिक मॉडल के अनुमानित स्कोर और मानव-एनोटेटेड स्वर्ण स्कोर के बीच पियर्सन सहसंबंध है। कुछ मूल्यांकन स्पीयरमैन सहसंबंध की भी रिपोर्ट करते हैं। इस कार्य के लिए मॉडलों को सूक्ष्म शब्दार्थ भेदों को पकड़ने की आवश्यकता होती है, जैसे कि एंटेलमेंट, पैराफ्रेज़ और विरोधाभास के बीच का अंतर।

उदाहरण के लिए, "एक आदमी गिटार बजा रहा है" और "एक आदमी गिटार झंकृत कर रहा है" की जोड़ी को उच्च स्कोर (5 के करीब) मिलेगा, जबकि "एक आदमी गिटार बजा रहा है" और "एक कुत्ता भौंक रहा है" को कम स्कोर (0 के करीब) मिलेगा। बेंचमार्क की कठिनाई वाक्य-विन्यास विविधताओं, शाब्दिक अतिव्यापन और विश्व ज्ञान को संभालने में निहित है।

ऐतिहासिक संदर्भ

STS-B बेंचमार्क SemEval-2012 में STS पायलट कार्य से विकसित हुआ, जिसमें माइक्रोसॉफ्ट रिसर्च पैराफ्रेज़ कॉर्पस और अन्य स्रोतों के डेटा का उपयोग किया गया था। 2017 संस्करण, जिसे डैनियल सेर, मोना डियाब और अन्य शोधकर्ताओं द्वारा आयोजित किया गया था, ने पिछले वर्षों के डेटा को निश्चित प्रशिक्षण, सत्यापन और परीक्षण विभाजन के साथ एक एकल, पुन: प्रयोज्य बेंचमार्क में समेकित किया। परीक्षण सेट के लेबल शुरू में छिपाए गए थे और ओवरफिटिंग को रोकने के लिए बाद में जारी किए गए, जो साझा कार्यों में एक सामान्य प्रथा है।

अपनी रिलीज़ के बाद से, STS-B का उपयोग कई अध्ययनों में किया गया है। इसे विशेष रूप से 2018 में पेश किए गए GLUE बेंचमार्क (जनरल लैंग्वेज अंडरस्टैंडिंग इवैल्यूएशन) में शामिल किया गया था, जिसने सामान्य-उद्देश्यीय भाषा मॉडलों का मूल्यांकन करने के लिए नौ NLP कार्यों को एकत्रित किया था। STS-B GLUE और इसके उत्तराधिकारी SuperGLUE का एक घटक बना हुआ है, हालांकि SuperGLUE ने इसे अधिक चुनौतीपूर्ण कार्य के साथ बदल दिया।

मॉडल विकास में उपयोग

STS-B का उपयोग अक्सर वाक्य एम्बेडिंग मॉडलों को प्रशिक्षित करने के लिए किया जाता है, जैसे कि Transformer (architecture) आर्किटेक्चर पर आधारित मॉडल। Sentence-BERT (SBERT) और बाद के वेरिएंट जैसे मॉडल सियामी या ट्रिपलेट नेटवर्क के माध्यम से STS-B को एक प्रशिक्षण लक्ष्य के रूप में उपयोग करते हैं, जो एम्बेडिंग के बीच कोसाइन समानता को अनुकूलित करते हैं। बेंचमार्क का उपयोग Neural network मॉडलों के मूल्यांकन के लिए भी किया जाता है, जिसमें Deep learning सिस्टम और OpenAI, Anthropic और Google DeepMind द्वारा विकसित Large language model शामिल हैं।

बड़े पूर्व-प्रशिक्षित मॉडलों के युग में, STS-B का उपयोग अक्सर एक जांच कार्य के रूप में किया जाता है, यह आकलन करने के लिए कि क्या किसी मॉडल ने मजबूत शब्दार्थ प्रतिनिधित्व सीखा है। इसका उपयोग क्रॉस-भाषाई और बहुभाषी सेटिंग्स में भी किया जाता है, जहां मॉडलों का मूल्यांकन डेटासेट के अनुवादित संस्करणों पर किया जाता है।

सीमाएं और आलोचनाएं

अपनी लोकप्रियता के बावजूद, STS-B की ज्ञात सीमाएं हैं। डेटासेट अपेक्षाकृत छोटा है, और इसका एनोटेशन पैमाना (0-5) व्यक्तिपरक हो सकता है, जिससे अंतर-एनोटेटर परिवर्तनशीलता उत्पन्न होती है। यदि मॉडलों को डेटासेट के सार्वजनिक संस्करणों पर प्रशिक्षित किया जाता है, तो परीक्षण सेट डेटा लीकेज के लिए भी संवेदनशील है। इसके अतिरिक्त, बेंचमार्क अंग्रेजी पर केंद्रित है, जो अन्य भाषाओं में इसकी प्रयोज्यता को सीमित करता है। कुछ शोधकर्ताओं ने तर्क दिया है कि STS-B पर उच्च प्रदर्शन आवश्यक रूप से प्रश्न उत्तरण या सारांशीकरण जैसे डाउनस्ट्रीम कार्यों पर बेहतर प्रदर्शन में तब्दील नहीं होता है।

संबंधित बेंचमार्क और विस्तार

STS-B ने कई विस्तारों को प्रेरित किया है, जिसमें STS-B मल्टीलिंगुअल (STS-B-M) शामिल है, जो डेटासेट का कई भाषाओं में अनुवाद करता है, और अरबी STS बेंचमार्क। यह अन्य शब्दार्थ समानता कार्यों से भी संबंधित है, जैसे कि सिमेंटिक टेक्स्टुअल सिमिलैरिटी (STS) साझा कार्य, माइक्रोसॉफ्ट रिसर्च पैराफ्रेज़ कॉर्पस और क्वोरा क्वेश्चन पेयर्स डेटासेट। Generative AI के संदर्भ में, STS-B का उपयोग कभी-कभी उत्पन्न पाठ की स्थिरता का मूल्यांकन करने के लिए किया जाता है, हालांकि MT-Bench और चैटबॉट एरिना जैसे नए बेंचमार्क ने संवादी मॉडलों के लिए प्रमुखता प्राप्त की है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·benchmark·dataset·semantic-similarity
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास