WNUT-2017 प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक प्रसिद्ध बेंचमार्क है, जिसे विशेष रूप से एक प्रणाली की उभरती और पहले से अनदेखी नामित संस्थाओं को पहचानने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है। यह डेटासेट, जो नॉइज़ी यूज़र-जनरेटेड टेक्स्ट पर कार्यशाला के लिए जारी किया गया था, ट्वीट्स जैसी अनौपचारिक, उपयोगकर्ता-जनित सामग्री से लोगों, संगठनों, स्थानों और उत्पादों जैसी संस्थाओं को निकालने पर केंद्रित है। पारंपरिक नामित इकाई पहचान (NER) डेटासेट के विपरीत, जो एक निश्चित ऑन्टोलॉजी मानते हैं, WNUT-2017 जानबूझकर नई और विकसित होती इकाई उल्लेखों को शामिल करता है जो मानक प्रशिक्षण कोरपोरा में अनुपस्थित हैं, जिससे यह मॉडल सामान्यीकरण के लिए एक चुनौतीपूर्ण परीक्षण बन जाता है।
यह बेंचमार्क 2017 की कार्यशाला में पेश किया गया था, जो एक प्रमुख कम्प्यूटेशनल भाषाविज्ञान सम्मेलन के साथ सह-स्थित था। इस कार्य ने शिक्षा और उद्योग दोनों से प्रतिभागियों को आकर्षित किया, जिससे एक साझा कार्य पेपर तैयार हुआ जिसमें विभिन्न दृष्टिकोणों का विवरण दिया गया। इसका प्राथमिक योगदान एक लेबल किया गया डेटासेट है जिसमें छोटे पाठ अंश शामिल हैं, मुख्य रूप से सोशल मीडिया से, जहां एनोटेटर्स ने उन संस्थाओं को चिह्नित किया जो मौजूदा NER संसाधनों में मौजूद नहीं थीं। यह डिज़ाइन मॉडल को याद किए गए शाब्दिक सूचियों के बजाय प्रासंगिक संकेतों और सतह पैटर्न पर निर्भर रहने के लिए मजबूर करता है।
कार्य परिभाषा और एनोटेशन
WNUT-2017 कार्य को अनुक्रम लेबलिंग समस्या के रूप में परिभाषित किया गया है। दिए गए पाठ अंश में प्रत्येक टोकन को या तो एक इकाई के हिस्से के रूप में (B-I-O टैगिंग के साथ) या किसी भी इकाई के बाहर के रूप में वर्गीकृत किया जाना चाहिए। इकाई प्रकार एक छोटे से सेट तक सीमित हैं: व्यक्ति, स्थान, संगठन और उत्पाद, हालांकि डेटासेट में "अन्य" संस्थाओं के लिए एक विशेष वर्ग भी शामिल है। एनोटेशन क्राउड-सोर्स किए गए थे, और प्रक्रिया में उन संस्थाओं की खोज पर जोर दिया गया जो मानक प्रशिक्षण डेटा में पहले से मौजूद नहीं थीं। प्रशिक्षण के लिए 2,000 से अधिक एनोटेटेड खंड जारी किए गए थे, साथ ही अलग विकास और मूल्यांकन सेट भी। अंतिम परीक्षण सेट में वित्तीय रूप से चुनौतीपूर्ण, नई उभरती इकाई नाम शामिल थे, विशेष रूप से वे जो वास्तविक समय के सोशल मीडिया फ़ीड में दिखाई देते हैं।
बेंचमार्क विशेषताएँ
WNUT-2017 की एक प्रमुख विशिष्ट विशेषता इसका नवीनता पर ध्यान केंद्रित करना है। जबकि विशिष्ट NER बेंचमार्क, जैसे कि Stanford AI Lab या MIT CSAIL शैली के कोरपोरा पर आधारित, मानते हैं कि इकाई प्रकार स्थिर रहते हैं, WNUT-2017 सक्रिय रूप से उन मामलों की तलाश करता है जहां एक इकाई का विकिपीडिया जैसे बड़े ज्ञान आधार में कोई उल्लेख नहीं है। यह कार्य को वास्तविक दुनिया के परिदृश्य के समान बनाता है जहां नए ब्रांड, सेलिब्रिटी या उत्पाद अक्सर दिखाई देते हैं, जो गतिशील अनुकूलन की आवश्यकता की पुष्टि करता है। डेटासेट का आकार आधुनिक बड़े भाषा मॉडल प्रशिक्षण सेट की तुलना में अपेक्षाकृत छोटा है, फिर भी इसकी कम टोकन संख्या इकाई सतह रूपों में उच्च भिन्नता को संभालने के लिए मजबूर करती है, जिसमें वर्तनी विविधताएं और संक्षिप्ताक्षर शामिल हैं।
बेंचमार्क प्रभाव
अपनी रिलीज़ के बाद से, WNUT-2017 अनुक्रम लेबलिंग और मजबूती अनुसंधान के लिए एक मानक परीक्षण मंच बन गया है। कई उल्लेखनीय योगदानों ने तंत्रिका नेटवर्क पर आधारित मॉडलों का मूल्यांकन करने के लिए इसका उपयोग किया है, विशेष रूप से एक सशर्त यादृच्छिक क्षेत्र उपकरण के साथ Transformer (architecture) एनकोडर वाले। डेटासेट को सैकड़ों पेपरों में उद्धृत किया गया है, जो उन कुछ साझा कार्यों में से एक के रूप में कार्य करता है जो विशेष रूप से सोशल मीडिया और अनौपचारिक पाठ को लक्षित करते हैं। इसका प्रभाव 2017 के व्यापक क्षेत्र में उल्लेखनीय है, जब Generative AI लहर अभी तक हावी नहीं हुई थी, और सर्वश्रेष्ठ प्रणालियों ने F1 स्कोर मध्य-40 से निम्न-50 के बीच हासिल किए।
संबंधित कार्य और विकास
WNUT-2017 एक पहले के संबंधित प्रयास, WNUT-2016 का अनुसरण करता है, जिसने समान उभरती इकाई पहचान के लिए एक मिसाल कायम की। इसे बाद के बेंचमार्क द्वारा पूरक किया गया है और अधिक अनुकूली दृष्टिकोणों के डिज़ाइन को प्रभावित किया है। सामान्य आर्किटेक्चर के उदय के साथ, डेटासेट अभी भी मॉडल सामान्यीकरण की जांच के लिए उपयोग किया जाता है। इसके टोकन एक संकीर्ण सोशल मीडिया डोमेन से लिए गए हैं, और वैश्विक-क्षेत्र से पूर्व-प्रशिक्षित मॉडल या स्वतंत्र रूप से प्रशिक्षित एम्बेडिंग विफल हो सकते हैं यदि सावधानीपूर्वक फाइन-ट्यून न किए जाएं। इसके अलावा, डेटासेट सीखने की क्षमताओं को मापने के लिए एक मीट्रिक बना हुआ है जो व्यापक बाहरी ज्ञान पर निर्भर नहीं करता है और इसके बजाय स्थानीय संदर्भ के साथ निष्कर्षण का समर्थन करता है।
वर्तमान प्रासंगिकता
हाल के वर्षों में, WNUT-2017 अभी भी उन मूल्यांकनों में सक्रिय रूप से संदर्भित किया जाता है जो Large language model ट्यूनिंग के लिए कुछ-शॉट कॉम्पैक्ट कार्यों पर केंद्रित हैं। कई हालिया अध्ययन इसके मूल्यांकन भाग का उपयोग यह मापने के लिए करते हैं कि जनरेटिव सिस्टम कितनी अच्छी तरह प्रदर्शन कर सकते हैं जब वे चैट इंटरफ़ेस के बिना इकाई स्पैन की पहचान करने तक सीमित होते हैं। यह एक स्थिर लेबल हार्ड-लेक्सिकॉन-चिह्नित पूरक के रूप में कार्य करता है। शोधकर्ता बेहतर मेमोरी वाले गहन शिक्षण ढांचे वाले मॉडलों में अपडेट का परीक्षण करने के लिए भी इस डेटासेट का उपयोग करते हैं।
अपनी उम्र के बावजूद, डेटासेट का समुदाय पर स्थायी प्रभाव पड़ा है कि विकसित होती संस्थाओं को कैसे प्रस्तुत किया जाता है। इसका कम लागत वाला कार्यान्वयन और स्थापित नियम Machine learning में नए लोगों को आकर्षित करना जारी रखते हैं। भविष्य के बेंचमार्क अक्सर प्रशिक्षण घंटों के दौरान मौजूद नहीं थे नामों जैसी संस्थाओं पर ध्यान केंद्रित करने के इसके दृष्टिकोण का पालन करते हैं, जो सेटिंग में इसकी मौलिक भूमिका की पुष्टि करता है। यह उसी युग के कई कृत्रिम बेंचमार्क के विपरीत है, और आधुनिक सोशल मीडिया अनुसंधान में शामिल प्लेटफार्मों पर नए उल्लेखों की मांग दर बनी रहती है।