अंग्रेज़ी से अनुवादित

CoNLL-2003 नामित इकाई पहचान के लिए एक व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है, जिसे 2003 में प्राकृतिक भाषा सीखने के सम्मेलन में पेश किया गया था, जिसमें अंग्रेजी और जर्मन समाचार पाठ शामिल हैं, जिनमें चार इकाई प्रकारों के लिए एनोटेशन हैं।

CoNLL-2003 नामित इकाई पहचान (NER) के लिए एक बेंचमार्क डेटासेट है, जिसे 2003 में सातवें सम्मेलन ऑन नेचुरल लैंग्वेज लर्निंग में पेश किया गया था। इसमें अंग्रेजी और जर्मन समाचार वायर टेक्स्ट शामिल हैं, जिन्हें चार इकाई प्रकारों के साथ मैन्युअल रूप से एनोटेट किया गया है: व्यक्ति, स्थान, संगठन, और विविध नाम। यह डेटासेट NER प्रणालियों के लिए एक मानक मूल्यांकन कॉर्पस बन गया है, जिसका व्यापक रूप से Machine learning और Deep learning अनुसंधान में उपयोग किया जाता है।

अंग्रेजी भाग में रॉयटर्स कॉर्पस के 946 दस्तावेज़ शामिल हैं, जिनमें कुल लगभग 301,000 टोकन हैं, जो प्रशिक्षण, विकास और परीक्षण सेटों में विभाजित हैं। जर्मन भाग, जो ECI मल्टीलिंगुअल टेक्स्ट कॉर्पस से लिया गया है, में 910 दस्तावेज़ों में लगभग 207,000 टोकन शामिल हैं। प्रत्येक टोकन को BIO (शुरुआत, अंदर, बाहर) एन्कोडिंग के साथ लेबल किया गया है, जो दर्शाता है कि यह किसी नामित इकाई की शुरुआत करता है, उसे जारी रखता है, या उसके बाहर आता है।

कार्य परिभाषा और मूल्यांकन

CoNLL-2003 में प्राथमिक कार्य पाठ में नामित इकाइयों की पहचान और वर्गीकरण करना है। प्रणालियों का मूल्यांकन F1 स्कोर का उपयोग करके किया जाता है, जो सटीकता और पुनर्प्राप्ति का हार्मोनिक माध्य है, जिसकी गणना इकाई स्तर पर की जाती है। एक भविष्यवाणी केवल तभी सही होती है जब इकाई की सीमाएँ और इकाई प्रकार दोनों स्वर्ण एनोटेशन से मेल खाते हों। यह सख्त मूल्यांकन मानदंड बेंचमार्क को चुनौतीपूर्ण बनाता है और अनुक्रम लेबलिंग मॉडल में प्रगति को प्रेरित करता है।

प्रारंभिक प्रणालियाँ हस्त-निर्मित विशेषताओं और सांख्यिकीय मॉडलों जैसे कंडीशनल रैंडम फील्ड और सपोर्ट वेक्टर मशीनों पर निर्भर थीं। मूल सम्मेलन में सर्वश्रेष्ठ प्रणाली ने अंग्रेजी परीक्षण सेट पर 88.76% का F1 स्कोर हासिल किया, जिसमें अधिकतम एंट्रॉपी मॉडल और शाब्दिक विशेषताओं का संयोजन उपयोग किया गया था।

तंत्रिका आर्किटेक्चर पर प्रभाव

Neural network मॉडलों के उदय के साथ, CoNLL-2003 द्विदिश लंबी अल्पकालिक स्मृति नेटवर्क जैसे आर्किटेक्चर के लिए एक प्राथमिक परीक्षण मंच बन गया, जिसमें कंडीशनल रैंडम फील्ड आउटपुट परतें शामिल थीं। ये मॉडल, जो लगभग 2015 में पेश किए गए थे, पारंपरिक विशेषता-आधारित दृष्टिकोणों से आगे निकल गए, अंग्रेजी परीक्षण सेट पर 90% से ऊपर F1 स्कोर तक पहुँच गए। डेटासेट ने अनुक्रम लेबलिंग कार्यों में पूर्व-प्रशिक्षित शब्द एम्बेडिंग, जैसे Word2Vec और GloVe, के उपयोग को लोकप्रिय बनाने में भी मदद की।

Transformer (architecture) आर्किटेक्चर और Large language model की शुरुआत ने प्रदर्शन को और बेहतर बनाया। BERT जैसे मॉडल, जो पहली बार 2018 में जारी हुए, ने प्रशिक्षण सेट पर फाइन-ट्यूनिंग करके CoNLL-2003 पर 92% से ऊपर F1 स्कोर हासिल किया। बाद के मॉडल, जिनमें OpenAI और Google DeepMind के मॉडल शामिल हैं, ने स्कोर को और ऊपर धकेलना जारी रखा है, कुछ 2023 तक 94% से अधिक तक पहुँच गए हैं।

जर्मन डेटासेट और क्रॉस-भाषाई अनुसंधान

CoNLL-2003 का जर्मन भाग क्रॉस-भाषाई शिक्षण और बहुभाषी NER में अनुसंधान का समर्थन करता है। इसमें समान चार इकाई प्रकारों के लिए एनोटेशन शामिल हैं, लेकिन विशिष्ट भाषाई चुनौतियों के साथ, जैसे यौगिक संज्ञाएँ और केस-संवेदनशील पूंजीकरण। कई अध्ययन अंग्रेजी डेटा पर प्रशिक्षित मॉडलों की स्थानांतरण क्षमता का मूल्यांकन करने के लिए जर्मन परीक्षण सेट का उपयोग करते हैं, जो कम-संसाधन सेटिंग्स में एक सामान्य परिदृश्य है।

डेटासेट की संरचना ने अन्य भाषाओं में समान बेंचमार्क को भी प्रेरित किया है, लेकिन CoNLL-2003 एक संदर्भ बिंदु बना हुआ है। आधुनिक कॉर्पस की तुलना में इसका अपेक्षाकृत छोटा आकार तेजी से प्रयोग की अनुमति देता है, जिससे यह शैक्षणिक पाठ्यक्रमों और शोध पत्रों में एक प्रमुख तत्व बन गया है।

सीमाएँ और आलोचनाएँ

CoNLL-2003 की आलोचना इसके संकीर्ण डोमेन के लिए की गई है, क्योंकि इसमें केवल 2000 के दशक की शुरुआत का समाचार पाठ शामिल है। यह समकालीन भाषा उपयोग, सोशल मीडिया, या बायोमेडिकल पाठ जैसे विशेष डोमेन की प्रतिनिधित्व क्षमता को सीमित करता है। इकाई प्रकार भी मोटे हैं, जिनमें नेस्टेड इकाइयाँ या तारीखों या मौद्रिक मूल्यों जैसी सूक्ष्म-श्रेणियाँ शामिल नहीं हैं, जो अन्य NER कार्यों में आम हैं।

इन सीमाओं के बावजूद, डेटासेट अपने स्वच्छ एनोटेशन और स्थापित मूल्यांकन प्रोटोकॉल के कारण व्यापक रूप से उपयोग में बना हुआ है। शोधकर्ता अक्सर मॉडल मजबूती प्रदर्शित करने के लिए नए बेंचमार्क, जैसे OntoNotes 5.0, के साथ CoNLL-2003 पर परिणाम रिपोर्ट करते हैं। डेटासेट शैक्षणिक उपयोग के लिए स्वतंत्र रूप से उपलब्ध है, हालांकि पुनर्वितरण के लिए लिंग्विस्टिक डेटा कंसोर्टियम से अनुमति की आवश्यकता होती है।

विरासत और निरंतर उपयोग

2020 के दशक के मध्य तक, CoNLL-2003 सालाना सैकड़ों शोध पत्रों में दिखाई देता रहता है। यह नए मॉडल आर्किटेक्चर के लिए एक सैनिटी चेक और Artificial intelligence प्रणालियों की तुलना के लिए एक आधार रेखा के रूप में कार्य करता है। बेंचमार्क को Hugging Face के डेटासेट जैसी लोकप्रिय लाइब्रेरी में भी एकीकृत किया गया है, जिससे यह चिकित्सकों के लिए आसानी से सुलभ हो गया है।

डेटासेट को पेश करने वाला सम्मेलन, CoNLL, Natural language processing और कम्प्यूटेशनल भाषाविज्ञान पर अनुसंधान के लिए एक वार्षिक स्थल बना हुआ है। डेटासेट की दीर्घायु NER मूल्यांकन को मानकीकृत करने में इसकी भूमिका को दर्शाती है, भले ही क्षेत्र बड़े, अधिक विविध बेंचमार्क की ओर बढ़ गया हो। इसका प्रभाव बाद के साझा कार्यों, जैसे CoNLL-2002 और CoNLL-2012, में स्पष्ट है, जिन्होंने अन्य भाषाओं और कार्यों के लिए समान प्रारूप अपनाए।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:named-entity-recognition·benchmark·natural-language-processing·dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास