अंग्रेज़ी से अनुवादित

ACE 2005 सूचना निष्कर्षण अनुसंधान के लिए व्यापक रूप से उपयोग किया जाने वाला कोष है, जिसमें इकाई, संबंध और घटना निष्कर्षण कार्यों के लिए एनोटेटेड अंग्रेजी, चीनी और अरबी दस्तावेज़ शामिल हैं।

ACE 2005, जिसे औपचारिक रूप से ऑटोमैटिक कंटेंट एक्सट्रैक्शन 2005 मूल्यांकन डेटासेट के रूप में जाना जाता है, एक बहुभाषी कॉर्पस है जिसे सूचना निष्कर्षण में अनुसंधान के लिए अमेरिकी राष्ट्रीय मानक और प्रौद्योगिकी संस्थान (NIST) द्वारा विकसित किया गया है। इसे 2005 में ACE कार्यक्रम के हिस्से के रूप में जारी किया गया था, जिसका उद्देश्य प्राकृतिक भाषा पाठ में संस्थाओं, संबंधों और घटनाओं का पता लगाने और उनकी विशेषता बताने के लिए प्रौद्योगिकियों को आगे बढ़ाना था। यह डेटासेट प्राकृतिक भाषा प्रसंस्करण (NLP) में एक मानक बेंचमार्क बन गया है, विशेष रूप से नामित इकाई पहचान, संबंध निष्कर्षण और घटना निष्कर्षण जैसे कार्यों के लिए।

कॉर्पस में तीन भाषाओं - अंग्रेजी, चीनी और अरबी - में एनोटेटेड दस्तावेज़ शामिल हैं। अंग्रेजी भाग में विभिन्न स्रोतों से लगभग 600 दस्तावेज़ शामिल हैं, जिनमें समाचार वायर, प्रसारण समाचार, प्रसारण वार्तालाप और वेबलॉग शामिल हैं। चीनी और अरबी भाग छोटे हैं लेकिन समान रूप से विविध हैं। एनोटेशन सात इकाई प्रकारों (जैसे, व्यक्ति, संगठन, स्थान), छह संबंध प्रकारों (जैसे, भौतिक, भाग-संपूर्ण, व्यक्तिगत/सामाजिक) और आठ घटना प्रकारों (जैसे, संघर्ष, जीवन, आंदोलन) को कवर करते हैं। प्रत्येक इकाई उल्लेख एक विहित इकाई से जुड़ा होता है, और संस्थाओं के बीच संबंधों की पहचान की जाती है। घटना एनोटेशन में ट्रिगर, तर्क और घटना उल्लेख शामिल हैं।

ACE 2005 अक्सर ACE 2004 और ACE 2002 डेटासेट के साथ संयोजन में उपयोग किया जाता है, लेकिन यह सबसे हालिया और सबसे व्यापक रूप से अपनाया गया है। यह कई अत्याधुनिक प्रणालियों के विकास में सहायक रहा है, जिनमें गहन शिक्षण और बड़े भाषा मॉडल पर आधारित प्रणालियाँ शामिल हैं। डेटासेट को भाषाई डेटा कंसोर्टियम (LDC) द्वारा कैटलॉग संख्या LDC2006T06 के तहत वितरित किया जाता है।

एनोटेशन योजना

ACE 2005 में एनोटेशन योजना पदानुक्रमित है। संस्थाओं को मोटे प्रकारों और उपप्रकारों में वर्गीकृत किया गया है। उदाहरण के लिए, एक व्यक्ति इकाई के उपप्रकार जैसे व्यक्तिगत, समूह या अनिश्चित हो सकते हैं। संबंधों को प्रकारों और उपप्रकारों में वर्गीकृत किया जाता है, जिनमें तर्क इकाई उल्लेख होते हैं। घटनाएँ अधिक जटिल हैं: प्रत्येक घटना उल्लेख में एक ट्रिगर (एक शब्द या वाक्यांश जो घटना को उद्घाटित करता है), तर्क (प्रतिभागी और विशेषताएँ) और एक मोडैलिटी (जैसे, पुष्ट, निषेध) होती है। डेटासेट में क्रॉस-दस्तावेज़ कोरफेरेंस भी शामिल है, जो विभिन्न दस्तावेज़ों में एक ही इकाई के उल्लेखों को जोड़ता है।

अनुसंधान में उपयोग

ACE 2005 सूचना निष्कर्षण अनुसंधान के लिए एक प्राथमिक बेंचमार्क रहा है। कई प्रारंभिक प्रणालियों ने फीचर-आधारित दृष्टिकोणों का उपयोग किया, जैसे सपोर्ट वेक्टर मशीन और अधिकतम एंट्रॉपी मॉडल। गहन शिक्षण के आगमन के साथ, द्विदिशात्मक LSTM और कन्वोल्यूशनल नेटवर्क जैसी तंत्रिका वास्तुकलाएँ लागू की गईं। हाल ही में, ट्रांसफॉर्मर-आधारित मॉडल, जैसे BERT और इसके वेरिएंट, ने ACE 2005 पर अत्याधुनिक परिणाम प्राप्त किए हैं। डेटासेट का उपयोग संयुक्त इकाई और संबंध निष्कर्षण, घटना निष्कर्षण और क्रॉस-भाषाई स्थानांतरण शिक्षण के लिए भी किया जाता है।

सीमाएँ और आलोचनाएँ

अपनी लोकप्रियता के बावजूद, ACE 2005 की सीमाएँ हैं। एनोटेशन दिशानिर्देश जटिल हैं, और डेटासेट अपेक्षाकृत छोटा है, जो ओवरफिटिंग का कारण बन सकता है। दस्तावेज़ एक सीमित समय अवधि (2003-2004) से हैं, और डोमेन अधिकतर समाचार वायर और प्रसारण है, जो अन्य शैलियों के लिए सामान्यीकृत नहीं हो सकता है। इसके अतिरिक्त, एनोटेशन गुणवत्ता भाषाओं के बीच भिन्न होती है, और कुछ घटना प्रकार दुर्लभ हैं। शोधकर्ताओं ने विस्तार और विकल्प प्रस्तावित किए हैं, जैसे TAC-KBP डेटासेट और अधिक हालिया ERE (इकाई, संबंध, घटना) डेटासेट।

संबंधित डेटासेट और विरासत

ACE 2005 ACE डेटासेट के व्यापक परिवार का हिस्सा है, जिसमें ACE 2002 और ACE 2004 शामिल हैं। इसने रिच ERE डेटासेट और इवेंट आर्ग्युमेंट एक्सट्रैक्शन डेटासेट जैसे बाद के कॉर्पोरा के डिज़ाइन को प्रभावित किया है। डेटासेट NLP समुदाय में एक मानक बना हुआ है, और इसके मूल्यांकन मेट्रिक्स (जैसे, इकाई उल्लेख F1, संबंध F1, घटना ट्रिगर और तर्क F1) व्यापक रूप से उपयोग किए जाते हैं। कई ओपन-सोर्स टूलकिट, जैसे स्टैनफोर्ड CoreNLP और spaCy, इकाई और संबंध निष्कर्षण के लिए ACE 2005 पर प्रशिक्षित मॉडल प्रदान करते हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:datasets·natural-language-processing·information-extraction·evaluation-corpora
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास