अंग्रेज़ी से अनुवादित

TACRED रिलेशन एक्सट्रैक्शन के लिए एक बड़े पैमाने का डेटासेट है, जिसमें समाचार और वेब टेक्स्ट से 106,000 से अधिक वाक्य शामिल हैं, जिनमें 41 रिलेशन प्रकार होते हैं, और इसका उपयोग संस्थाओं के बीच संबंधों को निकालने के लिए मशीन लर्निंग मॉडल को प्रशिक्षित और मूल्यांकन करने में किया जाता है।

TACRED (TAC Relation Extraction Dataset) प्राकृतिक भाषा प्रसंस्करण में संबंध निष्कर्षण के कार्य के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है। इसे 2017 में स्टैनफोर्ड विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा प्रस्तुत किया गया था। डेटासेट इकाई जोड़े और उनके संबंधित शब्दार्थ संबंधों के साथ एनोटेट किए गए वाक्यों का एक बड़ा संग्रह प्रदान करता है, जो संबंध निष्कर्षण मॉडल विकसित करने और मूल्यांकन करने के लिए एक मानक परीक्षण मंच के रूप में कार्य करता है, विशेष रूप से मशीन-लर्निंग और डीप-लर्निंग तकनीकों पर आधारित मॉडल।

डेटासेट का निर्माण TAC KBP (नॉलेज बेस पॉपुलेशन) मूल्यांकनों से किया गया था, विशेष रूप से 2009 से 2012 की वार्षिक प्रतियोगिताओं से। इसमें 106,264 वाक्य शामिल हैं, जिनमें से प्रत्येक एक क्वेरी इकाई जोड़े (विषय और वस्तु) और एक संबंध लेबल के साथ जुड़ा हुआ है। संबंध 41 प्रकारों के पूर्वनिर्धारित सेट से लिए गए हैं, जिनमें 18 सामान्य संबंध (जैसे, per:spouse, org:founded_by) और TAC KBP कार्य के लिए विशिष्ट 23 संबंध (जैसे, per:title, org:top_members/employees) शामिल हैं। इसके अतिरिक्त, एक विशेष 'no_relation' लेबल उन इकाई जोड़ों के लिए उपयोग किया जाता है जो किसी भी परिभाषित संबंध को व्यक्त नहीं करते हैं, जो अधिकांश उदाहरणों का गठन करता है।

TACRED अपने आकार और जटिलता के लिए उल्लेखनीय है। प्रत्येक वाक्य समाचार लेखों या वेब टेक्स्ट से एक वास्तविक-विश्व पाठ अंश है, जो भाषाई परिवर्तनशीलता, लंबी-दूरी की निर्भरता और विश्व ज्ञान की आवश्यकता के कारण कार्य को चुनौतीपूर्ण बनाता है। डेटासेट को प्रशिक्षण (68,124 वाक्य), विकास (22,631 वाक्य), और परीक्षण (15,509 वाक्य) सेटों में विभाजित किया गया है, जिसमें यथार्थवादी मूल्यांकन सुनिश्चित करने के लिए विभाजनों में दस्तावेज़ों के ओवरलैप से बचने पर सावधानीपूर्वक ध्यान दिया गया है।

TACRED के लिए प्राथमिक मूल्यांकन मीट्रिक माइक्रो-औसत F1 स्कोर है, जो सभी संबंध प्रकारों में सटीकता और पुनर्प्राप्ति को संतुलित करता है। प्रारंभिक बेसलाइन मॉडल, जैसे कि हस्त-निर्मित विशेषताओं के साथ लॉजिस्टिक रिग्रेशन, ने लगभग 50-60% के F1 स्कोर प्राप्त किए। न्यूरल-नेटवर्क मॉडल की शुरुआत, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करने वाले, ने महत्वपूर्ण सुधार लाए। उदाहरण के लिए, झांग एट अल. (2019) द्वारा BERT-आधारित मॉडल ने 71.5% का F1 स्कोर हासिल किया, और अधिक परिष्कृत ध्यान तंत्र और बाहरी ज्ञान वाले बाद के मॉडल ने स्कोर को 80% से ऊपर धकेल दिया है।

निर्माण और एनोटेशन

डेटासेट TAC KBP स्रोत कॉर्पस से वाक्यों को स्वचालित रूप से निकालकर बनाया गया था, जिसमें न्यूज़वायर और वेब टेक्स्ट शामिल हैं। प्रत्येक दस्तावेज़ के लिए, इकाई उल्लेखों की पहचान एक नामित इकाई पहचानकर्ता का उपयोग करके की गई थी, और इकाई जोड़े को उम्मीदवार संबंध उदाहरणों के रूप में चुना गया था। मानव एनोटेटरों ने तब विस्तृत एनोटेशन दिशानिर्देशों का पालन करते हुए प्रत्येक वाक्य को उचित संबंध के साथ लेबल किया। एनोटेशन प्रक्रिया में गुणवत्ता नियंत्रण के कई दौर शामिल थे, जिसमें असहमति का निर्णयन भी शामिल था, ताकि उच्च अंतर-एनोटेटर सहमति सुनिश्चित हो सके। अंतिम डेटासेट में न केवल वाक्य और संबंध लेबल शामिल है, बल्कि वाक्य के भीतर विषय और वस्तु इकाइयों की स्थिति भी शामिल है, जो मॉडल प्रशिक्षण के लिए महत्वपूर्ण हैं।

अनुसंधान में प्रभाव और उपयोग

TACRED संबंध निष्कर्षण समुदाय में एक मानक बेंचमार्क बन गया है। इसका उपयोग पारंपरिक फीचर-आधारित क्लासिफायर से लेकर आधुनिक लार्ज-लैंग्वेज-मॉडल आधारित दृष्टिकोणों तक मॉडलों की एक विस्तृत श्रृंखला का मूल्यांकन करने के लिए किया गया है। डेटासेट ने कई व्युत्पन्न कार्यों को भी जन्म दिया है, जैसे कि फ्यू-शॉट संबंध निष्कर्षण और दस्तावेज़-स्तरीय संबंध निष्कर्षण, जहां शोधकर्ता सामान्यीकरण क्षमताओं का परीक्षण करने के लिए TACRED को अनुकूलित करते हैं। इसके अलावा, TACRED ने सामान्य ज्ञान या तथ्यात्मक तर्क की आवश्यकता वाले संबंधों पर प्रदर्शन में सुधार करने के लिए Wikidata जैसे बाहरी ज्ञान आधारों को न्यूरल मॉडल में शामिल करने पर अनुसंधान को आगे बढ़ाने में सहायक रहा है।

सीमाएं और आलोचनाएं

अपनी लोकप्रियता के बावजूद, TACRED की ज्ञात सीमाएं हैं। डेटासेट अन्य NLP बेंचमार्क की तुलना में अपेक्षाकृत छोटा है, और इसके संबंध प्रकार TAC KBP द्वारा परिभाषित तक सीमित हैं, जो खुले-डोमेन पाठ में संबंधों की पूर्ण विविधता को कवर नहीं कर सकते हैं। इसके अतिरिक्त, डेटासेट में एनोटेशन त्रुटियां होने और इसकी मूल्यांकन प्रोटोकॉल के लिए आलोचना की गई है, जो वास्तविक-विश्व प्रदर्शन को पूरी तरह से प्रतिबिंबित नहीं कर सकता है। कुछ अध्ययनों से पता चला है कि मॉडल डेटासेट-विशिष्ट पूर्वाग्रहों का शोषण करके उच्च स्कोर प्राप्त कर सकते हैं, जैसे कि वास्तविक संबंध शब्दार्थ सीखने के बजाय इकाई प्रकार की जानकारी पर निर्भर रहना। इन मुद्दों ने TACREV (TACRED का पुनः-एनोटेटेड संस्करण) और Re-TACRED जैसे नए डेटासेट के निर्माण को प्रेरित किया है, जिनका उद्देश्य इनमें से कुछ कमियों को दूर करना है।

संबंधित कार्य और विस्तार

TACRED संबंध निष्कर्षण डेटासेट के एक व्यापक परिवार का हिस्सा है। यह SemEval-2010 टास्क 8 डेटासेट से निकटता से संबंधित है, जो 19 संबंध प्रकारों के छोटे सेट पर केंद्रित है, और NYT-FB डेटासेट, जो दूरस्थ पर्यवेक्षण का उपयोग करता है। FewRel और TACREV जैसे हालिया डेटासेट फ्यू-शॉट लर्निंग का पता लगाने और स्वच्छ एनोटेशन प्रदान करने के लिए TACRED की संरचना पर निर्माण करते हैं। जनरेटिव-एआई के युग में, TACRED का उपयोग ओपनएआई के GPT श्रृंखला जैसे मॉडलों की शून्य-शॉट या फ्यू-शॉट तरीके से संबंध निष्कर्षण करने की क्षमता का मूल्यांकन करने के लिए भी किया गया है, जो अक्सर फाइन-ट्यून किए गए छोटे मॉडलों की तुलना में प्रतिस्पर्धी परिणाम देते हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:relation-extraction·dataset·natural-language-processing·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास