TACRED (TAC Relation Extraction Dataset) प्राकृतिक भाषा प्रसंस्करण में संबंध निष्कर्षण के कार्य के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है। इसे 2017 में स्टैनफोर्ड विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा प्रस्तुत किया गया था। डेटासेट इकाई जोड़े और उनके संबंधित शब्दार्थ संबंधों के साथ एनोटेट किए गए वाक्यों का एक बड़ा संग्रह प्रदान करता है, जो संबंध निष्कर्षण मॉडल विकसित करने और मूल्यांकन करने के लिए एक मानक परीक्षण मंच के रूप में कार्य करता है, विशेष रूप से मशीन-लर्निंग और डीप-लर्निंग तकनीकों पर आधारित मॉडल।
डेटासेट का निर्माण TAC KBP (नॉलेज बेस पॉपुलेशन) मूल्यांकनों से किया गया था, विशेष रूप से 2009 से 2012 की वार्षिक प्रतियोगिताओं से। इसमें 106,264 वाक्य शामिल हैं, जिनमें से प्रत्येक एक क्वेरी इकाई जोड़े (विषय और वस्तु) और एक संबंध लेबल के साथ जुड़ा हुआ है। संबंध 41 प्रकारों के पूर्वनिर्धारित सेट से लिए गए हैं, जिनमें 18 सामान्य संबंध (जैसे, per:spouse, org:founded_by) और TAC KBP कार्य के लिए विशिष्ट 23 संबंध (जैसे, per:title, org:top_members/employees) शामिल हैं। इसके अतिरिक्त, एक विशेष 'no_relation' लेबल उन इकाई जोड़ों के लिए उपयोग किया जाता है जो किसी भी परिभाषित संबंध को व्यक्त नहीं करते हैं, जो अधिकांश उदाहरणों का गठन करता है।
TACRED अपने आकार और जटिलता के लिए उल्लेखनीय है। प्रत्येक वाक्य समाचार लेखों या वेब टेक्स्ट से एक वास्तविक-विश्व पाठ अंश है, जो भाषाई परिवर्तनशीलता, लंबी-दूरी की निर्भरता और विश्व ज्ञान की आवश्यकता के कारण कार्य को चुनौतीपूर्ण बनाता है। डेटासेट को प्रशिक्षण (68,124 वाक्य), विकास (22,631 वाक्य), और परीक्षण (15,509 वाक्य) सेटों में विभाजित किया गया है, जिसमें यथार्थवादी मूल्यांकन सुनिश्चित करने के लिए विभाजनों में दस्तावेज़ों के ओवरलैप से बचने पर सावधानीपूर्वक ध्यान दिया गया है।
TACRED के लिए प्राथमिक मूल्यांकन मीट्रिक माइक्रो-औसत F1 स्कोर है, जो सभी संबंध प्रकारों में सटीकता और पुनर्प्राप्ति को संतुलित करता है। प्रारंभिक बेसलाइन मॉडल, जैसे कि हस्त-निर्मित विशेषताओं के साथ लॉजिस्टिक रिग्रेशन, ने लगभग 50-60% के F1 स्कोर प्राप्त किए। न्यूरल-नेटवर्क मॉडल की शुरुआत, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करने वाले, ने महत्वपूर्ण सुधार लाए। उदाहरण के लिए, झांग एट अल. (2019) द्वारा BERT-आधारित मॉडल ने 71.5% का F1 स्कोर हासिल किया, और अधिक परिष्कृत ध्यान तंत्र और बाहरी ज्ञान वाले बाद के मॉडल ने स्कोर को 80% से ऊपर धकेल दिया है।
निर्माण और एनोटेशन
डेटासेट TAC KBP स्रोत कॉर्पस से वाक्यों को स्वचालित रूप से निकालकर बनाया गया था, जिसमें न्यूज़वायर और वेब टेक्स्ट शामिल हैं। प्रत्येक दस्तावेज़ के लिए, इकाई उल्लेखों की पहचान एक नामित इकाई पहचानकर्ता का उपयोग करके की गई थी, और इकाई जोड़े को उम्मीदवार संबंध उदाहरणों के रूप में चुना गया था। मानव एनोटेटरों ने तब विस्तृत एनोटेशन दिशानिर्देशों का पालन करते हुए प्रत्येक वाक्य को उचित संबंध के साथ लेबल किया। एनोटेशन प्रक्रिया में गुणवत्ता नियंत्रण के कई दौर शामिल थे, जिसमें असहमति का निर्णयन भी शामिल था, ताकि उच्च अंतर-एनोटेटर सहमति सुनिश्चित हो सके। अंतिम डेटासेट में न केवल वाक्य और संबंध लेबल शामिल है, बल्कि वाक्य के भीतर विषय और वस्तु इकाइयों की स्थिति भी शामिल है, जो मॉडल प्रशिक्षण के लिए महत्वपूर्ण हैं।
अनुसंधान में प्रभाव और उपयोग
TACRED संबंध निष्कर्षण समुदाय में एक मानक बेंचमार्क बन गया है। इसका उपयोग पारंपरिक फीचर-आधारित क्लासिफायर से लेकर आधुनिक लार्ज-लैंग्वेज-मॉडल आधारित दृष्टिकोणों तक मॉडलों की एक विस्तृत श्रृंखला का मूल्यांकन करने के लिए किया गया है। डेटासेट ने कई व्युत्पन्न कार्यों को भी जन्म दिया है, जैसे कि फ्यू-शॉट संबंध निष्कर्षण और दस्तावेज़-स्तरीय संबंध निष्कर्षण, जहां शोधकर्ता सामान्यीकरण क्षमताओं का परीक्षण करने के लिए TACRED को अनुकूलित करते हैं। इसके अलावा, TACRED ने सामान्य ज्ञान या तथ्यात्मक तर्क की आवश्यकता वाले संबंधों पर प्रदर्शन में सुधार करने के लिए Wikidata जैसे बाहरी ज्ञान आधारों को न्यूरल मॉडल में शामिल करने पर अनुसंधान को आगे बढ़ाने में सहायक रहा है।
सीमाएं और आलोचनाएं
अपनी लोकप्रियता के बावजूद, TACRED की ज्ञात सीमाएं हैं। डेटासेट अन्य NLP बेंचमार्क की तुलना में अपेक्षाकृत छोटा है, और इसके संबंध प्रकार TAC KBP द्वारा परिभाषित तक सीमित हैं, जो खुले-डोमेन पाठ में संबंधों की पूर्ण विविधता को कवर नहीं कर सकते हैं। इसके अतिरिक्त, डेटासेट में एनोटेशन त्रुटियां होने और इसकी मूल्यांकन प्रोटोकॉल के लिए आलोचना की गई है, जो वास्तविक-विश्व प्रदर्शन को पूरी तरह से प्रतिबिंबित नहीं कर सकता है। कुछ अध्ययनों से पता चला है कि मॉडल डेटासेट-विशिष्ट पूर्वाग्रहों का शोषण करके उच्च स्कोर प्राप्त कर सकते हैं, जैसे कि वास्तविक संबंध शब्दार्थ सीखने के बजाय इकाई प्रकार की जानकारी पर निर्भर रहना। इन मुद्दों ने TACREV (TACRED का पुनः-एनोटेटेड संस्करण) और Re-TACRED जैसे नए डेटासेट के निर्माण को प्रेरित किया है, जिनका उद्देश्य इनमें से कुछ कमियों को दूर करना है।
संबंधित कार्य और विस्तार
TACRED संबंध निष्कर्षण डेटासेट के एक व्यापक परिवार का हिस्सा है। यह SemEval-2010 टास्क 8 डेटासेट से निकटता से संबंधित है, जो 19 संबंध प्रकारों के छोटे सेट पर केंद्रित है, और NYT-FB डेटासेट, जो दूरस्थ पर्यवेक्षण का उपयोग करता है। FewRel और TACREV जैसे हालिया डेटासेट फ्यू-शॉट लर्निंग का पता लगाने और स्वच्छ एनोटेशन प्रदान करने के लिए TACRED की संरचना पर निर्माण करते हैं। जनरेटिव-एआई के युग में, TACRED का उपयोग ओपनएआई के GPT श्रृंखला जैसे मॉडलों की शून्य-शॉट या फ्यू-शॉट तरीके से संबंध निष्कर्षण करने की क्षमता का मूल्यांकन करने के लिए भी किया गया है, जो अक्सर फाइन-ट्यून किए गए छोटे मॉडलों की तुलना में प्रतिस्पर्धी परिणाम देते हैं।
यह भी देखें
- कृत्रिम-बुद्धिमत्ता
- प्राकृतिक-भाषा-प्रसंस्करण (नोट: प्रदान की गई सूची में नहीं, लेकिन संबंधित)
- स्टैनफोर्ड-एआई-लैब
- मशीन-लर्निंग