अंग्रेज़ी से अनुवादित

ReCoRD एक बड़े पैमाने का पठन समझ बेंचमार्क है जो सामान्य ज्ञान तर्क का उपयोग करके पाठ्य अस्पष्टताओं को हल करने की मॉडल की क्षमता का परीक्षण करता है। यह सिस्टम से समाचार अनुच्छेदों में छिपी संस्थाओं की भविष्यवाणी करने की आवश्यकता होती है, उन्हें पाठ से उम्मीदवार संस्थाओं से जोड़कर।

ReCoRD (रीडिंग कॉम्प्रिहेंशन विद कॉमनसेंस रीज़निंग) कृत्रिम बुद्धिमत्ता प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क डेटासेट है, विशेष रूप से प्राकृतिक भाषा समझ के क्षेत्र में। इसे 2018 में मैरीलैंड विश्वविद्यालय और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था। डेटासेट को पढ़ते समय सामान्य ज्ञान तर्क करने की मॉडल की क्षमता को मापने के लिए डिज़ाइन किया गया है, जो सरल तथ्य पुनर्प्राप्ति या पैटर्न मिलान से परे है।

ReCoRD में मुख्य कार्य में पाठ का एक अंश शामिल होता है, जो आमतौर पर समाचार लेखों से लिया जाता है, जहाँ कुछ इकाइयों को छिपा दिया गया होता है। मॉडल को उम्मीदवार इकाइयों की सूची से छिपी हुई इकाई की भविष्यवाणी करनी होती है, जो अंश में कहीं और दिखाई देती हैं। महत्वपूर्ण रूप से, सही उत्तर के लिए अक्सर संदर्भ को समझना, सहसंदर्भों को हल करना और वास्तविक दुनिया के ज्ञान को लागू करना आवश्यक होता है जो स्पष्ट रूप से नहीं बताया गया है। उदाहरण के लिए, यदि कोई अंश किसी व्यक्ति और शहर का उल्लेख करता है, और छिपी हुई इकाई एक स्थान है, तो मॉडल को कथा के आधार पर अनुमान लगाना चाहिए कि कौन सा शहर प्रासंगिक है।

ReCoRD में 120,000 से अधिक उदाहरण हैं, जो प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित हैं। अंश समाचार लेखों से प्राप्त होते हैं, और क्वेरी नामित इकाइयों को छिपाकर उत्पन्न की जाती हैं। डेटासेट इस बात पर जोर देता है कि सही उत्तर हमेशा उम्मीदवार इकाइयों में से एक होता है, जो सभी अंश में उल्लिखित होती हैं, जिससे यह एक सीमित उत्तर स्थान के साथ एक क्लोज़-शैली कार्य बन जाता है। यह डिज़ाइन मॉडल को बाहरी ज्ञान आधारों पर निर्भर रहने के बजाय इकाइयों और वर्णित घटनाओं के बीच संबंधों के बारे में तर्क करने के लिए मजबूर करता है।

निर्माण और डिज़ाइन

ReCoRD डेटासेट का निर्माण दो-चरणीय प्रक्रिया का उपयोग करके किया गया था। पहले, विभिन्न स्रोतों से समाचार लेख एकत्र किए गए, और एक मानक इकाई पहचानकर्ता का उपयोग करके नामित इकाइयों की पहचान की गई। फिर, प्रत्येक लेख के लिए, एक इकाई को यादृच्छिक रूप से छिपाकर और उसी लेख में दिखाई देने वाली उम्मीदवार इकाइयों की एक सूची प्रदान करके क्वेरी का एक सेट बनाया गया। उम्मीदवारों में सही उत्तर और कई व्याकुलता विकल्प शामिल हैं, जो उसी लेख की अन्य इकाइयाँ हैं। यह सुनिश्चित करता है कि मॉडल केवल सबसे लगातार इकाई का चयन नहीं कर सकता है या सतही आँकड़ों पर भरोसा नहीं कर सकता है।

ReCoRD की एक उल्लेखनीय विशेषता सामान्य ज्ञान तर्क पर इसका जोर है। क्वेरी को इस तरह से डिज़ाइन किया गया है कि सही उत्तर स्थानीय संदर्भ द्वारा तुच्छ रूप से निर्धारित नहीं होता है। इसके बजाय, मॉडल को कई वाक्यों में जानकारी को एकीकृत करना चाहिए और निहित संबंधों का अनुमान लगाना चाहिए। उदाहरण के लिए, यदि कोई अंश किसी व्यक्ति को किसी विशिष्ट क्षेत्र में पुरस्कार जीतने का वर्णन करता है, तो मॉडल को पता होना चाहिए कि पुरस्कार आमतौर पर उस क्षेत्र से जुड़ा होता है, जो सामान्य ज्ञान का एक टुकड़ा है।

डेटासेट को 101,249 प्रशिक्षण उदाहरणों, 6,353 सत्यापन उदाहरणों और 10,000 परीक्षण उदाहरणों में विभाजित किया गया था। परीक्षण सेट को अलग रखा गया है, और मॉडल का मूल्यांकन एक सबमिशन प्रणाली के माध्यम से किया जाता है। प्राथमिक मूल्यांकन मीट्रिक सटीक मिलान सटीकता है, जहाँ मॉडल की भविष्यवाणी की गई इकाई को ग्राउंड ट्रुथ से बिल्कुल मेल खाना चाहिए।

मूल्यांकन और प्रदर्शन

ReCoRD प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक मानक बेंचमार्क बन गया है। प्रारंभिक मॉडल, जिनमें आवर्तक तंत्रिका नेटवर्क और प्रारंभिक ट्रांसफॉर्मर आर्किटेक्चर पर आधारित शामिल हैं, ने सत्यापन सेट पर 60-70% की सीमा में सटीकता हासिल की। बड़े पूर्व-प्रशिक्षित भाषा मॉडल, जैसे कि BERT और इसके उत्तराधिकारियों की शुरूआत ने प्रदर्शन में काफी सुधार किया, कुछ मॉडल 2020 तक 90% से अधिक सटीकता प्राप्त कर रहे थे।

हालाँकि, अत्याधुनिक मॉडल भी अभी भी कुछ प्रकार की क्वेरी के साथ संघर्ष करते हैं जिनके लिए गहन सामान्य ज्ञान तर्क की आवश्यकता होती है, जैसे कि अस्थायी तर्क, स्थानिक तर्क या सूक्ष्म सामाजिक परंपराओं से जुड़ी क्वेरी। इसने ReCoRD को वर्तमान AI प्रणालियों की सीमाओं का निदान करने के लिए एक मूल्यवान उपकरण बना दिया है। बेंचमार्क का उपयोग मॉडल आकार, प्रशिक्षण डेटा और वास्तुकला विकल्पों के तर्क क्षमता पर प्रभाव का अध्ययन करने के लिए भी किया गया है।

अन्य बेंचमार्क के साथ संबंध

ReCoRD पठन समझ बेंचमार्क के एक व्यापक परिवार का हिस्सा है जिसमें SQuAD, RACE और DROP शामिल हैं। SQuAD के विपरीत, जो पाठ से उत्तर स्पैन निकालने पर केंद्रित है, ReCoRD को इकाइयों के एक सेट से चयन करने की आवश्यकता होती है, जिससे यह एक बहुविकल्पीय क्लोज़ कार्य बन जाता है। अंग्रेजी परीक्षाओं पर आधारित RACE की तुलना में, ReCoRD का समाचार डोमेन एक अधिक विविध और कम औपचारिक संदर्भ प्रदान करता है। दूसरी ओर, DROP को संख्यात्मक तर्क की आवश्यकता होती है, जबकि ReCoRD सामान्य ज्ञान अनुमान पर जोर देता है।

ReCoRD का उपयोग अक्सर किसी मॉडल की क्षमताओं का व्यापक मूल्यांकन प्रदान करने के लिए अन्य बेंचमार्क के साथ संयोजन में किया जाता है। यह प्राकृतिक भाषा को समझने में कृत्रिम बुद्धिमत्ता और मशीन लर्निंग तकनीकों के एकीकरण के परीक्षण के लिए विशेष रूप से प्रासंगिक है। बेंचमार्क को प्रमुख संस्थानों के शोध समूहों द्वारा अपनाया गया है, जिनमें Google DeepMind, OpenAI और Anthropic शामिल हैं, उनके मॉडल मूल्यांकन सुइट के हिस्से के रूप में।

प्रभाव और भविष्य की दिशाएँ

ReCoRD की शुरूआत ने AI में सामान्य ज्ञान तर्क पर आगे के शोध को प्रेरित किया है। इसने पैटर्न पहचान और वास्तविक समझ के बीच की खाई को उजागर किया है, जिससे ऐसे मॉडल विकसित करने के प्रयासों को बढ़ावा मिला है जो रोजमर्रा की स्थितियों के बारे में तर्क कर सकें। बाद के बेंचमार्क, जैसे कि CommonsenseQA और Social IQA, ने ReCoRD से सीखे गए पाठों पर निर्माण किया है, जो अधिक स्पष्ट सामान्य ज्ञान पर केंद्रित हैं।

ReCoRD की एक सीमा यह है कि उम्मीदवार इकाइयाँ सभी एक ही अंश से होती हैं, जो कभी-कभी कार्य को आसान बना सकती हैं यदि मॉडल सांख्यिकीय संकेतों का शोषण करना सीख जाता है। शोधकर्ताओं ने ऐसे वेरिएंट प्रस्तावित किए हैं जो बाहरी ज्ञान का परिचय देते हैं या मल्टी-हॉप तर्क की आवश्यकता होती है। इन चुनौतियों के बावजूद, ReCoRD एक व्यापक रूप से उद्धृत और उपयोग किया जाने वाला बेंचमार्क बना हुआ है, और यह अधिक मजबूत और व्याख्या योग्य AI प्रणालियों के विकास को सूचित करना जारी रखता है।

2020 के दशक की शुरुआत तक, ReCoRD को अभी भी एक प्रासंगिक बेंचमार्क माना जाता है, हालाँकि नए मॉडल अक्सर लगभग पूर्ण स्कोर प्राप्त करते हैं। इसकी विरासत प्राकृतिक भाषा समझ में सामान्य ज्ञान तर्क के महत्व को प्रदर्शित करने और इस क्षेत्र में प्रगति को मापने के लिए एक ठोस कार्य प्रदान करने में निहित है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·reading-comprehension·commonsense-reasoning·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास