ReCoRD (रीडिंग कॉम्प्रिहेंशन विद कॉमनसेंस रीज़निंग) कृत्रिम बुद्धिमत्ता प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क डेटासेट है, विशेष रूप से प्राकृतिक भाषा समझ के क्षेत्र में। इसे 2018 में मैरीलैंड विश्वविद्यालय और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था। डेटासेट को पढ़ते समय सामान्य ज्ञान तर्क करने की मॉडल की क्षमता को मापने के लिए डिज़ाइन किया गया है, जो सरल तथ्य पुनर्प्राप्ति या पैटर्न मिलान से परे है।
ReCoRD में मुख्य कार्य में पाठ का एक अंश शामिल होता है, जो आमतौर पर समाचार लेखों से लिया जाता है, जहाँ कुछ इकाइयों को छिपा दिया गया होता है। मॉडल को उम्मीदवार इकाइयों की सूची से छिपी हुई इकाई की भविष्यवाणी करनी होती है, जो अंश में कहीं और दिखाई देती हैं। महत्वपूर्ण रूप से, सही उत्तर के लिए अक्सर संदर्भ को समझना, सहसंदर्भों को हल करना और वास्तविक दुनिया के ज्ञान को लागू करना आवश्यक होता है जो स्पष्ट रूप से नहीं बताया गया है। उदाहरण के लिए, यदि कोई अंश किसी व्यक्ति और शहर का उल्लेख करता है, और छिपी हुई इकाई एक स्थान है, तो मॉडल को कथा के आधार पर अनुमान लगाना चाहिए कि कौन सा शहर प्रासंगिक है।
ReCoRD में 120,000 से अधिक उदाहरण हैं, जो प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित हैं। अंश समाचार लेखों से प्राप्त होते हैं, और क्वेरी नामित इकाइयों को छिपाकर उत्पन्न की जाती हैं। डेटासेट इस बात पर जोर देता है कि सही उत्तर हमेशा उम्मीदवार इकाइयों में से एक होता है, जो सभी अंश में उल्लिखित होती हैं, जिससे यह एक सीमित उत्तर स्थान के साथ एक क्लोज़-शैली कार्य बन जाता है। यह डिज़ाइन मॉडल को बाहरी ज्ञान आधारों पर निर्भर रहने के बजाय इकाइयों और वर्णित घटनाओं के बीच संबंधों के बारे में तर्क करने के लिए मजबूर करता है।
निर्माण और डिज़ाइन
ReCoRD डेटासेट का निर्माण दो-चरणीय प्रक्रिया का उपयोग करके किया गया था। पहले, विभिन्न स्रोतों से समाचार लेख एकत्र किए गए, और एक मानक इकाई पहचानकर्ता का उपयोग करके नामित इकाइयों की पहचान की गई। फिर, प्रत्येक लेख के लिए, एक इकाई को यादृच्छिक रूप से छिपाकर और उसी लेख में दिखाई देने वाली उम्मीदवार इकाइयों की एक सूची प्रदान करके क्वेरी का एक सेट बनाया गया। उम्मीदवारों में सही उत्तर और कई व्याकुलता विकल्प शामिल हैं, जो उसी लेख की अन्य इकाइयाँ हैं। यह सुनिश्चित करता है कि मॉडल केवल सबसे लगातार इकाई का चयन नहीं कर सकता है या सतही आँकड़ों पर भरोसा नहीं कर सकता है।
ReCoRD की एक उल्लेखनीय विशेषता सामान्य ज्ञान तर्क पर इसका जोर है। क्वेरी को इस तरह से डिज़ाइन किया गया है कि सही उत्तर स्थानीय संदर्भ द्वारा तुच्छ रूप से निर्धारित नहीं होता है। इसके बजाय, मॉडल को कई वाक्यों में जानकारी को एकीकृत करना चाहिए और निहित संबंधों का अनुमान लगाना चाहिए। उदाहरण के लिए, यदि कोई अंश किसी व्यक्ति को किसी विशिष्ट क्षेत्र में पुरस्कार जीतने का वर्णन करता है, तो मॉडल को पता होना चाहिए कि पुरस्कार आमतौर पर उस क्षेत्र से जुड़ा होता है, जो सामान्य ज्ञान का एक टुकड़ा है।
डेटासेट को 101,249 प्रशिक्षण उदाहरणों, 6,353 सत्यापन उदाहरणों और 10,000 परीक्षण उदाहरणों में विभाजित किया गया था। परीक्षण सेट को अलग रखा गया है, और मॉडल का मूल्यांकन एक सबमिशन प्रणाली के माध्यम से किया जाता है। प्राथमिक मूल्यांकन मीट्रिक सटीक मिलान सटीकता है, जहाँ मॉडल की भविष्यवाणी की गई इकाई को ग्राउंड ट्रुथ से बिल्कुल मेल खाना चाहिए।
मूल्यांकन और प्रदर्शन
ReCoRD प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक मानक बेंचमार्क बन गया है। प्रारंभिक मॉडल, जिनमें आवर्तक तंत्रिका नेटवर्क और प्रारंभिक ट्रांसफॉर्मर आर्किटेक्चर पर आधारित शामिल हैं, ने सत्यापन सेट पर 60-70% की सीमा में सटीकता हासिल की। बड़े पूर्व-प्रशिक्षित भाषा मॉडल, जैसे कि BERT और इसके उत्तराधिकारियों की शुरूआत ने प्रदर्शन में काफी सुधार किया, कुछ मॉडल 2020 तक 90% से अधिक सटीकता प्राप्त कर रहे थे।
हालाँकि, अत्याधुनिक मॉडल भी अभी भी कुछ प्रकार की क्वेरी के साथ संघर्ष करते हैं जिनके लिए गहन सामान्य ज्ञान तर्क की आवश्यकता होती है, जैसे कि अस्थायी तर्क, स्थानिक तर्क या सूक्ष्म सामाजिक परंपराओं से जुड़ी क्वेरी। इसने ReCoRD को वर्तमान AI प्रणालियों की सीमाओं का निदान करने के लिए एक मूल्यवान उपकरण बना दिया है। बेंचमार्क का उपयोग मॉडल आकार, प्रशिक्षण डेटा और वास्तुकला विकल्पों के तर्क क्षमता पर प्रभाव का अध्ययन करने के लिए भी किया गया है।
अन्य बेंचमार्क के साथ संबंध
ReCoRD पठन समझ बेंचमार्क के एक व्यापक परिवार का हिस्सा है जिसमें SQuAD, RACE और DROP शामिल हैं। SQuAD के विपरीत, जो पाठ से उत्तर स्पैन निकालने पर केंद्रित है, ReCoRD को इकाइयों के एक सेट से चयन करने की आवश्यकता होती है, जिससे यह एक बहुविकल्पीय क्लोज़ कार्य बन जाता है। अंग्रेजी परीक्षाओं पर आधारित RACE की तुलना में, ReCoRD का समाचार डोमेन एक अधिक विविध और कम औपचारिक संदर्भ प्रदान करता है। दूसरी ओर, DROP को संख्यात्मक तर्क की आवश्यकता होती है, जबकि ReCoRD सामान्य ज्ञान अनुमान पर जोर देता है।
ReCoRD का उपयोग अक्सर किसी मॉडल की क्षमताओं का व्यापक मूल्यांकन प्रदान करने के लिए अन्य बेंचमार्क के साथ संयोजन में किया जाता है। यह प्राकृतिक भाषा को समझने में कृत्रिम बुद्धिमत्ता और मशीन लर्निंग तकनीकों के एकीकरण के परीक्षण के लिए विशेष रूप से प्रासंगिक है। बेंचमार्क को प्रमुख संस्थानों के शोध समूहों द्वारा अपनाया गया है, जिनमें Google DeepMind, OpenAI और Anthropic शामिल हैं, उनके मॉडल मूल्यांकन सुइट के हिस्से के रूप में।
प्रभाव और भविष्य की दिशाएँ
ReCoRD की शुरूआत ने AI में सामान्य ज्ञान तर्क पर आगे के शोध को प्रेरित किया है। इसने पैटर्न पहचान और वास्तविक समझ के बीच की खाई को उजागर किया है, जिससे ऐसे मॉडल विकसित करने के प्रयासों को बढ़ावा मिला है जो रोजमर्रा की स्थितियों के बारे में तर्क कर सकें। बाद के बेंचमार्क, जैसे कि CommonsenseQA और Social IQA, ने ReCoRD से सीखे गए पाठों पर निर्माण किया है, जो अधिक स्पष्ट सामान्य ज्ञान पर केंद्रित हैं।
ReCoRD की एक सीमा यह है कि उम्मीदवार इकाइयाँ सभी एक ही अंश से होती हैं, जो कभी-कभी कार्य को आसान बना सकती हैं यदि मॉडल सांख्यिकीय संकेतों का शोषण करना सीख जाता है। शोधकर्ताओं ने ऐसे वेरिएंट प्रस्तावित किए हैं जो बाहरी ज्ञान का परिचय देते हैं या मल्टी-हॉप तर्क की आवश्यकता होती है। इन चुनौतियों के बावजूद, ReCoRD एक व्यापक रूप से उद्धृत और उपयोग किया जाने वाला बेंचमार्क बना हुआ है, और यह अधिक मजबूत और व्याख्या योग्य AI प्रणालियों के विकास को सूचित करना जारी रखता है।
2020 के दशक की शुरुआत तक, ReCoRD को अभी भी एक प्रासंगिक बेंचमार्क माना जाता है, हालाँकि नए मॉडल अक्सर लगभग पूर्ण स्कोर प्राप्त करते हैं। इसकी विरासत प्राकृतिक भाषा समझ में सामान्य ज्ञान तर्क के महत्व को प्रदर्शित करने और इस क्षेत्र में प्रगति को मापने के लिए एक ठोस कार्य प्रदान करने में निहित है।