अंग्रेज़ी से अनुवादित

DuoRC एक पठन समझ डेटासेट है जिसमें 7,680 फिल्म कथानक सारांशों से प्राप्त 186,089 प्रश्न-उत्तर जोड़े शामिल हैं, जो लंबे आख्यानों की मशीन समझ का परीक्षण करने के लिए डिज़ाइन किया गया है, जिसमें कई वाक्यों में अनुमान की आवश्यकता वाले प्रश्न शामिल हैं।

DuoRC एक बड़े पैमाने का पठन-समझ डेटासेट है, जिसे 2018 में भारतीय प्रौद्योगिकी संस्थान (IIT) मद्रास और कार्नेगी मेलन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था। इसमें विकिपीडिया और IMDb से प्राप्त 7,680 फिल्म कथानक सारांशों से उत्पन्न 186,089 प्रश्न-उत्तर जोड़े शामिल हैं। कई पुराने डेटासेट के विपरीत, जो एकल-वाक्य या लघु-अनुच्छेद संदर्भों पर निर्भर करते हैं, DuoRC लंबे, बहु-अनुच्छेद कथाओं पर केंद्रित है, जिसके लिए मॉडलों को कई वाक्यों और घटनाओं में जानकारी को संश्लेषित करने की आवश्यकता होती है।

डेटासेट का निर्माण दो-चरणीय प्रक्रिया के माध्यम से किया गया था। पहले, अमेज़न मैकेनिकल टर्क कर्मियों ने विकिपीडिया के कथानक सारांशों के आधार पर प्रश्न लिखे, जो आम तौर पर तटस्थ और स्पॉइलर-मुक्त होते हैं। फिर, कर्मियों के एक अलग समूह ने IMDb के संबंधित कथानक सारांशों का उपयोग करके उन प्रश्नों के उत्तर दिए, जो अधिक विस्तृत होते हैं और अक्सर स्पॉइलर युक्त होते हैं। प्रश्न-निर्माण संदर्भ और उत्तर-खोज संदर्भ के बीच यह जानबूझकर की गई बेमेल स्थिति मॉडलों को सरल शाब्दिक मिलान के बजाय गहरी समझ पर निर्भर रहने के लिए मजबूर करती है, क्योंकि उत्तर प्रश्न निर्माण के लिए उपयोग किए गए स्रोत में शब्दशः मौजूद नहीं हो सकता है।

निर्माण और एनोटेशन

DuoRC में प्रत्येक फिल्म के दो अलग-अलग कथानक सारांश हैं: एक विकिपीडिया से (औसत लंबाई लगभग 1,000 शब्द) और एक IMDb से (औसत लंबाई लगभग 2,000 शब्द)। एनोटेशन प्रक्रिया में कई गुणवत्ता नियंत्रण चरण शामिल थे, जिनमें उन प्रश्नों को फ़िल्टर करना शामिल था जिनका उत्तर एकल वाक्य से दिया जा सकता था, और यह सुनिश्चित करना कि उत्तर IMDb सारांश में मौजूद पाठ के खंड हों। अंतिम डेटासेट में प्रशिक्षण विभाजन के लिए 96,311 प्रश्न, सत्यापन के लिए 12,792, और परीक्षण के लिए 76,986 प्रश्न हैं, जिनमें कुल 186,089 प्रश्न-उत्तर जोड़े हैं।

DuoRC में प्रश्न मुख्य रूप से "क्या," "कौन," "क्यों," और "कैसे" प्रकार के हैं, जिनमें से एक महत्वपूर्ण अनुपात के लिए बहु-वाक्य तर्क की आवश्यकता होती है। उदाहरण के लिए, एक प्रश्न पूछ सकता है कि एक पात्र ने एक निश्चित तरीके से क्यों कार्य किया, जिसका उत्तर तीन या चार अलग-अलग अनुच्छेदों की जानकारी की आवश्यकता होती है। यह DuoRC को SQuAD जैसे डेटासेट से अलग करता है, जहां अधिकांश उत्तर एकल वाक्य या आसन्न वाक्यों के भीतर स्थित होते हैं।

मूल्यांकन और आधार रेखाएँ

DuoRC मानक पठन-समझ मेट्रिक्स का उपयोग करता है: एक्सैक्ट मैच (EM) और F1 स्कोर। जब पहली बार जारी किया गया था, लेखकों ने कई आधार रेखा मॉडलों का मूल्यांकन किया, जिनमें पारंपरिक फीचर-आधारित सिस्टम और प्रारंभिक तंत्रिका मॉडल शामिल थे। उस समय सर्वश्रेष्ठ प्रदर्शन करने वाली आधार रेखा ने लगभग 14% का EM स्कोर और लगभग 24% का F1 स्कोर हासिल किया, जो मानव प्रदर्शन से काफी कम था, जिसका अनुमान 78% EM और 86% F1 था। इस बड़े अंतर ने लंबे-संदर्भ तर्क की कठिनाई को उजागर किया और क्षेत्र में आगे के शोध को प्रेरित किया।

बाद में Transformer (architecture)-आधारित मॉडलों, जैसे बड़े भाषा मॉडल, के साथ किए गए कार्य ने प्रदर्शन में काफी सुधार किया है। हालांकि, आधुनिक सिस्टम भी DuoRC के सबसे जटिल प्रश्नों से जूझते हैं, विशेष रूप से उन प्रश्नों से जिनमें क्रॉस-अनुच्छेद अनुमान और अस्थायी तर्क की आवश्यकता होती है। यह डेटासेट प्राकृतिक भाषा प्रसंस्करण अनुसंधान में लंबे-दस्तावेज़ समझ का मूल्यांकन करने के लिए एक बेंचमार्क बना हुआ है।

अन्य डेटासेट से संबंध

DuoRC को मौजूदा पठन-समझ डेटासेट का पूरक बनाने के लिए डिज़ाइन किया गया था। SQuAD (जो छोटे विकिपीडिया लेखों का उपयोग करता है) या RACE (जो परीक्षाओं का उपयोग करता है) के विपरीत, DuoRC लंबे संदर्भ और एक अद्वितीय प्रश्न-उत्तर बेमेल प्रदान करता है। यह डिज़ाइन विकल्प इसे विशेष रूप से यह अध्ययन करने के लिए उपयोगी बनाता है कि क्या मॉडल सरल पैटर्न मिलान से परे सामान्यीकरण कर सकते हैं। डेटासेट का उपयोग मल्टी-हॉप तर्क, मशीन पठन-समझ, और प्रश्न-उत्तर प्रणालियों पर शोध में किया गया है।

निर्माताओं ने DuoRC-Paraphrase नामक एक उपसमुच्चय भी जारी किया, जिसमें मूल प्रश्नों के परिभाषित संस्करण शामिल हैं, जिससे शोधकर्ताओं को भाषाई भिन्नता के प्रति मजबूती का परीक्षण करने की अनुमति मिलती है। इस उपसमुच्चय का उपयोग प्रश्न-वाक्यांश में सतही परिवर्तनों के प्रति मॉडलों की संवेदनशीलता का मूल्यांकन करने के लिए किया गया है।

प्रभाव और सीमाएँ

DuoRC को कृत्रिम बुद्धिमत्ता समुदाय में लंबे-संदर्भ समझ के लिए एक चुनौतीपूर्ण बेंचमार्क के रूप में व्यापक रूप से उद्धृत किया गया है। इसने बाद के डेटासेटों के डिज़ाइन को प्रभावित किया है, जैसे NarrativeQA, जो पुस्तक और फिल्म कथानकों का भी उपयोग करता है। हालांकि, DuoRC की सीमाएँ हैं: फिल्म कथानक सारांश कॉपीराइट सामग्री हैं, जो पुनर्वितरण को प्रतिबंधित करती है, और डेटासेट मुख्य रूप से अंग्रेजी में है, जो क्रॉस-भाषाई अनुसंधान को सीमित करता है।

एक और सीमा यह है कि प्रश्न क्राउड कर्मियों द्वारा उत्पन्न किए गए थे, जो पूर्वाग्रह या असंगतताएँ पेश कर सकते हैं। कुछ प्रश्नों के कई मान्य उत्तर हो सकते हैं, और स्पैन-आधारित उत्तर प्रारूप सभी प्रकार के तर्क को कैप्चर नहीं करता है। इन मुद्दों के बावजूद, DuoRC लंबे, कथात्मक पाठ को संसाधित करने की आवश्यकता वाले मॉडलों का मूल्यांकन और सुधार करने के लिए एक मूल्यवान संसाधन बना हुआ है।

भविष्य की दिशाएँ

बड़े भाषा मॉडल और जनरेटिव AI के उदय के साथ, DuoRC का उपयोग यह परीक्षण करने के लिए किया गया है कि क्या ये मॉडल लंबे-रूप तर्क को संभाल सकते हैं। हाल के मूल्यांकनों से पता चलता है कि GPT-4 और Claude जैसे मॉडल बहुत अधिक स्कोर प्राप्त कर सकते हैं, लेकिन सबसे कठिन प्रश्नों पर मानव प्रदर्शन से अभी भी कम हैं। शोधकर्ता वर्तमान प्रणालियों में कमजोरियों का पता लगाने के लिए DuoRC का उपयोग जारी रखते हैं, जैसे कि मतिभ्रम और लंबे अंशों में पात्र संबंधों को ट्रैक करने में विफलता।

डेटासेट लंबे अनुक्रमों के लिए डिज़ाइन किए गए नए ध्यान तंत्र और मेमोरी-संवर्धित नेटवर्क विकसित करने के लिए एक परीक्षण मंच के रूप में भी कार्य करता है। जैसे-जैसे गहन शिक्षण मॉडल लंबे संदर्भों को संसाधित करने में अधिक कुशल होते जाते हैं, DuoRC संभवतः कथाओं की मशीन समझ में प्रगति को मापने के लिए एक मानक बेंचमार्क बना रहेगा।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·reading-comprehension·dataset·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास