अंग्रेज़ी से अनुवादित

NarrativeQA मशीन लर्निंग मॉडल के लिए एक पठन समझ बेंचमार्क डेटासेट है, जिसमें पुस्तकों और फिल्म स्क्रिप्ट जैसे पूर्ण-लंबाई वाले कथा पाठों पर प्रश्न और उत्तर शामिल हैं, जिसे 2018 में गहन शिक्षण प्रणालियों की कथा समझ का परीक्षण करने के लिए पेश किया गया था।

NarrativeQA एक बेंचमार्क डेटासेट है जिसे पठन-समझ अनुसंधान के लिए डिज़ाइन किया गया है, जो कृत्रिम बुद्धिमत्ता प्रणालियों की लंबे-रूप वाले कथात्मक ग्रंथों को समझने और उनके बारे में प्रश्नों के उत्तर देने की क्षमता पर केंद्रित है। 2018 में टोमाश कोचिस्की और सहकर्मियों सहित शोधकर्ताओं द्वारा पेश किया गया, यह डेटासेट पहले के समझ कार्यों में एक अंतर को संबोधित करता है जो आमतौर पर छोटे अनुच्छेदों या सिंथेटिक दस्तावेज़ों पर निर्भर थे। NarrativeQA के लिए मॉडलों को पूरी किताबों और फिल्म स्क्रिप्टों को संसाधित करने की आवश्यकता होती है, जिससे यह Machine learning और Deep learning प्रणालियों के लिए एक कठिन परीक्षण बन जाता है।

डेटासेट में 1,567 दस्तावेज़ शामिल हैं, जिनमें 360 किताबें और 1,207 फिल्म स्क्रिप्ट शामिल हैं, जो प्रोजेक्ट गुटेनबर्ग और इंटरनेट मूवी स्क्रिप्ट डेटाबेस (IMSDb) से प्राप्त हैं। प्रत्येक दस्तावेज़ के लिए, मानव एनोटेटरों ने 10 से 20 प्रश्न और उत्तर उत्पन्न किए, जिससे कुल 46,765 प्रश्न-उत्तर जोड़े बने। प्रश्न खुले-अंत वाले हैं और अक्सर सरल तथ्य पुनर्प्राप्ति के बजाय कई अध्यायों या दृश्यों में तर्क की आवश्यकता होती है। उत्तर दो रूपों में प्रदान किए जाते हैं: मुक्त-पाठ और एक बहुविकल्पीय संस्करण, जो जनरेटिव और विभेदक दोनों मूल्यांकन की अनुमति देता है।

निर्माण और एनोटेशन

NarrativeQA के निर्माण में एक दो-चरणीय प्रक्रिया शामिल थी। पहले, एनोटेटरों ने प्रत्येक पूर्ण कथा को पढ़ा और ऐसे प्रश्न लिखे जो कथानक, चरित्र प्रेरणाओं और कारणात्मक घटनाओं की समझ का परीक्षण करते थे। दूसरे, उन्होंने पाठ के आधार पर संक्षिप्त उत्तर प्रदान किए, आमतौर पर एक से पांच शब्द। एनोटेशन प्रोटोकॉल ने ऐसे प्रश्नों पर जोर दिया जिनका उत्तर एक ही वाक्य को देखकर नहीं दिया जा सकता था, जिससे मॉडलों को कहानी की वैश्विक समझ बनाने के लिए प्रोत्साहित किया गया। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया था, जिसमें परीक्षण सेट में 10,611 प्रश्न शामिल थे। यह डिज़ाइन SQuAD जैसे पहले के बेंचमार्कों के विपरीत है, जो विकिपीडिया लेखों और स्थानीय संदर्भ पर केंद्रित थे।

मूल्यांकन और मेट्रिक्स

NarrativeQA का मूल्यांकन मानक प्राकृतिक भाषा प्रसंस्करण मेट्रिक्स का उपयोग करके किया जाता है: BLEU-1, BLEU-4, ROUGE-L, और METEOR। ये मेट्रिक्स उत्पन्न उत्तरों की तुलना संदर्भ उत्तरों से करते हैं, जो n-ग्राम ओवरलैप और सबसे लंबे सामान्य अनुक्रम को मापते हैं। चूंकि उत्तर छोटे होते हैं, BLEU-1 और ROUGE-L अक्सर प्रदर्शन के प्राथमिक संकेतक होते हैं। बहुविकल्पीय संस्करण को सटीकता द्वारा स्कोर किया जाता है, जहां मॉडलों को विकल्पों के सेट से सही उत्तर चुनना होता है। प्रारंभिक बेसलाइन, जिनमें अनुक्रम-से-अनुक्रम मॉडल और मेमोरी-वर्धित नेटवर्क शामिल हैं, ने कम स्कोर प्राप्त किए, जो कार्य की कठिनाई को उजागर करते हैं। 2025 तक, सर्वोत्तम प्रणालियाँ, जो अक्सर Large language model आर्किटेक्चर पर आधारित होती हैं, अभी भी मानव-स्तरीय प्रदर्शन तक नहीं पहुँचती हैं, जिसमें बहुविकल्पीय कार्य पर मानव सटीकता लगभग 95% है।

चुनौतियाँ और अनुसंधान प्रभाव

NarrativeQA ने Artificial intelligence के कई क्षेत्रों में अनुसंधान को प्रेरित किया है। प्राथमिक चुनौती इनपुट दस्तावेज़ों की लंबाई है, जो 100,000 टोकन से अधिक हो सकती है, जो प्रारंभिक Transformer (architecture) मॉडलों के संदर्भ विंडो से कहीं अधिक है। इसने पदानुक्रमित ध्यान तंत्र, पुनर्प्राप्ति-वर्धित जनरेशन, और कुशल मेमोरी आर्किटेक्चर पर काम को प्रेरित किया है। डेटासेट कथात्मक संरचना को संभालने की क्षमता का भी परीक्षण करता है, जैसे कि अस्थायी क्रम और चरित्र सह-संदर्भ, जो तथ्य-आधारित QA डेटासेट में कम प्रमुख हैं। शोधकर्ताओं ने Neural network मॉडलों की लंबी-दूरी निर्भरता मॉडलिंग की क्षमता का मूल्यांकन करने के लिए NarrativeQA का उपयोग किया है, और यह RACE और HotpotQA जैसे डेटासेट के साथ Natural language processing समुदाय में एक मानक बेंचमार्क बन गया है।

आधुनिक भाषा मॉडलों से संबंध

OpenAI, Anthropic, और Google DeepMind द्वारा विकसित Large language model के आगमन के साथ, NarrativeQA का उपयोग विस्तारित ग्रंथों की समझ का परीक्षण करने के लिए किया गया है। आधुनिक मॉडल, जब पूरी कथा को खंडों में या पुनर्प्राप्ति के साथ दिया जाता है, प्रारंभिक बेसलाइनों की तुलना में काफी अधिक स्कोर प्राप्त कर सकते हैं, लेकिन फिर भी वैश्विक अनुमान या सूक्ष्म कथानक विवरणों की आवश्यकता वाले प्रश्नों में संघर्ष करते हैं। डेटासेट को Generative AI प्रणालियों के लिए मूल्यांकन सुइट्स में भी शामिल किया गया है, जहां यह लंबे-संदर्भ हैंडलिंग के लिए एक तनाव परीक्षण के रूप में कार्य करता है। कुछ मॉडल अब 128,000 टोकन या उससे अधिक के संदर्भ विंडो का समर्थन करते हैं, जिससे पूरी किताबों का सीधा प्रसंस्करण संभव हो जाता है, फिर भी NarrativeQA पर प्रदर्शन मानव स्तर से नीचे रहता है, जो दर्शाता है कि कच्ची संदर्भ लंबाई गहरी कथात्मक समझ के लिए पर्याप्त नहीं है।

सीमाएँ और आलोचनाएँ

आलोचकों ने नोट किया है कि NarrativeQA के मुक्त-रूप उत्तर छोटे और अक्सर निष्कर्षणात्मक होते हैं, जो कथात्मक तर्क की जटिलता को कम आंक सकते हैं। बहुविकल्पीय संस्करण को मॉडलों द्वारा उत्तर विकल्पों में सांख्यिकीय नियमितताओं का शोषण करके खेला जा सकता है। इसके अतिरिक्त, पश्चिमी साहित्य और फिल्म स्क्रिप्टों पर डेटासेट का ध्यान इसकी सांस्कृतिक विविधता को सीमित करता है। इन मुद्दों के बावजूद, NarrativeQA बड़े पैमाने पर समझ का अध्ययन करने के लिए एक मूल्यवान संसाधन बना हुआ है, और इसने NarrativeQA-2 और लंबे-दस्तावेज़ QA बेंचमार्क जैसे अनुवर्ती डेटासेट को प्रेरित किया है। 2025 तक, यह लंबाई और कथात्मक जटिलता के अद्वितीय संयोजन के लिए Machine learning और Deep learning पर अनुसंधान में उद्धृत किया जा रहा है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reading-comprehension·dataset·natural-language-processing·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास