दस्तावेज़ दृश्य प्रश्न उत्तर (DocVQA)

अंग्रेज़ी से अनुवादित

DocVQA दस्तावेज़ दृश्य प्रश्न उत्तर देने के लिए एक बेंचमार्क डेटासेट है, जो दस्तावेज़ छवियों से जानकारी निकालने और उस पर तर्क करने में AI मॉडल का मूल्यांकन करता है। इसमें 12,000 से अधिक दस्तावेज़ों पर 50,000 से अधिक प्रश्न शामिल हैं, जो पाठ, लेआउट और दृश्य तत्वों को कवर करते हैं।

DocVQA (Document Visual Question Answering) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की दस्तावेज़ छवियों की सामग्री के बारे में प्रश्नों के उत्तर देने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। पारंपरिक विज़ुअल प्रश्नोत्तर (VQA) के विपरीत, जो प्राकृतिक दृश्यों पर केंद्रित है, DocVQA दस्तावेज़ों की अनूठी चुनौतियों को लक्षित करता है, जो पाठ्य सामग्री, जटिल लेआउट, तालिकाओं, आकृतियों और विविध टाइपोग्राफी को जोड़ते हैं। इस कार्य के लिए एक मॉडल को न केवल पाठ पढ़ने की आवश्यकता होती है, बल्कि सही उत्तर का पता लगाने और संश्लेषित करने के लिए स्थानिक व्यवस्था और दृश्य संकेतों को समझने की भी आवश्यकता होती है।

यह डेटासेट 2020 में बास्क देश विश्वविद्यालय (UPV/EHU) और एलिकांटे विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जिसका नेतृत्व रूबेन टीटो और सहयोगियों ने किया था। इसे मौजूदा बेंचमार्क में एक अंतर को भरने के लिए बनाया गया था, जो या तो प्राकृतिक छवियों पर केंद्रित थे या तर्क घटक के बिना शुद्ध पाठ निष्कर्षण पर। DocVQA तब से दस्तावेज़ समझ में प्रगति के लिए एक मानक संदर्भ बिंदु बन गया है, जो दृष्टि और भाषा प्रसंस्करण को संयोजित करने वाले मल्टीमॉडल मॉडल में प्रगति को बढ़ावा देता है।

डेटासेट संरचना

DocVQA डेटासेट में 12,000 से अधिक व्यक्तिगत दस्तावेज़ पृष्ठों से प्राप्त 50,000 से अधिक प्रश्न शामिल हैं। ये दस्तावेज़ विभिन्न उद्योगों और प्रारूपों से प्राप्त होते हैं, जिनमें शैक्षणिक पेपर, व्यावसायिक रिपोर्ट, चालान, फॉर्म और तकनीकी मैनुअल शामिल हैं। प्रत्येक प्रश्न एक ग्राउंड-ट्रुथ उत्तर के साथ जोड़ा जाता है, जो एक छोटा वाक्यांश, एक संख्या, एक तारीख या वस्तुओं की सूची हो सकता है। प्रश्नों को समझ के विभिन्न स्तरों की आवश्यकता के लिए डिज़ाइन किया गया है, सरल पाठ पुनर्प्राप्ति (जैसे, "चालान संख्या क्या है?") से लेकर अधिक जटिल तर्क तक जिसमें दस्तावेज़ के कई हिस्सों से जानकारी को संयोजित करना शामिल है (जैसे, "तालिका में सूचीबद्ध सभी वस्तुओं की कुल लागत क्या है?")।

डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित किया गया है। प्रशिक्षण सेट में लगभग 41,000 प्रश्न हैं, सत्यापन सेट में लगभग 5,000, और परीक्षण सेट में लगभग 5,000। परीक्षण सेट को अलग रखा गया है और आधिकारिक मूल्यांकन के लिए उपयोग किया जाता है, जिसमें परिणाम एक सार्वजनिक लीडरबोर्ड पर रिपोर्ट किए जाते हैं। प्रश्नों को प्रकार के अनुसार वर्गीकृत किया जाता है, जिसमें हाँ/नहीं, संख्या, तारीख और छोटे वाक्यांश उत्तर शामिल हैं, जो विभिन्न प्रश्न प्रारूपों में मॉडल प्रदर्शन के सूक्ष्म विश्लेषण की अनुमति देता है।

मूल्यांकन मेट्रिक्स

DocVQA पर प्रदर्शन मुख्य रूप से औसत सामान्यीकृत लेवेनशेटिन समानता (ANLS) मीट्रिक का उपयोग करके मापा जाता है। सटीक मिलान सटीकता के विपरीत, ANLS मामूली वर्तनी त्रुटियों या वाक्यांश में मामूली बदलावों के प्रति सहिष्णु है, जो दस्तावेज़ समझ के लिए अधिक यथार्थवादी है जहां OCR (ऑप्टिकल कैरेक्टर पहचान) त्रुटियां या स्वरूपण अंतर हो सकते हैं। ANLS स्कोर 0 से 1 तक होता है, जिसमें 1 पूर्वानुमानित और ग्राउंड-ट्रुथ उत्तरों के बीच पूर्ण सहमति का संकेत देता है। यह मीट्रिक आंशिक मिलानों की तुलना में गलत उत्तरों को अधिक दंडित करता है, जो मॉडल गुणवत्ता का एक मजबूत माप प्रदान करता है।

ANLS के अतिरिक्त, कुछ अध्ययन द्वितीयक मीट्रिक के रूप में सटीक मिलान सटीकता की रिपोर्ट करते हैं। आधिकारिक लीडरबोर्ड ANLS स्कोर द्वारा सबमिशन को रैंक करता है, जिसमें शीर्ष प्रदर्शन करने वाले मॉडल 2024 तक 0.90 से ऊपर स्कोर प्राप्त करते हैं, जो बेंचमार्क पर लगभग मानव-स्तरीय प्रदर्शन का संकेत देता है। हालांकि, ये उच्च स्कोर अक्सर बड़े, कम्प्यूटेशनल रूप से गहन मॉडल से आते हैं, और बेंचमार्क प्रदर्शन और वास्तविक दुनिया की मजबूती के बीच एक अंतर बना रहता है।

अन्य बेंचमार्क से संबंध

DocVQA दस्तावेज़ समझ बेंचमार्क के एक व्यापक परिवार का हिस्सा है, जिसमें टेक्स्ट-ओनली प्रश्नोत्तर के लिए SQuAD और प्राकृतिक छवियों के लिए Visual QA शामिल हैं। यह OCR, प्रमुख जानकारी निष्कर्षण और लेआउट विश्लेषण जैसे अन्य दस्तावेज़-विशिष्ट कार्यों से निकटता से संबंधित है। बेंचमार्क ने InfographicVQA और ChartQA जैसे व्युत्पन्न डेटासेट को प्रेरित किया है, जो अधिक विशेष दस्तावेज़ प्रकारों पर केंद्रित हैं। Artificial intelligence और Machine learning के संदर्भ में, DocVQA मल्टीमॉडल प्रणालियों के लिए एक परीक्षण मंच के रूप में कार्य करता है जो Neural network आर्किटेक्चर को एकीकृत करते हैं, विशेष रूप से Transformer (architecture) मॉडल पर आधारित।

दृष्टि क्षमताओं वाले Large language model (LLM) के उदय, जैसे कि OpenAI, Anthropic और Google DeepMind द्वारा विकसित, ने DocVQA में नई रुचि पैदा की है। ये मॉडल, जो अक्सर Encoder-Decoder Architecture या Multi-Head Attention तंत्र पर निर्मित होते हैं, उनकी दस्तावेज़ तर्क क्षमताओं को बेंचमार्क करने के लिए DocVQA पर मूल्यांकन किए जाते हैं। बेंचमार्क का उपयोग Amazon Web Services और Google Cloud जैसी कंपनियों के विशेष दस्तावेज़ AI प्रणालियों के प्रदर्शन का आकलन करने के लिए भी किया गया है, जो दस्तावेज़ प्रसंस्करण सेवाएं प्रदान करते हैं।

चुनौतियां और सीमाएं

व्यापक उपयोग के बावजूद, DocVQA की कई सीमाएं हैं। डेटासेट मुख्य रूप से अंग्रेजी में है, जो बहुभाषी दस्तावेज़ समझ के लिए इसकी प्रयोज्यता को सीमित करता है। दस्तावेज़ अपेक्षाकृत साफ और अच्छी तरह से स्कैन किए गए हैं, जबकि वास्तविक दुनिया के दस्तावेज़ों में अक्सर शोर, हस्तलिखित पाठ या जटिल रंग योजनाएं होती हैं। इसके अतिरिक्त, प्रश्न मानव एनोटेटरों द्वारा उत्पन्न होते हैं और सभी संभावित तर्क प्रकारों को कवर नहीं कर सकते हैं, जो संभावित रूप से मॉडल को कुछ पैटर्न की ओर पक्षपाती बनाते हैं। बेंचमार्क विरोधी गड़बड़ी या डोमेन शिफ्ट के प्रति मजबूती का स्पष्ट रूप से परीक्षण भी नहीं करता है, जो उत्पादन वातावरण में तैनाती के लिए महत्वपूर्ण हैं।

एक और चुनौती उच्च स्कोर प्राप्त करने की कम्प्यूटेशनल लागत है। कई शीर्ष प्रदर्शन करने वाले मॉडल विशाल डेटासेट पर बड़े पैमाने पर प्रीट्रेनिंग पर निर्भर करते हैं, जो सभी शोध समूहों के लिए संभव नहीं है। इसने दस्तावेज़ समझ को अधिक सुलभ बनाने के लिए Model Pruning और Data Augmentation जैसे अधिक कुशल आर्किटेक्चर और प्रशिक्षण विधियों में बढ़ती रुचि पैदा की है।

भविष्य की दिशाएं

दस्तावेज़ विज़ुअल प्रश्नोत्तर का क्षेत्र तेजी से विकसित हो रहा है। भविष्य का काम DocVQA को अन्य भाषाओं और दस्तावेज़ प्रकारों तक विस्तारित करने, अधिक जटिल तर्क कार्यों को शामिल करने और मॉडल व्याख्यात्मकता में सुधार करने पर केंद्रित हो सकता है। शून्य-शॉट और कुछ-शॉट सीखने की दिशा में भी एक धक्का है, जहां मॉडल व्यापक फाइन-ट्यूनिंग के बिना अदृश्य दस्तावेज़ प्रारूपों को सामान्यीकृत कर सकते हैं। जैसे-जैसे Generative AI आगे बढ़ता जा रहा है, DocVQA यह सुनिश्चित करने के लिए एक महत्वपूर्ण बेंचमार्क बना हुआ है कि AI प्रणालियां दुनिया भर के दस्तावेज़ों में संग्रहीत विशाल मात्रा में जानकारी को विश्वसनीय रूप से पढ़ और तर्क कर सकें।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:document-understanding·visual-question-answering·benchmark·multimodal-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास