अंग्रेज़ी से अनुवादित

इन्फोग्राफिकवीक्यूए (InfographicVQA) इन्फोग्राफिक्स पर दृश्य प्रश्न उत्तरण के लिए एक डेटासेट और बेंचमार्क है, जिसमें मॉडलों को पाठ, ग्राफिक्स और डेटा विज़ुअलाइज़ेशन पर तर्क करने की आवश्यकता होती है। इसे 2022 में मल्टीमॉडल एआई अनुसंधान को आगे बढ़ाने के लिए पेश किया गया था।

InfographicVQA एक बेंचमार्क डेटासेट है जिसे इन्फोग्राफिक्स पर विज़ुअल प्रश्न उत्तर (VQA) के लिए डिज़ाइन किया गया है। इन्फोग्राफिक्स जटिल विज़ुअल दस्तावेज़ होते हैं जो जानकारी देने के लिए पाठ, चार्ट, आइकन और अन्य ग्राफिकल तत्वों को जोड़ते हैं। प्राकृतिक छवियों के विपरीत, इन्फोग्राफिक्स AI प्रणालियों के लिए अद्वितीय चुनौतियाँ प्रस्तुत करते हैं क्योंकि उन्हें पाठ्य सामग्री, विज़ुअल लेआउट और बार चार्ट, पाई चार्ट और फ्लो डायग्राम जैसे डेटा प्रतिनिधित्व पर संयुक्त तर्क की आवश्यकता होती है। यह डेटासेट 2022 में शोधकर्ताओं द्वारा कृत्रिम बुद्धिमत्ता और मशीन लर्निंग प्रणालियों में मल्टीमॉडल समझ की सीमाओं को आगे बढ़ाने के लिए पेश किया गया था।

InfographicVQA का प्राथमिक लक्ष्य AI मॉडल की उन प्रश्नों का उत्तर देने की क्षमता का मूल्यांकन और सुधार करना है जिनके लिए इन्फोग्राफिक के पाठ्य और ग्राफिकल दोनों घटकों से जानकारी के संश्लेषण की आवश्यकता होती है। उदाहरण के लिए, एक प्रश्न पूछ सकता है, "पाई चार्ट में दिखाए गए नवीकरणीय ऊर्जा स्रोतों का प्रतिशत क्या है?" जिसके लिए मॉडल को चार्ट का पता लगाना, प्रासंगिक डेटा निकालना और उसे प्रश्न के इरादे से मैप करना होता है। यह मानक VQA कार्यों से परे है जो प्राकृतिक छवियों पर केंद्रित हैं, क्योंकि इन्फोग्राफिक्स में अक्सर घनी, संरचित जानकारी होती है जो सामान्य तस्वीरों में मौजूद नहीं होती।

डेटासेट संरचना और एनोटेशन

InfographicVQA डेटासेट में शैक्षिक वेबसाइटों, समाचार लेखों और सरकारी रिपोर्टों सहित विभिन्न सार्वजनिक स्रोतों से एकत्र किए गए 5,000 से अधिक इन्फोग्राफिक्स शामिल हैं। प्रत्येक इन्फोग्राफिक को प्रश्न-उत्तर जोड़ों के एक सेट के साथ जोड़ा गया है, जो कुल 30,000 से अधिक प्रश्न बनाते हैं। प्रश्नों को सरल लुकअप, अंकगणितीय संचालन, तुलना और अनुमान सहित विभिन्न प्रकार के तर्क को कवर करने के लिए डिज़ाइन किया गया है। एनोटेशन मानव एनोटेटरों द्वारा बनाए गए थे जिन्हें ऐसे प्रश्न उत्पन्न करने के निर्देश दिए गए थे जिनके लिए दृश्य और पाठ्य दोनों तत्वों की समझ की आवश्यकता होती है, यह सुनिश्चित करते हुए कि बेंचमार्क केवल-पाठ या केवल-छवि मॉडल द्वारा तुच्छ रूप से हल नहीं किया जा सकता।

डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें प्रशिक्षण के लिए 70%, सत्यापन के लिए 10% और परीक्षण के लिए 20% का विशिष्ट विभाजन है। परीक्षण सेट को ओवरफिटिंग को रोकने के लिए निजी रखा जाता है, और मूल्यांकन एक ऑनलाइन सर्वर के माध्यम से किया जाता है जो सटीक मिलान के आधार पर सटीकता की गणना करता है और साथ ही एक शिथिल मीट्रिक जो समानार्थक शब्दों और व्याख्याओं की अनुमति देता है।

चुनौतियाँ और मूल्यांकन मीट्रिक्स

InfographicVQA AI मॉडल के लिए कई अलग-अलग चुनौतियाँ प्रस्तुत करता है। पहला, इन्फोग्राफिक्स की दृश्य जटिलता के लिए मॉडल को विभिन्न प्रकार के लेआउट, फ़ॉन्ट और रंग योजनाओं को संभालने की आवश्यकता होती है। दूसरा, प्रश्नों में अक्सर बहु-चरणीय तर्क की आवश्यकता होती है, जैसे लेबल पढ़ना, संबंधित डेटा बिंदु का पता लगाना और गणना करना। तीसरा, पाठ और ग्राफिक्स दोनों की उपस्थिति का मतलब है कि मॉडल को कई तौर-तरीकों से जानकारी को प्रभावी ढंग से संयोजित करना चाहिए, जो गहन शिक्षण में एक मुख्य समस्या है।

मूल्यांकन मुख्य रूप से सटीकता पर आधारित है, जिसे उन प्रश्नों के प्रतिशत के रूप में परिभाषित किया गया है जहां मॉडल का अनुमानित उत्तर ग्राउंड ट्रुथ उत्तर से बिल्कुल मेल खाता है। इसके अतिरिक्त, "WUPS" (वू-पामर समानता) नामक एक अधिक उदार मीट्रिक का उपयोग अनुमानित और ग्राउंड ट्रुथ उत्तरों के बीच शब्दार्थ समानता को मापने के लिए किया जाता है, जो आंशिक अंकों की अनुमति देता है। 2024 तक के सबसे उन्नत मॉडल लगभग 50-60% सटीक मिलान सटीकता प्राप्त करते हैं, जो सुधार के लिए महत्वपूर्ण गुंजाइश दर्शाता है।

अन्य VQA बेंचमार्क से संबंध

InfographicVQA VQA बेंचमार्क के व्यापक परिवार का हिस्सा है, लेकिन यह विशेष रूप से दस्तावेज़ समझ के लिए तैयार किया गया है। यह TextVQA जैसे अन्य डेटासेट का पूरक है, जो प्राकृतिक छवियों में पाठ पर केंद्रित है, और DocVQA, जो स्कैन किए गए दस्तावेज़ों को लक्षित करता है। प्रमुख अंतर यह है कि इन्फोग्राफिक्स को दृश्य रूप से आकर्षक और जानकारी-घना बनाने के लिए डिज़ाइन किया गया है, अक्सर डेटा को एन्कोड करने के लिए ग्राफिकल तत्वों का उपयोग करते हैं, जिसके लिए सादा पाठ पढ़ने की तुलना में अलग कौशल की आवश्यकता होती है। यह InfographicVQA को बड़े भाषा मॉडल और ट्रांसफॉर्मर-आधारित आर्किटेक्चर विकसित करने के लिए एक मूल्यवान परीक्षण मंच बनाता है जो संरचित दृश्य जानकारी को संभाल सकते हैं।

अनुप्रयोग और प्रभाव

InfographicVQA पर अच्छा प्रदर्शन करने वाले मॉडलों के विकास के व्यावहारिक अनुप्रयोग हैं जैसे स्वचालित दस्तावेज़ विश्लेषण, दृष्टिबाधित उपयोगकर्ताओं के लिए पहुंच उपकरण और शैक्षिक तकनीक। उदाहरण के लिए, एक AI प्रणाली जो इन्फोग्राफिक के बारे में प्रश्नों का उत्तर दे सकती है, छात्रों को दृश्य सामग्री से सीखने में मदद कर सकती है या पेशेवरों को डेटा-समृद्ध रिपोर्टों से जल्दी से अंतर्दृष्टि निकालने में सहायता कर सकती है। बेंचमार्क ने मल्टी-हेड अटेंशन तंत्र और क्रॉस-अटेंशन तकनीकों में अनुसंधान को भी प्रेरित किया है जो दृश्य और पाठ्य विशेषताओं को संरेखित करने के लिए महत्वपूर्ण हैं।

भविष्य की दिशाएँ

InfographicVQA पर भविष्य के काम में इंटरैक्टिव या एनिमेटेड इन्फोग्राफिक्स जैसे अधिक विविध इन्फोग्राफिक प्रकारों को शामिल करने के लिए डेटासेट का विस्तार करना और बाहरी ज्ञान की आवश्यकता वाले अधिक जटिल तर्क कार्यों को शामिल करना शामिल हो सकता है। इसके अतिरिक्त, ऐसे मॉडल विकसित करने में रुचि है जो न केवल प्रश्नों का उत्तर दे सकें बल्कि अपने उत्तरों के लिए स्पष्टीकरण भी उत्पन्न कर सकें, जो व्याख्या और विश्वास को बढ़ाएगा। जैसे-जैसे जनरेटिव AI आगे बढ़ता जा रहा है, InfographicVQA को तंत्रिका नेटवर्क आर्किटेक्चर के साथ एकीकृत करना जो दृष्टि और भाषा दोनों को एकीकृत तरीके से संभाल सकते हैं, अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·visual-question-answering·multimodal-ai·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास