InfographicVQA एक बेंचमार्क डेटासेट है जिसे इन्फोग्राफिक्स पर विज़ुअल प्रश्न उत्तर (VQA) के लिए डिज़ाइन किया गया है। इन्फोग्राफिक्स जटिल विज़ुअल दस्तावेज़ होते हैं जो जानकारी देने के लिए पाठ, चार्ट, आइकन और अन्य ग्राफिकल तत्वों को जोड़ते हैं। प्राकृतिक छवियों के विपरीत, इन्फोग्राफिक्स AI प्रणालियों के लिए अद्वितीय चुनौतियाँ प्रस्तुत करते हैं क्योंकि उन्हें पाठ्य सामग्री, विज़ुअल लेआउट और बार चार्ट, पाई चार्ट और फ्लो डायग्राम जैसे डेटा प्रतिनिधित्व पर संयुक्त तर्क की आवश्यकता होती है। यह डेटासेट 2022 में शोधकर्ताओं द्वारा कृत्रिम बुद्धिमत्ता और मशीन लर्निंग प्रणालियों में मल्टीमॉडल समझ की सीमाओं को आगे बढ़ाने के लिए पेश किया गया था।
InfographicVQA का प्राथमिक लक्ष्य AI मॉडल की उन प्रश्नों का उत्तर देने की क्षमता का मूल्यांकन और सुधार करना है जिनके लिए इन्फोग्राफिक के पाठ्य और ग्राफिकल दोनों घटकों से जानकारी के संश्लेषण की आवश्यकता होती है। उदाहरण के लिए, एक प्रश्न पूछ सकता है, "पाई चार्ट में दिखाए गए नवीकरणीय ऊर्जा स्रोतों का प्रतिशत क्या है?" जिसके लिए मॉडल को चार्ट का पता लगाना, प्रासंगिक डेटा निकालना और उसे प्रश्न के इरादे से मैप करना होता है। यह मानक VQA कार्यों से परे है जो प्राकृतिक छवियों पर केंद्रित हैं, क्योंकि इन्फोग्राफिक्स में अक्सर घनी, संरचित जानकारी होती है जो सामान्य तस्वीरों में मौजूद नहीं होती।
डेटासेट संरचना और एनोटेशन
InfographicVQA डेटासेट में शैक्षिक वेबसाइटों, समाचार लेखों और सरकारी रिपोर्टों सहित विभिन्न सार्वजनिक स्रोतों से एकत्र किए गए 5,000 से अधिक इन्फोग्राफिक्स शामिल हैं। प्रत्येक इन्फोग्राफिक को प्रश्न-उत्तर जोड़ों के एक सेट के साथ जोड़ा गया है, जो कुल 30,000 से अधिक प्रश्न बनाते हैं। प्रश्नों को सरल लुकअप, अंकगणितीय संचालन, तुलना और अनुमान सहित विभिन्न प्रकार के तर्क को कवर करने के लिए डिज़ाइन किया गया है। एनोटेशन मानव एनोटेटरों द्वारा बनाए गए थे जिन्हें ऐसे प्रश्न उत्पन्न करने के निर्देश दिए गए थे जिनके लिए दृश्य और पाठ्य दोनों तत्वों की समझ की आवश्यकता होती है, यह सुनिश्चित करते हुए कि बेंचमार्क केवल-पाठ या केवल-छवि मॉडल द्वारा तुच्छ रूप से हल नहीं किया जा सकता।
डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें प्रशिक्षण के लिए 70%, सत्यापन के लिए 10% और परीक्षण के लिए 20% का विशिष्ट विभाजन है। परीक्षण सेट को ओवरफिटिंग को रोकने के लिए निजी रखा जाता है, और मूल्यांकन एक ऑनलाइन सर्वर के माध्यम से किया जाता है जो सटीक मिलान के आधार पर सटीकता की गणना करता है और साथ ही एक शिथिल मीट्रिक जो समानार्थक शब्दों और व्याख्याओं की अनुमति देता है।
चुनौतियाँ और मूल्यांकन मीट्रिक्स
InfographicVQA AI मॉडल के लिए कई अलग-अलग चुनौतियाँ प्रस्तुत करता है। पहला, इन्फोग्राफिक्स की दृश्य जटिलता के लिए मॉडल को विभिन्न प्रकार के लेआउट, फ़ॉन्ट और रंग योजनाओं को संभालने की आवश्यकता होती है। दूसरा, प्रश्नों में अक्सर बहु-चरणीय तर्क की आवश्यकता होती है, जैसे लेबल पढ़ना, संबंधित डेटा बिंदु का पता लगाना और गणना करना। तीसरा, पाठ और ग्राफिक्स दोनों की उपस्थिति का मतलब है कि मॉडल को कई तौर-तरीकों से जानकारी को प्रभावी ढंग से संयोजित करना चाहिए, जो गहन शिक्षण में एक मुख्य समस्या है।
मूल्यांकन मुख्य रूप से सटीकता पर आधारित है, जिसे उन प्रश्नों के प्रतिशत के रूप में परिभाषित किया गया है जहां मॉडल का अनुमानित उत्तर ग्राउंड ट्रुथ उत्तर से बिल्कुल मेल खाता है। इसके अतिरिक्त, "WUPS" (वू-पामर समानता) नामक एक अधिक उदार मीट्रिक का उपयोग अनुमानित और ग्राउंड ट्रुथ उत्तरों के बीच शब्दार्थ समानता को मापने के लिए किया जाता है, जो आंशिक अंकों की अनुमति देता है। 2024 तक के सबसे उन्नत मॉडल लगभग 50-60% सटीक मिलान सटीकता प्राप्त करते हैं, जो सुधार के लिए महत्वपूर्ण गुंजाइश दर्शाता है।
अन्य VQA बेंचमार्क से संबंध
InfographicVQA VQA बेंचमार्क के व्यापक परिवार का हिस्सा है, लेकिन यह विशेष रूप से दस्तावेज़ समझ के लिए तैयार किया गया है। यह TextVQA जैसे अन्य डेटासेट का पूरक है, जो प्राकृतिक छवियों में पाठ पर केंद्रित है, और DocVQA, जो स्कैन किए गए दस्तावेज़ों को लक्षित करता है। प्रमुख अंतर यह है कि इन्फोग्राफिक्स को दृश्य रूप से आकर्षक और जानकारी-घना बनाने के लिए डिज़ाइन किया गया है, अक्सर डेटा को एन्कोड करने के लिए ग्राफिकल तत्वों का उपयोग करते हैं, जिसके लिए सादा पाठ पढ़ने की तुलना में अलग कौशल की आवश्यकता होती है। यह InfographicVQA को बड़े भाषा मॉडल और ट्रांसफॉर्मर-आधारित आर्किटेक्चर विकसित करने के लिए एक मूल्यवान परीक्षण मंच बनाता है जो संरचित दृश्य जानकारी को संभाल सकते हैं।
अनुप्रयोग और प्रभाव
InfographicVQA पर अच्छा प्रदर्शन करने वाले मॉडलों के विकास के व्यावहारिक अनुप्रयोग हैं जैसे स्वचालित दस्तावेज़ विश्लेषण, दृष्टिबाधित उपयोगकर्ताओं के लिए पहुंच उपकरण और शैक्षिक तकनीक। उदाहरण के लिए, एक AI प्रणाली जो इन्फोग्राफिक के बारे में प्रश्नों का उत्तर दे सकती है, छात्रों को दृश्य सामग्री से सीखने में मदद कर सकती है या पेशेवरों को डेटा-समृद्ध रिपोर्टों से जल्दी से अंतर्दृष्टि निकालने में सहायता कर सकती है। बेंचमार्क ने मल्टी-हेड अटेंशन तंत्र और क्रॉस-अटेंशन तकनीकों में अनुसंधान को भी प्रेरित किया है जो दृश्य और पाठ्य विशेषताओं को संरेखित करने के लिए महत्वपूर्ण हैं।
भविष्य की दिशाएँ
InfographicVQA पर भविष्य के काम में इंटरैक्टिव या एनिमेटेड इन्फोग्राफिक्स जैसे अधिक विविध इन्फोग्राफिक प्रकारों को शामिल करने के लिए डेटासेट का विस्तार करना और बाहरी ज्ञान की आवश्यकता वाले अधिक जटिल तर्क कार्यों को शामिल करना शामिल हो सकता है। इसके अतिरिक्त, ऐसे मॉडल विकसित करने में रुचि है जो न केवल प्रश्नों का उत्तर दे सकें बल्कि अपने उत्तरों के लिए स्पष्टीकरण भी उत्पन्न कर सकें, जो व्याख्या और विश्वास को बढ़ाएगा। जैसे-जैसे जनरेटिव AI आगे बढ़ता जा रहा है, InfographicVQA को तंत्रिका नेटवर्क आर्किटेक्चर के साथ एकीकृत करना जो दृष्टि और भाषा दोनों को एकीकृत तरीके से संभाल सकते हैं, अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है।