OK-VQA (आउटसाइड नॉलेज विज़ुअल क्वेश्चन आंसरिंग) विज़ुअल क्वेश्चन आंसरिंग (VQA) प्रणालियों के मूल्यांकन के लिए एक बेंचमार्क डेटासेट है। पहले के VQA डेटासेट के विपरीत, जो केवल छवि से उत्तर देने योग्य प्रश्नों पर केंद्रित होते हैं, OK-VQA विशेष रूप से मॉडलों से अपेक्षा करता है कि वे सही उत्तर उत्पन्न करने के लिए वस्तुओं, दृश्यों और रोज़मर्रा की अवधारणाओं के बारे में बाहरी ज्ञान को शामिल करें। यह डेटासेट 2019 में जॉर्जिया इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं द्वारा पेश किया गया था, जिनमें केनेथ मारिनो, मोहम्मद रस्तेगारी, अली फरहादी और रूज़बे मोत्ताघी शामिल थे, और तब से यह ज्ञान-संवर्धित विज़ुअल-भाषा मॉडलों के अध्ययन के लिए एक मानक परीक्षण मंच बन गया है।
इस बेंचमार्क में 14,031 प्रश्न शामिल हैं, जो 14,031 छवियों के साथ जोड़े गए हैं, और प्रत्येक छवि के साथ ठीक एक प्रश्न जुड़ा है। प्रश्नों को स्पष्ट और असंदिग्ध बनाने के लिए डिज़ाइन किया गया है, और उन्हें ऐसे बाहरी ज्ञान की आवश्यकता होती है जो दृश्य रूप से मौजूद नहीं है। उदाहरण के लिए, एक प्रश्न पूछ सकता है "यह किस प्रकार का जानवर है?" जब छवि में कोई आंशिक रूप से अस्पष्ट प्राणी दिखाई देता है, या किसी अपरिचित वस्तु के लिए "इस उपकरण का उद्देश्य क्या है?"। यह डेटासेट भोजन, जानवरों, वाहनों, खेल और घरेलू वस्तुओं सहित ज्ञान के व्यापक क्षेत्रों को कवर करता है, जिससे विविधता सुनिश्चित होती है और मॉडलों को वास्तविक दुनिया के संदर्भ के बारे में तर्क करने की चुनौती मिलती है।
निर्माण और एनोटेशन
OK-VQA को अमेज़न मैकेनिकल टर्क श्रमिकों से क्राउडसोर्सिंग के माध्यम से बनाया गया था। एनोटेशन प्रक्रिया में श्रमिकों को एक छवि दिखाना और उनसे एक ऐसा प्रश्न उत्पन्न करने के लिए कहना शामिल था जिसका उत्तर केवल छवि को देखकर नहीं दिया जा सकता था, बल्कि सामान्य ज्ञान या तथ्यात्मक ज्ञान की आवश्यकता होती थी। गुणवत्ता सुनिश्चित करने के लिए, प्रत्येक प्रश्न को कई एनोटेटरों द्वारा मान्य किया गया था, और केवल उच्च अंतर-एनोटेटर सहमति वाले प्रश्नों को बनाए रखा गया था। अंतिम डेटासेट को फिर प्रशिक्षण (9,009 प्रश्न), सत्यापन (2,016 प्रश्न) और परीक्षण (3,006 प्रश्न) सेटों में विभाजित किया गया था। परीक्षण सेट का उपयोग एक ऑनलाइन सर्वर के माध्यम से आधिकारिक मूल्यांकन के लिए किया जाता है, जिसमें सटीकता प्राथमिक मीट्रिक होती है।
मूल्यांकन और मीट्रिक्स
OK-VQA के लिए मानक मूल्यांकन मीट्रिक सटीक-मिलान सटीकता है, जहां एक मॉडल के अनुमानित उत्तर को सही माना जाता है यदि यह ग्राउंड-ट्रूथ उत्तरों में से एक से बिल्कुल मेल खाता है। प्रत्येक प्रश्न में विभिन्न एनोटेटरों द्वारा प्रदान किए गए 10 ग्राउंड-ट्रूथ उत्तर होते हैं, और एक भविष्यवाणी को सही माना जाता है यदि यह उनमें से किसी से मेल खाती है। यह दृष्टिकोण मनुष्यों द्वारा उत्तरों को व्यक्त करने के तरीके में भिन्नता को ध्यान में रखता है। मॉडलों का आमतौर पर परीक्षण सेट पर मूल्यांकन किया जाता है, लेकिन शोधकर्ता अक्सर विकास और हाइपरपैरामीटर ट्यूनिंग के लिए सत्यापन सेट का उपयोग करते हैं।
चुनौतियाँ और सीमाएँ
OK-VQA AI प्रणालियों के लिए कई चुनौतियाँ प्रस्तुत करता है। पहला, इसके लिए दृश्य जानकारी को विश्व ज्ञान के व्यापक आधार के साथ एकीकृत करने की आवश्यकता होती है, जो मुख्य रूप से छवि-पाठ जोड़ों पर प्रशिक्षित मॉडलों के लिए कठिन है। दूसरा, कई प्रश्न अस्पष्ट होते हैं या निहित संदर्भ के बारे में तर्क करने की आवश्यकता होती है, जैसे सांस्कृतिक प्रथाओं या भौतिक गुणों को समझना। तीसरा, डेटासेट की आलोचना की गई है क्योंकि डिज़ाइन के इरादे के बावजूद इसमें कुछ ऐसे प्रश्न शामिल हैं जिनका उत्तर केवल छवि से दिया जा सकता है, और अन्य VQA बेंचमार्क की तुलना में इसका आकार अपेक्षाकृत छोटा है। इसके अतिरिक्त, सटीक-मिलान मीट्रिक कठोर हो सकती है, जो अर्थगत रूप से सही लेकिन अलग ढंग से शब्दबद्ध उत्तरों को दंडित करती है।
प्रभाव और उपयोग
OK-VQA Machine learning और कंप्यूटर विज़न के क्षेत्रों में एक व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बन गया है। इसे शोधकर्ताओं द्वारा उन मॉडलों का मूल्यांकन करने के लिए अपनाया गया है जो दृश्य एनकोडर को बड़े-भाषा-मॉडल के साथ जोड़ते हैं, अक्सर छवि और पाठ प्रतिनिधित्व को संलयन करने के लिए क्रॉस-अटेंशन जैसी तकनीकों का उपयोग करते हैं। कई अत्याधुनिक विज़ुअल-भाषा मॉडल, जिनमें ट्रांसफॉर्मर आर्किटेक्चर पर आधारित मॉडल शामिल हैं, ज्ञान-आधारित तर्क करने की अपनी क्षमता के प्रमुख संकेतक के रूप में OK-VQA पर प्रदर्शन की रिपोर्ट करते हैं। इस डेटासेट ने ज्ञान पुनर्प्राप्ति और एकीकरण के लिए विशेष तरीकों के विकास को भी प्रोत्साहित किया है, जैसे बाहरी ज्ञान आधारों को शामिल करना या सामान्यीकरण में सुधार के लिए डेटा-वर्धन तकनीकों का उपयोग करना।
संबंधित बेंचमार्क
OK-VQA VQA बेंचमार्क के व्यापक परिवार का हिस्सा है। मूल VQA डेटासेट, जिसे 2015 में पेश किया गया था, छवि सामग्री से उत्तर देने योग्य प्रश्नों पर केंद्रित है। अन्य संबंधित बेंचमार्क में विज़ुअल जीनोम शामिल है, जो संबंधों और विशेषताओं पर जोर देता है, और GQA, जो संरचनात्मक तर्क का परीक्षण करता है। A-OKVQA जैसे हालिया बेंचमार्क अतिरिक्त उत्तर विकल्प और तर्क एनोटेशन प्रदान करके OK-VQA का विस्तार करते हैं। OK-VQA बाहरी ज्ञान पर अपने स्पष्ट फोकस में अद्वितीय बना हुआ है, जो इसे AI में धारणा और तर्क के प्रतिच्छेदन का अध्ययन करने के लिए एक विशेष संसाधन बनाता है।