अंग्रेज़ी से अनुवादित

OK-VQA एक दृश्य प्रश्न उत्तर बेंचमार्क है जिसे AI प्रणालियों की छवि सामग्री से परे बाहरी ज्ञान की आवश्यकता वाले प्रश्नों के उत्तर देने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें 14,031 छवियों पर 14,031 प्रश्न शामिल हैं।

OK-VQA (आउटसाइड नॉलेज विज़ुअल क्वेश्चन आंसरिंग) विज़ुअल क्वेश्चन आंसरिंग (VQA) प्रणालियों के मूल्यांकन के लिए एक बेंचमार्क डेटासेट है। पहले के VQA डेटासेट के विपरीत, जो केवल छवि से उत्तर देने योग्य प्रश्नों पर केंद्रित होते हैं, OK-VQA विशेष रूप से मॉडलों से अपेक्षा करता है कि वे सही उत्तर उत्पन्न करने के लिए वस्तुओं, दृश्यों और रोज़मर्रा की अवधारणाओं के बारे में बाहरी ज्ञान को शामिल करें। यह डेटासेट 2019 में जॉर्जिया इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं द्वारा पेश किया गया था, जिनमें केनेथ मारिनो, मोहम्मद रस्तेगारी, अली फरहादी और रूज़बे मोत्ताघी शामिल थे, और तब से यह ज्ञान-संवर्धित विज़ुअल-भाषा मॉडलों के अध्ययन के लिए एक मानक परीक्षण मंच बन गया है।

इस बेंचमार्क में 14,031 प्रश्न शामिल हैं, जो 14,031 छवियों के साथ जोड़े गए हैं, और प्रत्येक छवि के साथ ठीक एक प्रश्न जुड़ा है। प्रश्नों को स्पष्ट और असंदिग्ध बनाने के लिए डिज़ाइन किया गया है, और उन्हें ऐसे बाहरी ज्ञान की आवश्यकता होती है जो दृश्य रूप से मौजूद नहीं है। उदाहरण के लिए, एक प्रश्न पूछ सकता है "यह किस प्रकार का जानवर है?" जब छवि में कोई आंशिक रूप से अस्पष्ट प्राणी दिखाई देता है, या किसी अपरिचित वस्तु के लिए "इस उपकरण का उद्देश्य क्या है?"। यह डेटासेट भोजन, जानवरों, वाहनों, खेल और घरेलू वस्तुओं सहित ज्ञान के व्यापक क्षेत्रों को कवर करता है, जिससे विविधता सुनिश्चित होती है और मॉडलों को वास्तविक दुनिया के संदर्भ के बारे में तर्क करने की चुनौती मिलती है।

निर्माण और एनोटेशन

OK-VQA को अमेज़न मैकेनिकल टर्क श्रमिकों से क्राउडसोर्सिंग के माध्यम से बनाया गया था। एनोटेशन प्रक्रिया में श्रमिकों को एक छवि दिखाना और उनसे एक ऐसा प्रश्न उत्पन्न करने के लिए कहना शामिल था जिसका उत्तर केवल छवि को देखकर नहीं दिया जा सकता था, बल्कि सामान्य ज्ञान या तथ्यात्मक ज्ञान की आवश्यकता होती थी। गुणवत्ता सुनिश्चित करने के लिए, प्रत्येक प्रश्न को कई एनोटेटरों द्वारा मान्य किया गया था, और केवल उच्च अंतर-एनोटेटर सहमति वाले प्रश्नों को बनाए रखा गया था। अंतिम डेटासेट को फिर प्रशिक्षण (9,009 प्रश्न), सत्यापन (2,016 प्रश्न) और परीक्षण (3,006 प्रश्न) सेटों में विभाजित किया गया था। परीक्षण सेट का उपयोग एक ऑनलाइन सर्वर के माध्यम से आधिकारिक मूल्यांकन के लिए किया जाता है, जिसमें सटीकता प्राथमिक मीट्रिक होती है।

मूल्यांकन और मीट्रिक्स

OK-VQA के लिए मानक मूल्यांकन मीट्रिक सटीक-मिलान सटीकता है, जहां एक मॉडल के अनुमानित उत्तर को सही माना जाता है यदि यह ग्राउंड-ट्रूथ उत्तरों में से एक से बिल्कुल मेल खाता है। प्रत्येक प्रश्न में विभिन्न एनोटेटरों द्वारा प्रदान किए गए 10 ग्राउंड-ट्रूथ उत्तर होते हैं, और एक भविष्यवाणी को सही माना जाता है यदि यह उनमें से किसी से मेल खाती है। यह दृष्टिकोण मनुष्यों द्वारा उत्तरों को व्यक्त करने के तरीके में भिन्नता को ध्यान में रखता है। मॉडलों का आमतौर पर परीक्षण सेट पर मूल्यांकन किया जाता है, लेकिन शोधकर्ता अक्सर विकास और हाइपरपैरामीटर ट्यूनिंग के लिए सत्यापन सेट का उपयोग करते हैं।

चुनौतियाँ और सीमाएँ

OK-VQA AI प्रणालियों के लिए कई चुनौतियाँ प्रस्तुत करता है। पहला, इसके लिए दृश्य जानकारी को विश्व ज्ञान के व्यापक आधार के साथ एकीकृत करने की आवश्यकता होती है, जो मुख्य रूप से छवि-पाठ जोड़ों पर प्रशिक्षित मॉडलों के लिए कठिन है। दूसरा, कई प्रश्न अस्पष्ट होते हैं या निहित संदर्भ के बारे में तर्क करने की आवश्यकता होती है, जैसे सांस्कृतिक प्रथाओं या भौतिक गुणों को समझना। तीसरा, डेटासेट की आलोचना की गई है क्योंकि डिज़ाइन के इरादे के बावजूद इसमें कुछ ऐसे प्रश्न शामिल हैं जिनका उत्तर केवल छवि से दिया जा सकता है, और अन्य VQA बेंचमार्क की तुलना में इसका आकार अपेक्षाकृत छोटा है। इसके अतिरिक्त, सटीक-मिलान मीट्रिक कठोर हो सकती है, जो अर्थगत रूप से सही लेकिन अलग ढंग से शब्दबद्ध उत्तरों को दंडित करती है।

प्रभाव और उपयोग

OK-VQA Machine learning और कंप्यूटर विज़न के क्षेत्रों में एक व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बन गया है। इसे शोधकर्ताओं द्वारा उन मॉडलों का मूल्यांकन करने के लिए अपनाया गया है जो दृश्य एनकोडर को बड़े-भाषा-मॉडल के साथ जोड़ते हैं, अक्सर छवि और पाठ प्रतिनिधित्व को संलयन करने के लिए क्रॉस-अटेंशन जैसी तकनीकों का उपयोग करते हैं। कई अत्याधुनिक विज़ुअल-भाषा मॉडल, जिनमें ट्रांसफॉर्मर आर्किटेक्चर पर आधारित मॉडल शामिल हैं, ज्ञान-आधारित तर्क करने की अपनी क्षमता के प्रमुख संकेतक के रूप में OK-VQA पर प्रदर्शन की रिपोर्ट करते हैं। इस डेटासेट ने ज्ञान पुनर्प्राप्ति और एकीकरण के लिए विशेष तरीकों के विकास को भी प्रोत्साहित किया है, जैसे बाहरी ज्ञान आधारों को शामिल करना या सामान्यीकरण में सुधार के लिए डेटा-वर्धन तकनीकों का उपयोग करना।

संबंधित बेंचमार्क

OK-VQA VQA बेंचमार्क के व्यापक परिवार का हिस्सा है। मूल VQA डेटासेट, जिसे 2015 में पेश किया गया था, छवि सामग्री से उत्तर देने योग्य प्रश्नों पर केंद्रित है। अन्य संबंधित बेंचमार्क में विज़ुअल जीनोम शामिल है, जो संबंधों और विशेषताओं पर जोर देता है, और GQA, जो संरचनात्मक तर्क का परीक्षण करता है। A-OKVQA जैसे हालिया बेंचमार्क अतिरिक्त उत्तर विकल्प और तर्क एनोटेशन प्रदान करके OK-VQA का विस्तार करते हैं। OK-VQA बाहरी ज्ञान पर अपने स्पष्ट फोकस में अद्वितीय बना हुआ है, जो इसे AI में धारणा और तर्क के प्रतिच्छेदन का अध्ययन करने के लिए एक विशेष संसाधन बनाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:visual-question-answering·benchmark·computer-vision·dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास