अंग्रेज़ी से अनुवादित

VQA 1.0 मूल दृश्य प्रश्न उत्तर डेटासेट और बेंचमार्क है, जिसे 2015 में पेश किया गया था ताकि छवियों के बारे में प्राकृतिक भाषा प्रश्नों का उत्तर देने की AI प्रणालियों की क्षमता का मूल्यांकन किया जा सके।

VQA 1.0 दृश्य प्रश्न उत्तरण (VQA) के लिए पहला बड़े पैमाने का डेटासेट और बेंचमार्क है, जो एक ऐसा कार्य है जिसमें AI प्रणाली को छवियों के बारे में खुले-अंत वाले प्रश्नों का उत्तर देना होता है। 2015 में वर्जीनिया टेक और माइक्रोसॉफ्ट के शोधकर्ताओं द्वारा प्रस्तुत, यह इस क्षेत्र के लिए मानक मूल्यांकन सेट बन गया, जिसने कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण के संयोजन में प्रगति को बढ़ावा दिया। डेटासेट में मानव-एनोटेटेड प्रश्नों और उत्तरों के साथ वास्तविक तस्वीरें शामिल हैं, जिन्हें दृश्य सामग्री और भाषा के बारे में तर्क करने की मॉडल की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है।

VQA 1.0 का निर्माण AI प्रणालियों को विकसित करने के लक्ष्य से प्रेरित था जो मानव-समान तरीके से दृश्य दुनिया के साथ बातचीत कर सकें। छवि कैप्शनिंग जैसे पहले के कार्यों के विपरीत, जो एक एकल वर्णनात्मक वाक्य उत्पन्न करते हैं, VQA के लिए विशिष्ट प्रश्नों का उत्तर देना आवश्यक है, जिसके लिए गहरी समझ और तर्क की मांग होती है। डेटासेट का डिज़ाइन मॉडल को विभिन्न प्रकार के प्रश्नों को संभालने के लिए प्रोत्साहित करता है, जिसमें हाँ/नहीं, गिनती, और खुले-अंत वाले प्रश्न शामिल हैं, और उनके उत्तरों को दृश्य साक्ष्य पर आधारित करना होता है।

डेटासेट संरचना और आँकड़े

VQA 1.0 में माइक्रोसॉफ्ट COCO डेटासेट की 204,721 छवियाँ शामिल हैं, जिनके साथ 614,163 प्रश्न और 6,141,630 उत्तर जुड़े हैं। प्रत्येक छवि लगभग तीन प्रश्नों से जुड़ी है, और प्रत्येक प्रश्न में विभिन्न मानव एनोटेटरों द्वारा दिए गए दस ग्राउंड-ट्रुथ उत्तर हैं। प्रश्न खुले-अंत वाले हैं, जिनमें वस्तुओं, रंगों, गिनती और स्थानिक संबंधों जैसी श्रेणियाँ शामिल हैं। डेटासेट को प्रशिक्षण (82,783 छवियाँ), सत्यापन (40,504 छवियाँ), और परीक्षण (81,434 छवियाँ) सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट को मूल्यांकन के लिए test-dev और test-standard में आगे विभाजित किया गया है।

कार्य परिभाषा और मूल्यांकन

VQA में, एक मॉडल को एक छवि और एक प्राकृतिक भाषा प्रश्न प्राप्त होता है, और उसे एक संक्षिप्त उत्तर उत्पन्न करना होता है। मूल्यांकन मीट्रिक सटीकता है, जिसकी गणना मॉडल के उत्तर की तुलना दस मानव उत्तरों से करके की जाती है। मॉडल का उत्तर सही माना जाता है यदि दस मानव उत्तरों में से कम से कम तीन उससे बिल्कुल मेल खाते हैं। यह मीट्रिक, जिसे VQA सटीकता के रूप में जाना जाता है, वाक्यांशन में मानव परिवर्तनशीलता को ध्यान में रखने के लिए डिज़ाइन किया गया था। बेंचमार्क 'प्रति-प्रश्न-प्रकार' विवरणों का एक सेट भी प्रदान करता है, जिससे शोधकर्ता 'कौन सा रंग' या 'कितने' जैसी विशिष्ट श्रेणियों पर प्रदर्शन का विश्लेषण कर सकते हैं।

बेसलाइन मॉडल और प्रारंभिक प्रगति

VQA 1.0 के लिए प्रारंभिक बेसलाइन में सरल दृष्टिकोण शामिल थे, जैसे निकटतम-पड़ोसी पुनर्प्राप्ति और एक 'पूर्व' मॉडल जो किसी दिए गए प्रश्न प्रकार के लिए सबसे सामान्य उत्तर की भविष्यवाणी करता है। इन बेसलाइनों ने लगभग 30-40% की सटीकता हासिल की। पहले तंत्रिका मॉडल, जिन्होंने छवि सुविधाओं के लिए कन्वोल्यूशनल तंत्रिका नेटवर्क को प्रश्न एन्कोडिंग के लिए आवर्तक तंत्रिका नेटवर्क के साथ जोड़ा, ने प्रदर्शन में लगभग 55-60% तक सुधार किया। इन प्रारंभिक प्रणालियों ने प्रश्नों को संसाधित करने के लिए LSTM नेटवर्क और शब्द एम्बेडिंग का उपयोग किया, और एक पूर्व-प्रशिक्षित VGG नेटवर्क से छवि सुविधाएँ निकालीं। मानव प्रदर्शन (लगभग 83%) और मशीन प्रदर्शन के बीच का अंतर कार्य की कठिनाई को उजागर करता है।

प्रभाव और विरासत

VQA 1.0 ने VQA कार्य को कृत्रिम बुद्धिमत्ता में एक मुख्य चुनौती के रूप में स्थापित किया, जिससे कई अनुवर्ती डेटासेट और मॉडलों के विकास को बढ़ावा मिला। इसने VQA 2.0 के निर्माण का नेतृत्व किया, जिसने भाषा पूर्वाग्रहों को कम करने के लिए उत्तर वितरण को संतुलित किया, और विज़ुअल जीनोम, जिसने क्षेत्र-स्तरीय एनोटेशन जोड़े। डेटासेट ने GQA और CLEVR जैसे बाद के बेंचमार्क के डिज़ाइन को भी प्रभावित किया, जो रचनात्मक तर्क पर केंद्रित हैं। VQA 1.0 दृश्य तर्क क्षमताओं के मूल्यांकन के लिए एक संदर्भ बिंदु बना हुआ है, और इसकी पद्धति को कई बाद के मल्टीमॉडल बेंचमार्क में अपनाया गया है।

VQA 1.0 की रिलीज़ गहन शिक्षण और ट्रांसफॉर्मर वास्तुकला के उदय के साथ मेल खाती है, जो बाद में मल्टीमॉडल मॉडलों में प्रमुख बन गई। आधुनिक प्रणालियाँ, जैसे कि दृश्य एन्कोडर के साथ बड़े भाषा मॉडल पर आधारित, अब VQA 1.0 पर लगभग मानव-स्तरीय प्रदर्शन प्राप्त करती हैं, लेकिन डेटासेट की विरासत दृश्य तर्क और आधारित भाषा समझ में अनुसंधान के लिए उत्प्रेरक के रूप में इसकी भूमिका में निहित है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·computer-vision·natural-language-processing·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास