विज़ुअल क्वेश्चन आंसरिंग (VQA) एक कृत्रिम बुद्धिमत्ता कार्य है जिसमें एक प्रणाली को किसी छवि के बारे में प्राकृतिक भाषा के प्रश्नों का उत्तर देना होता है। यह कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण के प्रतिच्छेदन पर स्थित है, जिसके लिए मॉडल को न केवल छवि में वस्तुओं, दृश्यों और गतिविधियों को पहचानना होता है, बल्कि प्रश्न के अर्थ को भी समझना होता है और सही उत्तर उत्पन्न करने के लिए दृश्य सामग्री पर तर्क करना होता है। VQA को उच्च-स्तरीय दृश्य समझ और तर्क के लिए एक बेंचमार्क माना जाता है, जो सरल छवि वर्गीकरण या कैप्शनिंग से परे जाता है।
इस कार्य में आमतौर पर एक इनपुट छवि और मुक्त-पाठ रूप में एक प्रश्न शामिल होता है, जिसका अपेक्षित आउटपुट एक संक्षिप्त उत्तर होता है, जो अक्सर एक शब्द या छोटा वाक्यांश होता है। VQA प्रणालियों को विभिन्न प्रकार के प्रश्नों को संभालना होता है, जिनमें वस्तु की उपस्थिति, रंग, गिनती, स्थानिक संबंध, और यहां तक कि सामान्य ज्ञान तर्क से संबंधित प्रश्न शामिल हैं जो सीधे दिखाई देने वाली चीज़ों से परे जाते हैं। इस क्षेत्र ने 2010 के दशक के मध्य में बड़े पैमाने पर डेटासेट के जारी होने और गहन शिक्षण तकनीकों के अनुप्रयोग के साथ महत्वपूर्ण गति प्राप्त की, और तब से यह मल्टीमॉडल AI मॉडल के लिए एक मानक मूल्यांकन बन गया है।
डेटासेट और बेंचमार्क
VQA डेटासेट, जिसे पहली बार 2015 में वर्जीनिया टेक और माइक्रोसॉफ्ट के शोधकर्ताओं द्वारा जारी किया गया था, इस कार्य के लिए वास्तविक मानक बेंचमार्क बन गया। मूल VQA डेटासेट में माइक्रोसॉफ्ट COCO डेटासेट से 200,000 से अधिक छवियां और 600,000 से अधिक प्रश्न शामिल थे, जिनमें प्रत्येक प्रश्न मानव एनोटेटरों से एकत्रित कई ग्राउंड-ट्रुथ उत्तरों के साथ जोड़ा गया था। डेटासेट को विभिन्न कौशलों की आवश्यकता के लिए डिज़ाइन किया गया था, जिसमें वस्तु पहचान, गिनती और स्थानिक तर्क शामिल हैं। बाद के संस्करण, जैसे कि VQA 2.0, ने भाषा पूर्वाग्रहों को कम करने के लिए उत्तर वितरण को संतुलित किया, जहां मॉडल छवि को देखे बिना केवल प्रश्न पैटर्न के आधार पर उत्तरों का अनुमान लगा सकते थे। अन्य उल्लेखनीय बेंचमार्क में विज़ुअल जीनोम शामिल है, जो वस्तुओं, विशेषताओं और संबंधों के घने एनोटेशन प्रदान करता है, और CLEVR, एक सिंथेटिक डेटासेट है जो सरल 3D आकृतियों की छवियां उत्पन्न करके और बहु-चरणीय तर्क की आवश्यकता वाले प्रश्न पूछकर रचनात्मक तर्क का परीक्षण करने के लिए डिज़ाइन किया गया है।
दृष्टिकोण और आर्किटेक्चर
प्रारंभिक VQA प्रणालियों ने छवि सुविधा निष्कर्षण के लिए कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) और प्रश्न एन्कोडिंग के लिए आवर्तक न्यूरल नेटवर्क (RNN) या लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) नेटवर्क का संयोजन उपयोग किया। इन सुविधाओं को फिर अक्सर तत्व-वार गुणन या संयोजन के माध्यम से जोड़ा जाता था, और उत्तर की भविष्यवाणी करने के लिए एक क्लासिफायर के माध्यम से पारित किया जाता था। एक प्रमुख सफलता ध्यान तंत्रों की शुरुआत के साथ आई, जिसने मॉडल को प्रश्न के आधार पर छवि के प्रासंगिक क्षेत्रों पर ध्यान केंद्रित करने की अनुमति दी। 2017 में पेश किया गया ट्रांसफॉर्मर आर्किटेक्चर, दृश्य और पाठ्य टोकन के एकीकृत प्रसंस्करण को सक्षम करके इस क्षेत्र में और क्रांति लेकर आया। आधुनिक VQA मॉडल, जैसे कि विज़न-भाषा प्रीट्रेनिंग पर आधारित, छवि-पाठ जोड़ों पर प्रीट्रेन किए गए बड़े पैमाने के ट्रांसफॉर्मर मॉडल का उपयोग करते हैं और फिर VQA डेटासेट पर फाइन-ट्यून किए जाते हैं। ये मॉडल, जो अक्सर बड़े भाषा मॉडल के साथ एकीकृत होते हैं, मुक्त-रूप उत्तर उत्पन्न कर सकते हैं और जटिल तर्क कर सकते हैं, कभी-कभी VQA डेटा पर स्पष्ट फाइन-ट्यूनिंग के बिना भी।
चुनौतियाँ और सीमाएँ
महत्वपूर्ण प्रगति के बावजूद, VQA एक चुनौतीपूर्ण कार्य बना हुआ है। एक प्रमुख मुद्दा भाषा पूर्वाग्रह है: मॉडल छवि को वास्तव में समझे बिना प्रश्नों का उत्तर देने के लिए प्रशिक्षण डेटा में सांख्यिकीय नियमितताओं का शोषण कर सकते हैं। उदाहरण के लिए, एक मॉडल "कितने" से शुरू होने वाले प्रश्नों के लिए "2" का उत्तर दे सकता है क्योंकि यह डेटासेट में सबसे आम उत्तर है। VQA 2.0 डेटासेट को यह सुनिश्चित करके इसे कम करने के लिए बनाया गया था कि प्रत्येक प्रश्न में विभिन्न उत्तरों वाली पूरक छवियां हों। एक और चुनौती रचनात्मक सामान्यीकरण है, जहां मॉडल उन प्रश्नों का उत्तर देने में संघर्ष करते हैं जिनके लिए ज्ञात अवधारणाओं के नए संयोजनों की आवश्यकता होती है। इसके अतिरिक्त, VQA प्रणालियां अक्सर बाहरी ज्ञान या सामान्य ज्ञान तर्क की आवश्यकता वाले प्रश्नों पर विफल हो जाती हैं, जैसे "व्यक्ति क्यों मुस्कुरा रहा है?" या "आगे क्या होगा?" प्रतिकूल उदाहरणों और वितरण से बाहर की छवियों के प्रति मजबूती भी एक चिंता का विषय है, क्योंकि मॉडल मामूली परिवर्तनों से आसानी से धोखा खा सकते हैं।
अनुप्रयोग
VQA के विभिन्न क्षेत्रों में व्यावहारिक अनुप्रयोग हैं। पहुंच में, यह दृष्टिबाधित व्यक्तियों को उनके आस-पास के बारे में प्रश्नों का उत्तर देकर सहायता कर सकता है, जैसे संकेत पढ़ना या वस्तुओं की पहचान करना। मानव-कंप्यूटर संपर्क में, VQA अधिक प्राकृतिक इंटरफेस सक्षम करता है जहां उपयोगकर्ता चैट या खोज प्रणालियों में छवियों के बारे में प्रश्न पूछ सकते हैं। स्वास्थ्य सेवा में, VQA रेडियोलॉजिस्टों को चिकित्सा छवियों के बारे में प्रश्नों का उत्तर देकर सहायता कर सकता है, हालांकि इसके लिए विशेष प्रशिक्षण और सावधानीपूर्वक सत्यापन की आवश्यकता होती है। ई-कॉमर्स में, VQA दृश्य खोज और उत्पाद अनुशंसा प्रणालियों को शक्ति प्रदान कर सकता है। यह तकनीक स्वायत्त ड्राइविंग में भी उपयोग की जाती है, जहां प्रणालियों को "क्या ट्रैफिक लाइट लाल है?" या "क्या कोई पैदल यात्री सड़क पार कर रहा है?" जैसे प्रश्नों का उत्तर देने के लिए दृश्य दृश्यों को समझना और उन पर तर्क करना होता है।
हाल के विकास
OpenAI, गूगल डीपमाइंड, और अन्य शोध प्रयोगशालाओं द्वारा विकसित बड़े मल्टीमॉडल मॉडल के उदय ने VQA क्षमताओं को काफी उन्नत किया है। ये मॉडल, जो अक्सर ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित होते हैं और छवियों और पाठ के विशाल डेटासेट पर प्रशिक्षित होते हैं, उच्च सटीकता के साथ प्रश्नों का उत्तर दे सकते हैं और स्पष्टीकरण भी प्रदान कर सकते हैं। उदाहरण के लिए, GPT-4V और जेमिनी जैसे मॉडलों ने मानक VQA बेंचमार्क पर मजबूत प्रदर्शन दिखाया है, कभी-कभी कुछ कार्यों पर मानव-स्तर की सटीकता के करीब पहुंचते हैं। हालांकि, ये मॉडल सीमाओं से रहित नहीं हैं, और वे अभी भी पूर्वाग्रह या मतिभ्रम प्रदर्शित कर सकते हैं। यह क्षेत्र विकसित होता जा रहा है, जिसमें शोध तर्क क्षमताओं में सुधार, पूर्वाग्रहों को कम करने और मॉडलों को अधिक व्याख्यात्मक और मजबूत बनाने पर केंद्रित है। 2025 तक, VQA अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, जिसमें दृश्य समझ की सीमाओं को आगे बढ़ाने के लिए नए बेंचमार्क और चुनौतियां पेश की जा रही हैं।