VQA v2 बड़े पैमाने पर दृश्य प्रश्न उत्तर (VQA) के लिए एक डेटासेट है, जिसमें एक मॉडल को किसी छवि के बारे में प्राकृतिक भाषा के प्रश्न का उत्तर देना होता है। इसे 2017 में मूल VQA डेटासेट के उत्तराधिकारी के रूप में पेश किया गया था, जिसे अपने पूर्ववर्ती को प्रभावित करने वाली भाषा पूर्वाग्रह की समस्या को कम करने के लिए डिज़ाइन किया गया था। इस डेटासेट में 200,000 से अधिक छवियों के बारे में 1.1 मिलियन से अधिक प्रश्न हैं, जिनमें से प्रत्येक प्रश्न एक पूरक छवि के साथ जोड़ा गया है जिसका उत्तर अलग है, जो मॉडल को भाषा पूर्वधारणाओं के बजाय दृश्य जानकारी पर निर्भर रहने के लिए मजबूर करता है।
VQA v2 का निर्माण इस अवलोकन से प्रेरित था कि कई मॉडलों ने VQA v1 पर अच्छा प्रदर्शन किया, जो प्रश्नों में सांख्यिकीय नियमितताओं का फायदा उठाकर किया, बिना वास्तव में छवियों को समझे। उदाहरण के लिए, एक मॉडल छवि सामग्री की परवाह किए बिना अधिकांश 'क्या वहाँ...' प्रश्नों का उत्तर 'हाँ' दे सकता है। इससे निपटने के लिए, VQA v2 डेटासेट को पूरक छवि-प्रश्न जोड़े एकत्र करके बनाया गया था: प्रत्येक प्रश्न के लिए, एक अतिरिक्त छवि का चयन किया गया था ताकि दोनों छवियों में समान प्रश्न का उत्तर अलग हो। यह संतुलित डिज़ाइन उन मॉडलों के विकास को प्रोत्साहित करता है जो दृश्य और पाठ्य तर्क दोनों को एकीकृत करते हैं।
यह डेटासेट Machine learning और Deep learning के क्षेत्रों में एक मानक बेंचमार्क के रूप में व्यापक रूप से उपयोग किया जाता है, विशेष रूप से Neural network आर्किटेक्चर और ध्यान तंत्र का मूल्यांकन करने के लिए। यह बहुविध शिक्षा पर शोध को आगे बढ़ाने में सहायक रहा है, जहां मॉडल को दृश्य विशेषताओं को भाषाई प्रतिनिधित्व के साथ संरेखित करना होता है। कई अत्याधुनिक सिस्टम, जिनमें Transformer (architecture) आर्किटेक्चर और Large language model पर आधारित सिस्टम शामिल हैं, का VQA v2 पर मूल्यांकन किया गया है, जो अक्सर प्राथमिक मीट्रिक के रूप में सटीकता की रिपोर्ट करते हैं।
Dataset Structure
VQA v2 में Microsoft COCO डेटासेट से प्राप्त छवियां शामिल हैं, जिसमें कई वस्तुओं और अंतःक्रियाओं वाले जटिल दृश्य शामिल हैं। प्रत्येक छवि कई प्रश्नों से जुड़ी होती है, और प्रत्येक प्रश्न में मानव एनोटेटरों से एकत्र किए गए 10 ग्राउंड-ट्रुथ उत्तर होते हैं। प्रश्न खुले-अंत वाले होते हैं, जिनमें वस्तु उपस्थिति, रंग, गिनती और स्थानिक संबंध जैसी श्रेणियां शामिल होती हैं। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट को मूल्यांकन उद्देश्यों के लिए परीक्षण-देव और परीक्षण-मानक उपसमूहों में आगे विभाजित किया गया है।
VQA v2 का प्रमुख नवाचार इसकी संतुलित जोड़ी है: प्रत्येक प्रश्न के लिए, डेटासेट में कम से कम एक अन्य छवि मौजूद है जहां उत्तर अलग है। यह सुनिश्चित करता है कि एक मॉडल केवल प्रश्न-उत्तर पैटर्न को याद करके उच्च सटीकता प्राप्त नहीं कर सकता। डेटासेट में लगभग 1.1 मिलियन प्रश्न शामिल हैं, जिसमें प्रशिक्षण सेट में लगभग 250,000 छवियां, सत्यापन सेट में 25,000 और परीक्षण सेट में 25,000 छवियां हैं।
Evaluation Metrics
सटीकता VQA v2 के लिए प्राथमिक मीट्रिक है। प्रत्येक प्रश्न के लिए, एक मॉडल के भविष्यवाणी किए गए उत्तर की तुलना 10 मानव-प्रदत्त उत्तरों से की जाती है। एकल प्रश्न के लिए सटीकता की गणना मानव उत्तरों की संख्या के न्यूनतम मान के रूप में की जाती है जो भविष्यवाणी से मेल खाते हैं, जिसे 3 से विभाजित किया जाता है, और 1 पर सीमित किया जाता है। यह स्कोरिंग योजना उन उत्तरों को पुरस्कृत करती है जिन पर कई एनोटेटर सहमत होते हैं, जिससे मॉडल सामान्य-ज्ञान प्रतिक्रियाएं उत्पन्न करने के लिए प्रोत्साहित होते हैं।
कुल सटीकता के अलावा, परिणाम अक्सर प्रश्न प्रकार के अनुसार रिपोर्ट किए जाते हैं, जैसे 'हाँ/नहीं', 'संख्या', और 'अन्य' (खुले-अंत)। यह विभाजन किसी मॉडल की विशिष्ट ताकत और कमजोरियों की पहचान करने में मदद करता है। उदाहरण के लिए, एक मॉडल हाँ/नहीं प्रश्नों में उत्कृष्ट हो सकता है लेकिन गिनती या स्थानिक संबंधों के बारे में तर्क करने में संघर्ष कर सकता है।
Impact on Research
VQA v2 Computer vision और Natural language processing समुदायों में एक मानक बेंचमार्क बन गया है, हालांकि प्रदान की गई लिंक सूची में उन स्लग शामिल नहीं हैं। इसने कई Deep learning मॉडलों के विकास को प्रेरित किया है, जिनमें ध्यान तंत्र, Residual Network (ResNet) और Multi-Head Attention परतों का उपयोग करने वाले मॉडल शामिल हैं। डेटासेट का उपयोग Data Augmentation तकनीकों और बहुविध कार्यों के लिए तैयार Loss Functions का अध्ययन करने के लिए भी किया गया है।
VQA v2 का संतुलित डिज़ाइन बाद के डेटासेट निर्माण को प्रभावित किया है, जैसे कि Visual Genome और GQA डेटासेट, जो पूर्वाग्रह को कम करने का लक्ष्य भी रखते हैं। शोधकर्ताओं ने VQA v2 का उपयोग रचनात्मक तर्क और दृश्य आधार जैसे क्षेत्रों में मॉडल क्षमताओं का परीक्षण करने के लिए किया है, जिससे वर्तमान Artificial intelligence प्रणालियों की सीमाओं के बारे में अंतर्दृष्टि प्राप्त हुई है।
Limitations and Criticisms
अपने सुधारों के बावजूद, VQA v2 अभी भी कुछ पूर्वाग्रह प्रदर्शित करता है। उदाहरण के लिए, कुछ प्रश्नों का डेटासेट में एक प्रमुख उत्तर हो सकता है, और मॉडल इन पूर्वधारणाओं का लाभ उठा सकते हैं। इसके अतिरिक्त, डेटासेट मुख्य रूप से COCO से स्थिर छवियों पर केंद्रित है, जो वास्तविक दुनिया के दृश्य परिदृश्यों की विविधता को पकड़ नहीं सकता है। कुछ आलोचकों का तर्क है कि प्रश्नों की खुली प्रकृति अस्पष्टता की ओर ले जाती है, और मूल्यांकन मीट्रिक शब्दार्थ रूप से समकक्ष उत्तरों (जैसे, 'कार' बनाम 'ऑटोमोबाइल') के लिए जिम्मेदार नहीं है।
इसके अलावा, डेटासेट की आलोचना की गई है कि इसमें गहन तर्क की आवश्यकता नहीं है; कई प्रश्नों का उत्तर जटिल अनुमान के बिना वस्तुओं या विशेषताओं को पहचानकर दिया जा सकता है। इससे अधिक चुनौतीपूर्ण बेंचमार्क का विकास हुआ है, जैसे कि VQA-CP (बदलती पूर्वधारणाओं के तहत VQA), जो भाषा पूर्वाग्रह को अधिक स्पष्ट रूप से उजागर करने के लिए डेटा को फिर से विभाजित करता है।
Conclusion
VQA v2 बहुविध AI अनुसंधान में एक मौलिक संसाधन बना हुआ है। इसका संतुलित डिज़ाइन डेटासेट निर्माण के लिए एक नया मानक स्थापित करता है, जो उन मॉडलों के विकास को प्रोत्साहित करता है जो वास्तव में दृश्य और पाठ्य जानकारी को एकीकृत करते हैं। जबकि नए बेंचमार्क उभरे हैं, VQA v2 का उपयोग मॉडलों के मूल्यांकन और तुलना के लिए जारी है, और इसका प्रभाव बाद के डेटासेट और कार्यों के डिज़ाइन में स्पष्ट है।