Visual7W एक दृश्य प्रश्न उत्तर (VQA) और दृश्य ग्राउंडिंग के लिए एक बेंचमार्क डेटासेट है, जिसे पहली बार 2016 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा प्रस्तुत किया गया था। इसमें Microsoft COCO से प्राप्त 47,300 वास्तविक-विश्व छवियाँ और 327,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनमें से प्रत्येक एक या अधिक बाउंडिंग बॉक्स के साथ जुड़ा है जो उत्तर का समर्थन करने वाले दृश्य साक्ष्य को स्थानीयकृत करते हैं। यह डेटासेट ग्राउंडिंग पर अपने जोर के लिए उल्लेखनीय है, जिसके लिए मॉडलों को न केवल प्रश्नों का उत्तर देना होता है, बल्कि प्रासंगिक छवि क्षेत्रों की पहचान भी करनी होती है - यह क्षमता व्याख्यात्मक AI प्रणालियों के लिए केंद्रीय है।
Visual7W नाम सात प्रकार के प्रश्नों से लिया गया है जिन्हें यह कवर करता है: क्या, कहाँ, कब, कौन, क्यों, और कैसे, जिसमें 'कौन सा' सातवीं श्रेणी के रूप में जोड़ा गया है ताकि वस्तु चयन कार्यों को संबोधित किया जा सके। पहले के VQA डेटासेट के विपरीत जो मुख्य रूप से वस्तु पहचान पर केंद्रित थे, Visual7W में 'क्यों' और 'कैसे' प्रश्नों का एक महत्वपूर्ण हिस्सा शामिल है, जो दृश्यों में कारण और प्रक्रियात्मक संबंधों के बारे में तर्क की मांग करते हैं। यह डिज़ाइन इसे डीप लर्निंग मॉडलों के लिए एक कठोर परीक्षण बनाता है, क्योंकि यह धारणा और उच्च-स्तरीय अनुभूति के बीच सेतु का कार्य करता है।
डेटासेट संरचना
Visual7W दो मुख्य घटकों में व्यवस्थित है: बहुविकल्पीय QA और खुले-अंत वाला QA। बहुविकल्पीय उपसमुच्चय प्रति प्रश्न चार उम्मीदवार उत्तर प्रदान करता है, जबकि खुले-अंत वाला उपसमुच्चय मुक्त-रूप निर्माण की आवश्यकता रखता है। प्रत्येक प्रश्न एक ग्राउंडिंग बॉक्स के साथ एनोटेट किया गया है, जो छवि क्षेत्र के चारों ओर एक बाउंडिंग बॉक्स है जिसमें उत्तर निहित होता है। डेटासेट प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित है, जिसमें परीक्षण सेट को सार्वजनिक भाग और आधिकारिक मूल्यांकन के लिए उपयोग किए जाने वाले छिपे हुए भाग में विभाजित किया गया है।
सभी छवियाँ Microsoft COCO डेटासेट से ली गई हैं, जो रोज़मर्रा की वस्तुओं और गतिविधियों के साथ विविध दृश्य सुनिश्चित करती हैं। एनोटेशन Amazon Mechanical Turk के माध्यम से एकत्र किए गए थे, जिसमें अस्पष्ट या गलत प्रश्नों को फ़िल्टर करने के लिए गुणवत्ता नियंत्रण उपाय शामिल थे। औसत प्रश्न लंबाई लगभग 8 शब्द है, और शब्दावली लगभग 4,000 शब्दों को कवर करती है, जो इसे तंत्रिका नेटवर्क मॉडलों के लिए एक संक्षिप्त लेकिन चुनौतीपूर्ण भाषाई स्थान बनाती है।
कार्य निरूपण
Visual7W में प्राथमिक कार्य दृश्य ग्राउंडिंग है, जहाँ एक मॉडल एक छवि और एक प्रश्न प्राप्त करता है और उसे एक उत्तर और एक बाउंडिंग बॉक्स दोनों आउटपुट करना होता है। इसे एक संयुक्त भविष्यवाणी समस्या के रूप में औपचारिक रूप दिया गया है: मॉडल को उस क्षेत्र का पता लगाना चाहिए जो प्रश्न का उत्तर देता है, फिर उस क्षेत्र के आधार पर उत्तर को वर्गीकृत या उत्पन्न करना चाहिए। मूल्यांकन मेट्रिक्स में उत्तर सटीकता और ग्राउंडिंग सटीकता शामिल हैं, जिसमें ग्राउंडिंग को पूर्वानुमानित और वास्तविक-मान बॉक्सों के बीच इंटरसेक्शन ओवर यूनियन (IoU) द्वारा मापा जाता है।
एक द्वितीयक कार्य ग्राउंडिंग के बिना दृश्य प्रश्न उत्तर है, जो पिछले डेटासेट के साथ तुलना की अनुमति देता है। हालाँकि, ग्राउंडिंग आवश्यकता Visual7W को ध्यान तंत्रों के अध्ययन के लिए अद्वितीय रूप से उपयुक्त बनाती है, क्योंकि मॉडलों को छवि के प्रासंगिक भागों पर ध्यान केंद्रित करना सीखना होता है। इसने बाद के आर्किटेक्चर को प्रभावित किया है, जैसे कि मल्टी-हेड अटेंशन और क्रॉस-अटेंशन परतों का उपयोग करने वाले, जो अब ट्रांसफॉर्मर-आधारित दृष्टि-भाषा मॉडलों में मानक हैं।
बेंचमार्क महत्व
Visual7W पहले VQA बेंचमार्क में से एक था जिसने 'क्यों' और 'कैसे' प्रश्नों पर जोर दिया, जिनके लिए सरल पैटर्न मिलान से परे सामान्य ज्ञान तर्क की आवश्यकता होती है। उदाहरण के लिए, 'व्यक्ति छाता क्यों पकड़े हुए है?' जैसा प्रश्न मौसम के संदर्भ और कारण अनुमान की समझ की मांग करता है। इसने क्षेत्र को अधिक परिष्कृत बड़े भाषा मॉडल और दृष्टि-भाषा प्रीट्रेनिंग दृष्टिकोणों की ओर धकेला।
डेटासेट का उपयोग कई मॉडलों का मूल्यांकन करने के लिए किया गया है, प्रारंभिक अवशिष्ट नेटवर्क से लेकर आवर्ती नेटवर्क के साथ संयुक्त आधुनिक जनरेटिव AI प्रणालियों तक। यह Visual Genome और GQA जैसे बड़े बेंचमार्क के लिए एक अग्रदूत के रूप में भी कार्य करता था, जिन्होंने संबंधपरक तर्क के दायरे का विस्तार किया। स्टैनफोर्ड AI लैब और बर्कले AI रिसर्च जैसे संस्थानों के शोधकर्ताओं ने व्याख्यात्मकता और ध्यान विज़ुअलाइज़ेशन तकनीकों का परीक्षण करने के लिए Visual7W का उपयोग किया है।
सीमाएँ और आलोचनाएँ
इसके योगदानों के बावजूद, Visual7W में ज्ञात सीमाएँ हैं। ग्राउंडिंग बॉक्स अक्सर मोटे होते हैं, जो संदर्भित विशिष्ट वस्तु से बड़े क्षेत्रों को कवर करते हैं, जो ग्राउंडिंग सटीकता को बढ़ा सकते हैं। डेटासेट भाषा पूर्वाग्रह से भी ग्रस्त है, जहाँ कुछ उत्तर प्रश्न प्रकारों के साथ सहसंबद्ध होते हैं, जिससे मॉडल वास्तविक दृश्य समझ के बिना शॉर्टकट का शोषण कर सकते हैं। इसके अतिरिक्त, 'क्यों' और 'कैसे' प्रश्न 'क्या' और 'कहाँ' की तुलना में अपेक्षाकृत दुर्लभ हैं, जो तर्क मूल्यांकन की गहराई को सीमित करता है।
आलोचकों ने नोट किया है कि बहुविकल्पीय प्रारूप को सांख्यिकीय नियमितताओं द्वारा खेला जा सकता है, और खुले-अंत वाले उत्तरों का मूल्यांकन सटीक स्ट्रिंग मिलान के साथ किया जाता है, जो शब्दार्थ रूप से सही लेकिन पुनःशब्दित प्रतिक्रियाओं को दंडित करता है। इन मुद्दों ने बाद के डेटासेट में अधिक मजबूत मूल्यांकन प्रोटोकॉल के विकास को प्रेरित किया है, जैसे कि स्कोरिंग के लिए RLHF-शैली मानव प्रतिक्रिया का उपयोग करना।
विरासत और प्रभाव
Visual7W दृश्य ग्राउंडिंग और प्रश्न उत्तर का अध्ययन करने के लिए एक मूल्यवान संसाधन बना हुआ है, विशेष रूप से शैक्षिक उद्देश्यों और ध्यान-आधारित मॉडलों के बेंचमार्किंग के लिए। इसके ग्राउंडिंग एनोटेशन को दृश्य सामान्य ज्ञान तर्क और संदर्भ अभिव्यक्ति समझ जैसे कार्यों के लिए पुनः उपयोग किया गया है। व्याख्यात्मकता पर डेटासेट का जोर मशीन लर्निंग में व्याख्यात्मक AI की ओर व्यापक रुझानों के साथ संरेखित है, और यह मल्टीमॉडल लर्निंग और डेटा संवर्धन रणनीतियों पर शोध में उद्धृत किया जाता रहा है।
2020 के दशक के मध्य तक, बड़े और अधिक जटिल डेटासेट के उद्भव के कारण Visual7W का उपयोग प्राथमिक बेंचमार्क के रूप में कम बार किया जाता है, लेकिन यह मौलिक VQA क्षमताओं के मूल्यांकन के लिए एक मानक संदर्भ बना हुआ है। इसके डिज़ाइन सिद्धांतों ने स्वायत्त ड्राइविंग और रोबोटिक्स के लिए डेटासेट के निर्माण को प्रभावित किया है, जहाँ ग्राउंडिंग महत्वपूर्ण है।