अंग्रेज़ी से अनुवादित

Visual7W एक बड़े पैमाने पर विज़ुअल प्रश्न उत्तर और ग्राउंडिंग डेटासेट है, जिसे 2016 में पेश किया गया था, जिसमें 47,300 छवियों में 327,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनमें प्रश्नों को सात Ws (क्या, कहाँ, कब, कौन, क्यों, कैसे) में वर्गीकृत किया गया है और छवि क्षेत्रों में ग्राउंड किया गया है।

Visual7W एक दृश्य प्रश्न उत्तर (VQA) और दृश्य ग्राउंडिंग के लिए एक बेंचमार्क डेटासेट है, जिसे पहली बार 2016 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा प्रस्तुत किया गया था। इसमें Microsoft COCO से प्राप्त 47,300 वास्तविक-विश्व छवियाँ और 327,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनमें से प्रत्येक एक या अधिक बाउंडिंग बॉक्स के साथ जुड़ा है जो उत्तर का समर्थन करने वाले दृश्य साक्ष्य को स्थानीयकृत करते हैं। यह डेटासेट ग्राउंडिंग पर अपने जोर के लिए उल्लेखनीय है, जिसके लिए मॉडलों को न केवल प्रश्नों का उत्तर देना होता है, बल्कि प्रासंगिक छवि क्षेत्रों की पहचान भी करनी होती है - यह क्षमता व्याख्यात्मक AI प्रणालियों के लिए केंद्रीय है।

Visual7W नाम सात प्रकार के प्रश्नों से लिया गया है जिन्हें यह कवर करता है: क्या, कहाँ, कब, कौन, क्यों, और कैसे, जिसमें 'कौन सा' सातवीं श्रेणी के रूप में जोड़ा गया है ताकि वस्तु चयन कार्यों को संबोधित किया जा सके। पहले के VQA डेटासेट के विपरीत जो मुख्य रूप से वस्तु पहचान पर केंद्रित थे, Visual7W में 'क्यों' और 'कैसे' प्रश्नों का एक महत्वपूर्ण हिस्सा शामिल है, जो दृश्यों में कारण और प्रक्रियात्मक संबंधों के बारे में तर्क की मांग करते हैं। यह डिज़ाइन इसे डीप लर्निंग मॉडलों के लिए एक कठोर परीक्षण बनाता है, क्योंकि यह धारणा और उच्च-स्तरीय अनुभूति के बीच सेतु का कार्य करता है।

डेटासेट संरचना

Visual7W दो मुख्य घटकों में व्यवस्थित है: बहुविकल्पीय QA और खुले-अंत वाला QA। बहुविकल्पीय उपसमुच्चय प्रति प्रश्न चार उम्मीदवार उत्तर प्रदान करता है, जबकि खुले-अंत वाला उपसमुच्चय मुक्त-रूप निर्माण की आवश्यकता रखता है। प्रत्येक प्रश्न एक ग्राउंडिंग बॉक्स के साथ एनोटेट किया गया है, जो छवि क्षेत्र के चारों ओर एक बाउंडिंग बॉक्स है जिसमें उत्तर निहित होता है। डेटासेट प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित है, जिसमें परीक्षण सेट को सार्वजनिक भाग और आधिकारिक मूल्यांकन के लिए उपयोग किए जाने वाले छिपे हुए भाग में विभाजित किया गया है।

सभी छवियाँ Microsoft COCO डेटासेट से ली गई हैं, जो रोज़मर्रा की वस्तुओं और गतिविधियों के साथ विविध दृश्य सुनिश्चित करती हैं। एनोटेशन Amazon Mechanical Turk के माध्यम से एकत्र किए गए थे, जिसमें अस्पष्ट या गलत प्रश्नों को फ़िल्टर करने के लिए गुणवत्ता नियंत्रण उपाय शामिल थे। औसत प्रश्न लंबाई लगभग 8 शब्द है, और शब्दावली लगभग 4,000 शब्दों को कवर करती है, जो इसे तंत्रिका नेटवर्क मॉडलों के लिए एक संक्षिप्त लेकिन चुनौतीपूर्ण भाषाई स्थान बनाती है।

कार्य निरूपण

Visual7W में प्राथमिक कार्य दृश्य ग्राउंडिंग है, जहाँ एक मॉडल एक छवि और एक प्रश्न प्राप्त करता है और उसे एक उत्तर और एक बाउंडिंग बॉक्स दोनों आउटपुट करना होता है। इसे एक संयुक्त भविष्यवाणी समस्या के रूप में औपचारिक रूप दिया गया है: मॉडल को उस क्षेत्र का पता लगाना चाहिए जो प्रश्न का उत्तर देता है, फिर उस क्षेत्र के आधार पर उत्तर को वर्गीकृत या उत्पन्न करना चाहिए। मूल्यांकन मेट्रिक्स में उत्तर सटीकता और ग्राउंडिंग सटीकता शामिल हैं, जिसमें ग्राउंडिंग को पूर्वानुमानित और वास्तविक-मान बॉक्सों के बीच इंटरसेक्शन ओवर यूनियन (IoU) द्वारा मापा जाता है।

एक द्वितीयक कार्य ग्राउंडिंग के बिना दृश्य प्रश्न उत्तर है, जो पिछले डेटासेट के साथ तुलना की अनुमति देता है। हालाँकि, ग्राउंडिंग आवश्यकता Visual7W को ध्यान तंत्रों के अध्ययन के लिए अद्वितीय रूप से उपयुक्त बनाती है, क्योंकि मॉडलों को छवि के प्रासंगिक भागों पर ध्यान केंद्रित करना सीखना होता है। इसने बाद के आर्किटेक्चर को प्रभावित किया है, जैसे कि मल्टी-हेड अटेंशन और क्रॉस-अटेंशन परतों का उपयोग करने वाले, जो अब ट्रांसफॉर्मर-आधारित दृष्टि-भाषा मॉडलों में मानक हैं।

बेंचमार्क महत्व

Visual7W पहले VQA बेंचमार्क में से एक था जिसने 'क्यों' और 'कैसे' प्रश्नों पर जोर दिया, जिनके लिए सरल पैटर्न मिलान से परे सामान्य ज्ञान तर्क की आवश्यकता होती है। उदाहरण के लिए, 'व्यक्ति छाता क्यों पकड़े हुए है?' जैसा प्रश्न मौसम के संदर्भ और कारण अनुमान की समझ की मांग करता है। इसने क्षेत्र को अधिक परिष्कृत बड़े भाषा मॉडल और दृष्टि-भाषा प्रीट्रेनिंग दृष्टिकोणों की ओर धकेला।

डेटासेट का उपयोग कई मॉडलों का मूल्यांकन करने के लिए किया गया है, प्रारंभिक अवशिष्ट नेटवर्क से लेकर आवर्ती नेटवर्क के साथ संयुक्त आधुनिक जनरेटिव AI प्रणालियों तक। यह Visual Genome और GQA जैसे बड़े बेंचमार्क के लिए एक अग्रदूत के रूप में भी कार्य करता था, जिन्होंने संबंधपरक तर्क के दायरे का विस्तार किया। स्टैनफोर्ड AI लैब और बर्कले AI रिसर्च जैसे संस्थानों के शोधकर्ताओं ने व्याख्यात्मकता और ध्यान विज़ुअलाइज़ेशन तकनीकों का परीक्षण करने के लिए Visual7W का उपयोग किया है।

सीमाएँ और आलोचनाएँ

इसके योगदानों के बावजूद, Visual7W में ज्ञात सीमाएँ हैं। ग्राउंडिंग बॉक्स अक्सर मोटे होते हैं, जो संदर्भित विशिष्ट वस्तु से बड़े क्षेत्रों को कवर करते हैं, जो ग्राउंडिंग सटीकता को बढ़ा सकते हैं। डेटासेट भाषा पूर्वाग्रह से भी ग्रस्त है, जहाँ कुछ उत्तर प्रश्न प्रकारों के साथ सहसंबद्ध होते हैं, जिससे मॉडल वास्तविक दृश्य समझ के बिना शॉर्टकट का शोषण कर सकते हैं। इसके अतिरिक्त, 'क्यों' और 'कैसे' प्रश्न 'क्या' और 'कहाँ' की तुलना में अपेक्षाकृत दुर्लभ हैं, जो तर्क मूल्यांकन की गहराई को सीमित करता है।

आलोचकों ने नोट किया है कि बहुविकल्पीय प्रारूप को सांख्यिकीय नियमितताओं द्वारा खेला जा सकता है, और खुले-अंत वाले उत्तरों का मूल्यांकन सटीक स्ट्रिंग मिलान के साथ किया जाता है, जो शब्दार्थ रूप से सही लेकिन पुनःशब्दित प्रतिक्रियाओं को दंडित करता है। इन मुद्दों ने बाद के डेटासेट में अधिक मजबूत मूल्यांकन प्रोटोकॉल के विकास को प्रेरित किया है, जैसे कि स्कोरिंग के लिए RLHF-शैली मानव प्रतिक्रिया का उपयोग करना।

विरासत और प्रभाव

Visual7W दृश्य ग्राउंडिंग और प्रश्न उत्तर का अध्ययन करने के लिए एक मूल्यवान संसाधन बना हुआ है, विशेष रूप से शैक्षिक उद्देश्यों और ध्यान-आधारित मॉडलों के बेंचमार्किंग के लिए। इसके ग्राउंडिंग एनोटेशन को दृश्य सामान्य ज्ञान तर्क और संदर्भ अभिव्यक्ति समझ जैसे कार्यों के लिए पुनः उपयोग किया गया है। व्याख्यात्मकता पर डेटासेट का जोर मशीन लर्निंग में व्याख्यात्मक AI की ओर व्यापक रुझानों के साथ संरेखित है, और यह मल्टीमॉडल लर्निंग और डेटा संवर्धन रणनीतियों पर शोध में उद्धृत किया जाता रहा है।

2020 के दशक के मध्य तक, बड़े और अधिक जटिल डेटासेट के उद्भव के कारण Visual7W का उपयोग प्राथमिक बेंचमार्क के रूप में कम बार किया जाता है, लेकिन यह मौलिक VQA क्षमताओं के मूल्यांकन के लिए एक मानक संदर्भ बना हुआ है। इसके डिज़ाइन सिद्धांतों ने स्वायत्त ड्राइविंग और रोबोटिक्स के लिए डेटासेट के निर्माण को प्रभावित किया है, जहाँ ग्राउंडिंग महत्वपूर्ण है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·visual-question-answering·computer-vision·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास