Visual Commonsense Reasoning (VCR) एक शोध मानदंड और कृत्रिम बुद्धिमत्ता में एक कार्य है जो किसी प्रणाली की छवियों को समझने और सामान्य ज्ञान का उपयोग करके उनके बारे में प्रश्नों के उत्तर देने की क्षमता का मूल्यांकन करता है। 2019 में पेश किया गया, VCR के लिए मॉडलों को न केवल दृश्य में वस्तुओं और क्रियाओं की पहचान करनी होती है, बल्कि प्रेरणाओं, मानसिक अवस्थाओं और संभावित भविष्य की घटनाओं का अनुमान भी लगाना होता है। इसे बुनियादी दृश्य पहचान से परे उच्च-स्तरीय अनुभूति का परीक्षण करने के लिए डिज़ाइन किया गया है, जो कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण के बीच की खाई को पाटता है।
VCR डेटासेट में 110,000 फिल्म दृश्यों से प्राप्त 290,000 से अधिक बहुविकल्पीय प्रश्न शामिल हैं, जिनमें से प्रत्येक एक प्रश्न, चार उत्तर विकल्प और चार तर्क विकल्पों के साथ जोड़ा गया है। एक मॉडल को सही उत्तर का चयन करना होता है और फिर सही तर्क का चयन करके अपनी पसंद को उचित ठहराना होता है। यह दो-चरणीय संरचना प्रणालियों को स्पष्टीकरण उत्पन्न करने के लिए मजबूर करती है, जिससे यह मानदंड पारंपरिक दृश्य प्रश्नोत्तर (VQA) की तुलना में अधिक चुनौतीपूर्ण बन जाता है। कार्य को दो उप-कार्यों में विभाजित किया गया है: क्वेरी-उत्तर (QA) और उत्तर-तर्क (AR), जिसमें समग्र प्रदर्शन को VCR स्कोर द्वारा मापा जाता है, जो दोनों उप-कार्यों पर सटीकता का गुणनफल है।
डेटासेट और एनोटेशन
VCR डेटासेट चैपल हिल में उत्तरी कैरोलिना विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा बनाया गया था। एनोटेशन को अमेज़न मैकेनिकल तुर्क का उपयोग करके क्राउडसोर्स किया गया था, जिसमें श्रमिकों से ऐसे प्रश्न लिखने को कहा गया था जिनके लिए सामान्य ज्ञान तर्क की आवश्यकता होती है, जैसे "व्यक्ति क्यों भाग रहा है?" या "आगे क्या होगा?" प्रत्येक प्रश्न एक फिल्म के विशिष्ट छवि पर आधारित है, जो सामाजिक अंतःक्रियाओं, भावनात्मक अभिव्यक्तियों और भौतिक कारणता जैसे समृद्ध संदर्भ संकेत प्रदान करता है। डेटासेट में 110,000 अद्वितीय फिल्म क्लिप शामिल हैं, जिनमें से प्रत्येक में औसतन 2.6 प्रश्न हैं, जिसके परिणामस्वरूप विविध परिदृश्यों का एक सेट बनता है जो केवल वस्तु पहचान की ओर पक्षपाती नहीं है।
कार्य निरूपण
औपचारिक रूप से, VCR को एक बहुविकल्पीय कार्य के रूप में परिभाषित किया गया है। एक छवि I, एक प्रश्न Q, और चार उत्तर उम्मीदवारों का एक सेट A = {a1, a2, a3, a4} दिए जाने पर, मॉडल को सही उत्तर a की भविष्यवाणी करनी होती है। फिर, समान छवि, प्रश्न और सही उत्तर दिए जाने पर, मॉडल को चार तर्क उम्मीदवारों के सेट से सही तर्क R का चयन करना होता है। अंतिम VCR स्कोर की गणना सही उत्तर और सही तर्क दोनों के चयन की सटीकता के रूप में की जाती है, अर्थात संयुक्त संभावना P(a | I, Q) P(r | I, Q, a*)। यह निरूपण मॉडलों को केवल उत्तर का अनुमान लगाने के बजाय सुसंगत स्पष्टीकरण उत्पन्न करने के लिए प्रोत्साहित करता है।
मॉडल दृष्टिकोण
प्रारंभिक VCR प्रणालियाँ दृश्य प्रश्नोत्तर वास्तुकलाओं पर निर्भर थीं जो छवि सुविधा निष्कर्षण के लिए कन्वोल्यूशनल तंत्रिका नेटवर्क (CNN) को पाठ के लिए आवर्तक तंत्रिका नेटवर्क (RNN) या ट्रांसफॉर्मर-आधारित एनकोडर के साथ जोड़ती थीं। एक सामान्य आधार रेखा विज़ुअल कॉमनसेंस रीज़निंग विद ट्रांसफॉर्मर (VCRT) मॉडल थी, जो दृश्य और पाठ्य अभ्यावेदन को संलयन करने के लिए मल्टी-हेड अटेंशन तंत्र का उपयोग करती थी। बाद में, बड़े भाषा मॉडल-आधारित दृष्टिकोण, जैसे BERT या GPT वेरिएंट को ठीक-ट्यून करना, बहुविध इनपुट को संभालने के लिए अनुकूलित किए गए। ये मॉडल अक्सर दो-चरणीय पाइपलाइन का उपयोग करते हैं: पहले, वे छवि और प्रश्न को संयुक्त रूप से एनकोड करते हैं, फिर वे उत्तर और तर्क का चयन करने के लिए एक वर्गीकरण हेड का उपयोग करते हैं। हाल के कार्यों ने क्रॉस-अटेंशन परतों के साथ अंत-से-अंत प्रशिक्षण का पता लगाया है, जिससे मॉडल को प्रश्न के बारे में तर्क करते समय प्रासंगिक छवि क्षेत्रों पर ध्यान केंद्रित करने की अनुमति मिलती है।
चुनौतियाँ और सीमाएँ
प्रगति के बावजूद, VCR एक कठिन मानदंड बना हुआ है। मॉडल अक्सर उन प्रश्नों के साथ संघर्ष करते हैं जिनके लिए गहन सामाजिक तर्क की आवश्यकता होती है, जैसे किसी पात्र के इरादे या भावनात्मक स्थिति का अनुमान लगाना। डेटासेट में पूर्वाग्रह भी शामिल हैं, क्योंकि कुछ प्रश्नों का उत्तर दृश्य साक्ष्य के बजाय पाठ में सांख्यिकीय नियमितताओं द्वारा दिया जा सकता है। उदाहरण के लिए, एक मॉडल दृश्य को वास्तव में समझे बिना कुछ क्रियाओं को विशिष्ट वस्तुओं के साथ जोड़ना सीख सकता है। इसके अतिरिक्त, तर्क चयन कार्य विशेष रूप से चुनौतीपूर्ण है क्योंकि इसके लिए मॉडल को एक प्रशंसनीय स्पष्टीकरण उत्पन्न करने की आवश्यकता होती है जो केवल उत्तर का पुनर्कथन नहीं है। 2025 तक, VCR पर सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल QA उप-कार्य पर लगभग 80% सटीकता और AR उप-कार्य पर 75% प्राप्त करते हैं, लेकिन संयुक्त VCR स्कोर 60% से नीचे रहता है, जो सुधार के लिए महत्वपूर्ण गुंजाइश दर्शाता है।
प्रभाव और संबंधित कार्य
VCR ने बाद के मानदंडों जैसे विज़ुअल कॉमनसेंस रीज़निंग इन द वाइल्ड (VCR-W) को प्रभावित किया है और AI प्रणालियों में सामान्य ज्ञान तर्क क्षमताओं के मूल्यांकन के लिए एक परीक्षण मंच के रूप में उपयोग किया गया है। इसने व्याख्यात्मक AI में शोध को भी प्रेरित किया है, क्योंकि तर्क चयन घटक मॉडलों को व्याख्या योग्य औचित्य प्रदान करने के लिए मजबूर करता है। डेटासेट सार्वजनिक रूप से उपलब्ध है और शोध समुदाय में व्यापक रूप से अपनाया गया है, 2025 तक 1,000 से अधिक उद्धरणों के साथ। VCR की तुलना अक्सर दृश्य-अंतर्निहितता और दृश्य प्रश्नोत्तर जैसे अन्य दृश्य तर्क कार्यों से की जाती है, लेकिन स्पष्टीकरण पर इसका जोर इसे अलग बनाता है। यह मानदंड एलन इंस्टीट्यूट फॉर AI द्वारा बनाए रखा गया है और नियमित रूप से शैक्षणिक प्रतियोगिताओं और कार्यशालाओं में उपयोग किया जाता है।
भविष्य की दिशाएँ
VCR पर भविष्य के कार्य में अधिक परिष्कृत तंत्रिका नेटवर्क वास्तुकलाओं को एकीकृत करना शामिल हो सकता है, जैसे कि दृष्टि-भाषा मॉडल जो बड़े पैमाने पर छवि-पाठ युग्मों पर पूर्व-प्रशिक्षित होते हैं। VCR का उपयोग जनरेटिव AI प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने में भी रुचि है, जहाँ मॉडलों को एक निश्चित सेट से चयन करने के बजाय मुक्त-रूप तर्क उत्पन्न करने होते हैं। इसके अतिरिक्त, शोधकर्ता प्रतिकूल उदाहरणों या प्रति-तथ्यात्मक प्रश्नों को पेश करके डेटासेट पूर्वाग्रह को कम करने के तरीकों की खोज कर रहे हैं। जैसे-जैसे कृत्रिम बुद्धिमत्ता आगे बढ़ती है, VCR मानव-स्तरीय दृश्य सामान्य ज्ञान तर्क की ओर प्रगति को मापने के लिए एक महत्वपूर्ण मानदंड के रूप में कार्य करता है।