NLVR2 (Natural Language Visual Reasoning, version 2) एक बेंचमार्क डेटासेट है जो कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र में किसी मॉडल की दृश्य तर्क करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इस कार्य में एक सिस्टम को दो छवियों और एक प्राकृतिक भाषा कैप्शन की जांच करनी होती है, फिर यह निर्धारित करना होता है कि कैप्शन छवियों की जोड़ी के संबंध में सत्य है या असत्य। अपने पूर्ववर्ती, NLVR, के विपरीत, जो सिंथेटिक, कंप्यूटर-जनित दृश्यों का उपयोग करता था, NLVR2 इंटरनेट से प्राप्त वास्तविक-विश्व तस्वीरों का उपयोग करता है, जिससे तर्क कार्य काफी अधिक जटिल और वास्तविक-विश्व अनुप्रयोगों के करीब हो जाता है।
यह डेटासेट 2019 में स्टैनफोर्ड विश्वविद्यालय और उत्तरी कैरोलिना विश्वविद्यालय चैपल हिल के शोधकर्ताओं द्वारा पेश किया गया था, जो 2017 में जारी मूल NLVR बेंचमार्क के उत्तराधिकारी के रूप में था। प्राथमिक प्रेरणा सिंथेटिक डेटा की सीमाओं को संबोधित करना था, जो मॉडलों को वास्तविक तर्क में शामिल होने के बजाय निम्न-स्तरीय दृश्य शॉर्टकट का शोषण करने की अनुमति देता था। NLVR2 में 107,000 से अधिक मानव-लिखित कैप्शन शामिल हैं, जिनमें से प्रत्येक दो अलग छवियों के साथ जोड़ा गया है। कैप्शन विविध हैं, जो स्थानिक संबंधों, गिनती, तुलनाओं, और तार्किक संचालनों को कवर करते हैं, और उन्हें अक्सर दोनों छवियों की एक साथ समझ की आवश्यकता होती है
कार्य परिभाषा और मूल्यांकन
NLVR2 में, प्रत्येक उदाहरण एक मॉडल को छवियों की एक जोड़ी (बाएं और दाएं) और एक कैप्शन प्रस्तुत करता है। मॉडल को एक द्विआधारी निर्णय आउटपुट करना होता है: 'सत्य' यदि कैप्शन जोड़ी का सटीक वर्णन करता है, या 'असत्य' अन्यथा। उदाहरण के लिए, एक कैप्शन कह सकता है 'बाएं छवि में दाएं छवि से अधिक लोग हैं,' और मॉडल को दोनों छवियों की तुलना करके इसे सत्यापित करना होता है। मूल्यांकन मीट्रिक केवल आयोजित परीक्षण सेट पर वर्गीकरण सटीकता है। क्योंकि कैप्शन मनुष्यों द्वारा लिखे गए हैं और छवियां प्राकृतिक तस्वीरें हैं, यह कार्य मजबूत दृश्य धारणा, भाषा समझ, और क्रॉस-मोडल तर्क की मांग करता है।
बेंचमार्क को प्रशिक्षण, विकास, और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट आधिकारिक लीडरबोर्ड रैंकिंग के लिए उपयोग किया जाता है। एक उल्लेखनीय विशेषता यह है कि परीक्षण सेट में 'कठिन' उदाहरण शामिल हैं जो विशेष रूप से चुनौतीपूर्ण होने के लिए डिज़ाइन किए गए हैं, जैसे निषेध या जटिल स्थानिक पूर्वसर्गों से जुड़े कैप्शन। यह सुनिश्चित करता है कि मॉडल पैटर्न को याद करके या सतही संकेतों का उपयोग करके उच्च स्कोर प्राप्त नहीं कर सकते।
अन्य बेंचमार्क से संबंध
NLVR2 दृश्य तर्क बेंचमार्क के एक व्यापक परिवार का हिस्सा है, जिसमें VQA (विज़ुअल क्वेश्चन आंसरिंग) और CLEVR शामिल हैं। हालांकि, यह VQA से भिन्न है क्योंकि इसमें एकल छवि के बारे में खुले-अंत वाले प्रश्नों का उत्तर देने के बजाय दो छवियों की तुलना करने की आवश्यकता होती है। CLEVR की तुलना में, जो सिंथेटिक 3D दृश्यों का उपयोग करता है, NLVR2 का वास्तविक तस्वीरों का उपयोग अधिक परिवर्तनशीलता और अस्पष्टता पेश करता है, जिससे यह सामान्यीकरण का अधिक यथार्थवादी परीक्षण बन जाता है। डेटासेट अक्सर डीप लर्निंग मॉडलों के साथ संयोजन में उपयोग किया जाता है, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर पर आधारित, जो मल्टीमोडल कार्यों के लिए मानक बन गए हैं।
NLVR2 ने बाद के बेंचमार्कों को भी प्रभावित किया है, जैसे NLVR3 और व्यापक 'विज़ुअल एंटेलमेंट' कार्य, जहां लक्ष्य यह निर्धारित करना है कि क्या एक कैप्शन एक छवि द्वारा निहित है। यह उन न्यूरल-नेटवर्क मॉडलों का मूल्यांकन करने के लिए एक व्यापक रूप से उद्धृत संसाधन बना हुआ है जो दृष्टि और भाषा को जोड़ते हैं, और यह अक्सर बड़े-भाषा-मॉडल विस्तारों पर शोध में उपयोग किया जाता है जो दृश्य इनपुट को शामिल करते हैं।
मॉडल प्रदर्शन और चुनौतियाँ
प्रारंभिक मॉडल जो NLVR पर उच्च सटीकता प्राप्त करते थे अक्सर सिंथेटिक छवि आंकड़ों पर निर्भर थे, लेकिन ये दृष्टिकोण NLVR2 पर विफल रहे। प्राकृतिक छवियों में बदलाव ने मॉडल क्षमताओं में महत्वपूर्ण अंतराल उजागर किए। 2024 तक, अत्याधुनिक मॉडल परीक्षण सेट पर लगभग 80-85% सटीकता प्राप्त करते हैं, जो सुधार के लिए पर्याप्त गुंजाइश छोड़ता है। उसी कार्य पर मानव प्रदर्शन 95% से ऊपर अनुमानित है, जो दर्शाता है कि वर्तमान सिस्टम सूक्ष्म तर्क, जैसे निहित संबंधों को समझना या अस्पष्ट कैप्शनों को संभालना, के साथ अभी भी संघर्ष करते हैं।
मुख्य चुनौतियों में प्रकाश, परिप्रेक्ष्य, और वस्तु उपस्थिति में भिन्नताओं को संभालना शामिल है, साथ ही कैप्शन के भीतर तार्किक विरोधाभासों को हल करना। मॉडल अक्सर विफल होते हैं जब वस्तुओं को सटीक रूप से गिनने की आवश्यकता होती है या जब कैप्शन में 'ऊपर' या 'बीच' जैसे स्थानिक शब्द शामिल होते हैं जो दो छवियों में वस्तुओं की सापेक्ष स्थितियों पर निर्भर करते हैं। शोधकर्ताओं ने दृश्य विशेषताओं को पाठ्य प्रतिनिधित्वों के साथ बेहतर ढंग से संरेखित करने के लिए क्रॉस-अटेंशन तंत्र और मल्टी-हेड-अटेंशन परतों सहित विभिन्न आर्किटेक्चरल नवाचारों का पता लगाया है।
अनुप्रयोग और प्रभाव
NLVR2 द्वारा परीक्षण किए गए कौशल सीधे जनरेटिव-एआई सिस्टम जैसे अनुप्रयोगों से संबंधित हैं जो छवि विवरण उत्पन्न करते हैं, दृश्य रूप से अक्षम उपयोगकर्ताओं के लिए सहायक प्रौद्योगिकियां, और स्वायत्त सिस्टम जिन्हें दृश्य दृश्यों के बारे में तर्क करने की आवश्यकता होती है। बेंचमार्क का उपयोग प्रमुख शोध प्रयोगशालाओं के मॉडलों का मूल्यांकन करने के लिए किया गया है, जिनमें गूगल-डीपमाइंड, ओपनएआई, और एंथ्रोपिक से जुड़े शामिल हैं, साथ ही एमआईटी-सीएसएआईएल और बर्कले-एआई-रिसर्च जैसे शैक्षणिक संस्थान।
NLVR2 ने नए प्रशिक्षण तकनीकों के विकास को भी प्रेरित किया है, जैसे कंट्रास्टिव लर्निंग और पाठ्यक्रम लर्निंग, जहां मॉडलों को कठिन उदाहरणों के संपर्क में आने से पहले आसान उदाहरणों पर प्रशिक्षित किया जाता है। डेटासेट की सार्वजनिक उपलब्धता ने इसे मल्टीमोडल मॉडलों की तुलना के लिए एक मानक परीक्षण मंच बना दिया है, और इसे अक्सर VQA और विज़ुअल जीनोम जैसे अन्य बेंचमार्कों के साथ व्यापक मूल्यांकन सुइटों में शामिल किया जाता है।
भविष्य की दिशाएँ
2025 तक, शोध दृश्य तर्क की सीमाओं को आगे बढ़ाना जारी रखता है। NLVR2 का बड़े-भाषा-मॉडल ढांचों के साथ एकीकरण, जहां एक भाषा मॉडल को दृश्य एन्कोडरों के साथ बढ़ाया जाता है, आशाजनक दिखा है। हालांकि, ये मॉडल अभी भी भंगुरता प्रदर्शित करते हैं, विशेष रूप से जब कैप्शन में दुर्लभ शब्द या असामान्य वस्तु संयोजन होते हैं। भविष्य के कार्य में अधिक विविध छवि स्रोतों को शामिल करने के लिए डेटासेट का विस्तार, अस्थायी या वीडियो-आधारित तर्क को शामिल करना, और ऐसे मीट्रिक विकसित करना शामिल हो सकता है जो द्विआधारी सटीकता से परे जाकर तर्क चरणों की गुणवत्ता को पकड़ते हैं।
बेंचमार्क कृत्रिम बुद्धिमत्ता में प्रगति को मापने के लिए एक महत्वपूर्ण उपकरण बना हुआ है, जो दृश्य दृश्यों की मानव और मशीन समझ के बीच अंतराल को उजागर करता है। इसके डिज़ाइन सिद्धांतों ने कई बाद के डेटासेटों को प्रभावित किया है, जिससे मल्टीमोडल मशीन लर्निंग के क्षेत्र में एक आधारभूत संसाधन के रूप में इसकी भूमिका स्थापित हुई है।