अंग्रेज़ी से अनुवादित

NLVR2 एक दृश्य तर्क के लिए बेंचमार्क डेटासेट है, जिसमें मॉडलों को यह निर्धारित करना होता है कि क्या एक प्राकृतिक भाषा कैप्शन छवियों की एक जोड़ी का सटीक वर्णन करता है। यह सिंथेटिक ग्राफिक्स के बजाय वास्तविक तस्वीरों का उपयोग करके मूल NLVR कार्य को विस्तारित करता है, जो गहरी [[semantic-understanding|सिमेंटिक समझ]] का परीक्षण करता है।

NLVR2 (Natural Language Visual Reasoning, version 2) एक बेंचमार्क डेटासेट है जो कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र में किसी मॉडल की दृश्य तर्क करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इस कार्य में एक सिस्टम को दो छवियों और एक प्राकृतिक भाषा कैप्शन की जांच करनी होती है, फिर यह निर्धारित करना होता है कि कैप्शन छवियों की जोड़ी के संबंध में सत्य है या असत्य। अपने पूर्ववर्ती, NLVR, के विपरीत, जो सिंथेटिक, कंप्यूटर-जनित दृश्यों का उपयोग करता था, NLVR2 इंटरनेट से प्राप्त वास्तविक-विश्व तस्वीरों का उपयोग करता है, जिससे तर्क कार्य काफी अधिक जटिल और वास्तविक-विश्व अनुप्रयोगों के करीब हो जाता है।

यह डेटासेट 2019 में स्टैनफोर्ड विश्वविद्यालय और उत्तरी कैरोलिना विश्वविद्यालय चैपल हिल के शोधकर्ताओं द्वारा पेश किया गया था, जो 2017 में जारी मूल NLVR बेंचमार्क के उत्तराधिकारी के रूप में था। प्राथमिक प्रेरणा सिंथेटिक डेटा की सीमाओं को संबोधित करना था, जो मॉडलों को वास्तविक तर्क में शामिल होने के बजाय निम्न-स्तरीय दृश्य शॉर्टकट का शोषण करने की अनुमति देता था। NLVR2 में 107,000 से अधिक मानव-लिखित कैप्शन शामिल हैं, जिनमें से प्रत्येक दो अलग छवियों के साथ जोड़ा गया है। कैप्शन विविध हैं, जो स्थानिक संबंधों, गिनती, तुलनाओं, और तार्किक संचालनों को कवर करते हैं, और उन्हें अक्सर दोनों छवियों की एक साथ समझ की आवश्यकता होती है

कार्य परिभाषा और मूल्यांकन

NLVR2 में, प्रत्येक उदाहरण एक मॉडल को छवियों की एक जोड़ी (बाएं और दाएं) और एक कैप्शन प्रस्तुत करता है। मॉडल को एक द्विआधारी निर्णय आउटपुट करना होता है: 'सत्य' यदि कैप्शन जोड़ी का सटीक वर्णन करता है, या 'असत्य' अन्यथा। उदाहरण के लिए, एक कैप्शन कह सकता है 'बाएं छवि में दाएं छवि से अधिक लोग हैं,' और मॉडल को दोनों छवियों की तुलना करके इसे सत्यापित करना होता है। मूल्यांकन मीट्रिक केवल आयोजित परीक्षण सेट पर वर्गीकरण सटीकता है। क्योंकि कैप्शन मनुष्यों द्वारा लिखे गए हैं और छवियां प्राकृतिक तस्वीरें हैं, यह कार्य मजबूत दृश्य धारणा, भाषा समझ, और क्रॉस-मोडल तर्क की मांग करता है।

बेंचमार्क को प्रशिक्षण, विकास, और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट आधिकारिक लीडरबोर्ड रैंकिंग के लिए उपयोग किया जाता है। एक उल्लेखनीय विशेषता यह है कि परीक्षण सेट में 'कठिन' उदाहरण शामिल हैं जो विशेष रूप से चुनौतीपूर्ण होने के लिए डिज़ाइन किए गए हैं, जैसे निषेध या जटिल स्थानिक पूर्वसर्गों से जुड़े कैप्शन। यह सुनिश्चित करता है कि मॉडल पैटर्न को याद करके या सतही संकेतों का उपयोग करके उच्च स्कोर प्राप्त नहीं कर सकते।

अन्य बेंचमार्क से संबंध

NLVR2 दृश्य तर्क बेंचमार्क के एक व्यापक परिवार का हिस्सा है, जिसमें VQA (विज़ुअल क्वेश्चन आंसरिंग) और CLEVR शामिल हैं। हालांकि, यह VQA से भिन्न है क्योंकि इसमें एकल छवि के बारे में खुले-अंत वाले प्रश्नों का उत्तर देने के बजाय दो छवियों की तुलना करने की आवश्यकता होती है। CLEVR की तुलना में, जो सिंथेटिक 3D दृश्यों का उपयोग करता है, NLVR2 का वास्तविक तस्वीरों का उपयोग अधिक परिवर्तनशीलता और अस्पष्टता पेश करता है, जिससे यह सामान्यीकरण का अधिक यथार्थवादी परीक्षण बन जाता है। डेटासेट अक्सर डीप लर्निंग मॉडलों के साथ संयोजन में उपयोग किया जाता है, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर पर आधारित, जो मल्टीमोडल कार्यों के लिए मानक बन गए हैं।

NLVR2 ने बाद के बेंचमार्कों को भी प्रभावित किया है, जैसे NLVR3 और व्यापक 'विज़ुअल एंटेलमेंट' कार्य, जहां लक्ष्य यह निर्धारित करना है कि क्या एक कैप्शन एक छवि द्वारा निहित है। यह उन न्यूरल-नेटवर्क मॉडलों का मूल्यांकन करने के लिए एक व्यापक रूप से उद्धृत संसाधन बना हुआ है जो दृष्टि और भाषा को जोड़ते हैं, और यह अक्सर बड़े-भाषा-मॉडल विस्तारों पर शोध में उपयोग किया जाता है जो दृश्य इनपुट को शामिल करते हैं।

मॉडल प्रदर्शन और चुनौतियाँ

प्रारंभिक मॉडल जो NLVR पर उच्च सटीकता प्राप्त करते थे अक्सर सिंथेटिक छवि आंकड़ों पर निर्भर थे, लेकिन ये दृष्टिकोण NLVR2 पर विफल रहे। प्राकृतिक छवियों में बदलाव ने मॉडल क्षमताओं में महत्वपूर्ण अंतराल उजागर किए। 2024 तक, अत्याधुनिक मॉडल परीक्षण सेट पर लगभग 80-85% सटीकता प्राप्त करते हैं, जो सुधार के लिए पर्याप्त गुंजाइश छोड़ता है। उसी कार्य पर मानव प्रदर्शन 95% से ऊपर अनुमानित है, जो दर्शाता है कि वर्तमान सिस्टम सूक्ष्म तर्क, जैसे निहित संबंधों को समझना या अस्पष्ट कैप्शनों को संभालना, के साथ अभी भी संघर्ष करते हैं।

मुख्य चुनौतियों में प्रकाश, परिप्रेक्ष्य, और वस्तु उपस्थिति में भिन्नताओं को संभालना शामिल है, साथ ही कैप्शन के भीतर तार्किक विरोधाभासों को हल करना। मॉडल अक्सर विफल होते हैं जब वस्तुओं को सटीक रूप से गिनने की आवश्यकता होती है या जब कैप्शन में 'ऊपर' या 'बीच' जैसे स्थानिक शब्द शामिल होते हैं जो दो छवियों में वस्तुओं की सापेक्ष स्थितियों पर निर्भर करते हैं। शोधकर्ताओं ने दृश्य विशेषताओं को पाठ्य प्रतिनिधित्वों के साथ बेहतर ढंग से संरेखित करने के लिए क्रॉस-अटेंशन तंत्र और मल्टी-हेड-अटेंशन परतों सहित विभिन्न आर्किटेक्चरल नवाचारों का पता लगाया है।

अनुप्रयोग और प्रभाव

NLVR2 द्वारा परीक्षण किए गए कौशल सीधे जनरेटिव-एआई सिस्टम जैसे अनुप्रयोगों से संबंधित हैं जो छवि विवरण उत्पन्न करते हैं, दृश्य रूप से अक्षम उपयोगकर्ताओं के लिए सहायक प्रौद्योगिकियां, और स्वायत्त सिस्टम जिन्हें दृश्य दृश्यों के बारे में तर्क करने की आवश्यकता होती है। बेंचमार्क का उपयोग प्रमुख शोध प्रयोगशालाओं के मॉडलों का मूल्यांकन करने के लिए किया गया है, जिनमें गूगल-डीपमाइंड, ओपनएआई, और एंथ्रोपिक से जुड़े शामिल हैं, साथ ही एमआईटी-सीएसएआईएल और बर्कले-एआई-रिसर्च जैसे शैक्षणिक संस्थान।

NLVR2 ने नए प्रशिक्षण तकनीकों के विकास को भी प्रेरित किया है, जैसे कंट्रास्टिव लर्निंग और पाठ्यक्रम लर्निंग, जहां मॉडलों को कठिन उदाहरणों के संपर्क में आने से पहले आसान उदाहरणों पर प्रशिक्षित किया जाता है। डेटासेट की सार्वजनिक उपलब्धता ने इसे मल्टीमोडल मॉडलों की तुलना के लिए एक मानक परीक्षण मंच बना दिया है, और इसे अक्सर VQA और विज़ुअल जीनोम जैसे अन्य बेंचमार्कों के साथ व्यापक मूल्यांकन सुइटों में शामिल किया जाता है।

भविष्य की दिशाएँ

2025 तक, शोध दृश्य तर्क की सीमाओं को आगे बढ़ाना जारी रखता है। NLVR2 का बड़े-भाषा-मॉडल ढांचों के साथ एकीकरण, जहां एक भाषा मॉडल को दृश्य एन्कोडरों के साथ बढ़ाया जाता है, आशाजनक दिखा है। हालांकि, ये मॉडल अभी भी भंगुरता प्रदर्शित करते हैं, विशेष रूप से जब कैप्शन में दुर्लभ शब्द या असामान्य वस्तु संयोजन होते हैं। भविष्य के कार्य में अधिक विविध छवि स्रोतों को शामिल करने के लिए डेटासेट का विस्तार, अस्थायी या वीडियो-आधारित तर्क को शामिल करना, और ऐसे मीट्रिक विकसित करना शामिल हो सकता है जो द्विआधारी सटीकता से परे जाकर तर्क चरणों की गुणवत्ता को पकड़ते हैं।

बेंचमार्क कृत्रिम बुद्धिमत्ता में प्रगति को मापने के लिए एक महत्वपूर्ण उपकरण बना हुआ है, जो दृश्य दृश्यों की मानव और मशीन समझ के बीच अंतराल को उजागर करता है। इसके डिज़ाइन सिद्धांतों ने कई बाद के डेटासेटों को प्रभावित किया है, जिससे मल्टीमोडल मशीन लर्निंग के क्षेत्र में एक आधारभूत संसाधन के रूप में इसकी भूमिका स्थापित हुई है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:visual-reasoning·multimodal-learning·benchmark·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास