Natural Language Visual Reasoning (NLVR) कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण को संयोजित करने वाला कृत्रिम बुद्धिमत्ता का एक उपक्षेत्र है, जो मशीनों को दृश्य जानकारी की व्याख्या करने और मानव भाषा में व्यक्त तर्क कार्यों को निष्पादित करने में सक्षम बनाता है। यह शब्द सबसे अधिक NLVR बेंचमार्क से जुड़ा है, जो 2016 में पेश किया गया एक डेटासेट है, जो मॉडल की जटिल वाक्यों को समझने और छवियों के विरुद्ध उन्हें सत्यापित करने की क्षमता का मूल्यांकन करता है। सरल दृश्य प्रश्न उत्तरण के विपरीत, NLVR कार्यों में संरचनात्मक तर्क की आवश्यकता होती है, जैसे स्थानिक संबंधों की तुलना करना, वस्तुओं की गिनती करना, या दृश्य सामग्री पर "और" और "या" जैसे तार्किक ऑपरेटरों को लागू करना।
NLVR में मुख्य चुनौती भाषाई विवरणों और पिक्सेल-स्तरीय दृश्य डेटा के बीच अर्थ संबंधी अंतर को पाटने में निहित है। एक सामान्य NLVR कार्य एक वाक्य (जैसे, "एक लाल सिलेंडर के बाईं ओर कम से कम तीन नीले ब्लॉक हैं") और एक छवि प्रस्तुत करता है, और सिस्टम को एक द्विआधारी सत्य मान (सत्य या असत्य) आउटपुट करना होता है। यह न केवल वस्तु पहचान की मांग करता है, बल्कि स्थानिक पूर्वसर्गों, परिमाणकों और निषेध की समझ भी मांगता है। बेंचमार्क को पूर्वाग्रहों को नियंत्रित करने के लिए सिंथेटिक रूप से डिज़ाइन किया गया था, जिसमें सरल ज्यामितीय आकृतियों के साथ प्रस्तुत 3D दृश्यों का उपयोग किया गया था, जो शोधकर्ताओं को वास्तविक दुनिया की दृश्य जटिलता से तर्क क्षमताओं को अलग करने की अनुमति देता है।
ऐतिहासिक विकास
मूल NLVR डेटासेट 2016 में स्टैनफोर्ड एआई लैब और टोरंटो विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जिसमें एक पेपर प्राकृतिक भाषा प्रसंस्करण में अनुभवजन्य तरीकों पर सम्मेलन में प्रस्तुत किया गया था। प्रारंभिक संस्करण में 3D रेंडरिंग इंजन का उपयोग करके उत्पन्न सिंथेटिक छवियों के साथ 90,000 से अधिक मानव-लिखित वाक्य शामिल थे। प्रत्येक छवि में एक ग्रिड में व्यवस्थित रंगीन आकृतियों (ब्लॉक, सिलेंडर, गोले) का एक सेट दर्शाया गया था। वाक्यों को क्राउडसोर्सिंग के माध्यम से एकत्र किया गया था, जिसमें एनोटेटरों को दृश्यों का वर्णन करने या उनके बारे में दावे करने के लिए कहा गया था। डेटासेट को बाद में 2018 में NLVR2 तक विस्तारित किया गया, जिसमें सिंथेटिक छवियों के बजाय वेब से प्राकृतिक तस्वीरों का उपयोग किया गया, जिससे कठिनाई और वास्तविक दुनिया की प्रासंगिकता बढ़ गई।
NLVR के शुरुआती दृष्टिकोण तंत्रिका नेटवर्क आर्किटेक्चर पर निर्भर थे, विशेष रूप से अनुक्रम-से-अनुक्रम मॉडल और एनकोडर-डिकोडर ढांचे पर। ये सिस्टम आमतौर पर कन्वोल्यूशनल तंत्रिका नेटवर्क का उपयोग करके छवि को एनकोड करते थे और आवर्ती तंत्रिका नेटवर्क का उपयोग करके वाक्य को एनकोड करते थे, फिर भविष्यवाणी करने के लिए प्रतिनिधित्वों को संयोजित करते थे। हालांकि, ये मॉडल अक्सर संरचनात्मक सामान्यीकरण के साथ संघर्ष करते थे, परिचित वाक्य संरचनाओं पर अच्छा प्रदर्शन करते थे लेकिन शब्दों और दृश्य अवधारणाओं के नए संयोजनों पर विफल होते थे।
प्रमुख विधियाँ और आर्किटेक्चर
आधुनिक NLVR सिस्टम ट्रांसफॉर्मर-आधारित मॉडल और बड़े भाषा मॉडल का लाभ उठाते हैं। एक सामान्य दृष्टिकोण एक पूर्व-प्रशिक्षित दृश्य-भाषा मॉडल का उपयोग करना है जो छवियों और पाठ को संयुक्त रूप से एनकोड करता है, जैसे CLIP या ViLBERT, और फिर इसे NLVR कार्य पर फाइन-ट्यून करना है। ये मॉडल दृश्य क्षेत्रों को पाठ्य टोकन के साथ संरेखित करने के लिए बहु-शीर्ष ध्यान तंत्र का उपयोग करते हैं, जिससे अधिक सूक्ष्म तर्क संभव होता है। उदाहरण के लिए, मॉडल "नीला" शब्द को संसाधित करते समय विशिष्ट नीले ब्लॉक पर और "बाईं ओर" को संसाधित करते समय बाएं क्षेत्र पर ध्यान केंद्रित कर सकता है।
काम की एक और पंक्ति मॉड्यूलर नेटवर्क का उपयोग करती है, जहां वाक्य को एक प्रोग्राम में पार्स किया जाता है (जैसे, "फ़िल्टर(नीला), गिनती, अधिक-से(3)" जैसे संचालन का एक अनुक्रम) जो छवि पर निष्पादित होता है। यह दृष्टिकोण, पाठ्यक्रम-शिक्षण और न्यूरो-प्रतीकात्मक तर्क से प्रेरित, व्याख्या और सामान्यीकरण में सुधार करता है। कुछ हालिया मॉडल भाषा और दृश्य धाराओं को पुनरावृत्त रूप से बातचीत करने की अनुमति देने के लिए क्रॉस-ध्यान परतों को भी शामिल करते हैं, कई चरणों में प्रतिनिधित्व को परिष्कृत करते हैं।
मूल्यांकन और बेंचमार्क
NLVR के लिए प्राथमिक मीट्रिक आयोजित परीक्षण सेट पर वर्गीकरण सटीकता है। मूल NLVR डेटासेट को प्रशिक्षण, विकास और परीक्षण भागों में विभाजित किया गया है, जिसमें आधिकारिक मूल्यांकन के लिए परीक्षण सेट निजी रखा गया है। NLVR2, प्राकृतिक छवि संस्करण, में 107,000 से अधिक छवियां और 107,000 वाक्य शामिल हैं, जिसमें समान द्विआधारी वर्गीकरण कार्य है। शोधकर्ता वितरण-बाहर विभाजनों पर भी मूल्यांकन करते हैं ताकि संरचनात्मक सामान्यीकरण का परीक्षण किया जा सके, जहां परीक्षण वाक्यों में शब्दों और संरचनाओं के नए संयोजन होते हैं जो प्रशिक्षण के दौरान नहीं देखे गए थे।
मूल बेंचमार्क से परे, NLVR ने अन्य तर्क कार्यों को प्रभावित किया है, जैसे दृश्य निहितार्थ और आधारित भाषा समझ। NLVR की सिंथेटिक प्रकृति नियंत्रित प्रयोगों की अनुमति देती है, लेकिन यह वास्तविक दुनिया के अनुप्रयोगों में स्थानांतरण क्षमता को भी सीमित करती है। परिणामस्वरूप, कई शोधकर्ता NLVR को अंतिम अनुप्रयोग लक्ष्य के बजाय एक नैदानिक उपकरण के रूप में उपयोग करते हैं, इसे मॉडल की समग्र दृश्य तर्क क्षमता का आकलन करने के लिए VQA (दृश्य प्रश्न उत्तरण) जैसे अन्य डेटासेट के साथ जोड़ते हैं।
चुनौतियाँ और सीमाएँ
NLVR में एक प्रमुख चुनौती भाषाई अस्पष्टता और परिवर्तनशीलता को संभालना है। मानव वाक्यों को अनगिनत तरीकों से पैराफ्रेज़ किया जा सकता है, और मॉडल को समानार्थक शब्दों, पुनर्क्रमण और अंतर्निहित संदर्भों के प्रति मजबूत होना चाहिए। एक और मुद्दा मूल डेटासेट में सिंथेटिक छवियों पर निर्भरता है, जो वास्तविक दुनिया के दृश्यों की जटिलता को पकड़ नहीं सकती है, जिससे सरल ज्यामितीय पैटर्न पर अति-अनुकूलन हो सकता है। NLVR2 इसे संबोधित करता है लेकिन नई चुनौतियाँ पेश करता है, जैसे पृष्ठभूमि अव्यवस्था और वस्तु अवरोधन।
इसके अलावा, वर्तमान मॉडल अक्सर सच्चे तर्क के बजाय सांख्यिकीय सहसंबंधों पर निर्भर करते हैं। उदाहरण के लिए, एक मॉडल सीख सकता है कि "बाएं" शब्द वाले वाक्य कुछ छवि विन्यासों में सत्य होने की अधिक संभावना रखते हैं, बिना वास्तव में स्थानिक संबंधों को समझे। इसने कारण तर्क और प्रति-तथ्यात्मक मूल्यांकन पर शोध को जन्म दिया है, जहां मॉडल को ऐसे प्रतिकूल उदाहरणों पर परीक्षण किया जाता है जो ऐसे शॉर्टकट को उजागर करने के लिए डिज़ाइन किए गए हैं।
अनुप्रयोग और भविष्य की दिशाएँ
NLVR का जनरेटिव एआई प्रणालियों के लिए व्यावहारिक निहितार्थ है जिन्हें दृश्य सामग्री को सत्यापित या वर्णित करने की आवश्यकता होती है, जैसे छवि कैप्शनिंग, दृश्य संवाद, और दृष्टिहीन उपयोगकर्ताओं के लिए सहायक प्रौद्योगिकियाँ। यह मानव-समान संरचनात्मक सामान्यीकरण प्राप्त करने के मशीन लर्निंग में व्यापक प्रयासों से भी जुड़ता है, जो ब्रेंडन लेक और जोशुआ टेनेनबाम जैसे शोधकर्ताओं का एक प्रमुख लक्ष्य है। भविष्य की दिशाओं में मानव निर्णयों के साथ संरेखण में सुधार के लिए सुदृढीकरण सीखने को मानव प्रतिक्रिया (आरएलएआईएफ) के साथ एकीकृत करना, और डेटा-वृद्धि तकनीकों का उपयोग करके अधिक विविध और जटिल दृश्य दृश्यों तक स्केल करना शामिल है।
2020 के दशक के मध्य तक, NLVR2 पर अत्याधुनिक मॉडल 90% से ऊपर सटीकता प्राप्त करते हैं, लेकिन वे अभी भी मानव प्रदर्शन से कम हैं, जो लगभग 98% है। यह अंतर दृश्य तर्क की चल रही कठिनाई को उजागर करता है, विशेष रूप से अवधारणाओं के नए संयोजनों और लंबे, बहु-खंड वाक्यों को संभालने में। निरंतर प्रगति संभवतः तंत्रिका नेटवर्क के साथ प्रतीकात्मक तर्क के बेहतर एकीकरण के साथ-साथ बड़े, अधिक विविध प्रशिक्षण डेटासेट से आएगी।
यह भी देखें
- दृश्य प्रश्न उत्तरण (नोट: प्रदान की गई सूची में नहीं, लेकिन संबंधित)
- compositional-generalization (सूची में नहीं, लेकिन निहित)
- neuro-symbolic-ai (सूची में नहीं, लेकिन निहित)
नोट: उपरोक्त "यह भी देखें" लिंक प्लेसहोल्डर हैं क्योंकि प्रदान की गई स्लग सूची में वे विशिष्ट शब्द शामिल नहीं हैं; एक पूर्ण लेख में, वे प्रासंगिक पृष्ठों से लिंक होंगे।