एक विज़न-लैंग्वेज मॉडल (VLM) एक मल्टीमॉडल प्रणाली है जिसे छवियों और पाठ को संयुक्त रूप से समझने के लिए प्रशिक्षित किया जाता है, जिससे छवि कैप्शनिंग, दृश्य प्रश्न-उत्तर, छवि-पाठ पुनर्प्राप्ति, और आधारित तर्क जैसे कार्य सक्षम होते हैं जो भाषा को विशिष्ट दृश्य सामग्री से जोड़ते हैं। VLM व्यापक फाउंडेशन मॉडल श्रेणी के अंतर्गत आते हैं और आमतौर पर ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित होते हैं।
इतिहास
आधुनिक VLM का पता OpenAI के CLIP (2021) से लगाया जा सकता है, जिसने वेब से स्क्रैप किए गए सैकड़ों मिलियन छवि-पाठ जोड़ों पर कंट्रास्टिव लर्निंग का उपयोग करके छवियों और उनके कैप्शन को एक साझा एम्बेडिंग स्पेस में संरेखित किया, बिना हाथ से लेबल की गई श्रेणियों की आवश्यकता के। CLIP के एम्बेडिंग वर्गीकरण से कहीं आगे उपयोगी साबित हुए, जिसने प्रारंभिक टेक्स्ट-टू-इमेज प्रणालियों में मार्गदर्शन तंत्र को शक्ति प्रदान की और बाद के मॉडलों के लिए एक मानक दृश्य एन्कोडर बन गया। 2021-2023 के दौरान, Flamingo, BLIP, और LLaVA जैसे मॉडलों ने एक स्थिर या हल्के-ट्यून किए गए दृश्य एन्कोडर को एक पूर्व-प्रशिक्षित बड़े भाषा मॉडल से जोड़ने के तरीकों की खोज की, जिससे भाषा मॉडल के तर्क और ज्ञान को अपेक्षाकृत कम अतिरिक्त प्रशिक्षण के साथ दृश्य इनपुट तक विस्तारित किया जा सके।
आर्किटेक्चर
अधिकांश VLM एक दृश्य एन्कोडर, जो अक्सर CNN या विज़न ट्रांसफॉर्मर होता है, को एक भाषा मॉडल बैकबोन के साथ जोड़ते हैं, जो एक प्रोजेक्शन परत द्वारा जुड़ा होता है जो छवि सुविधाओं को टोकन एम्बेडिंग स्पेस में मैप करता है जिसे भाषा मॉडल पहले से समझता है। संयुक्त मॉडल को फिर युग्मित छवि-पाठ डेटा पर प्रशिक्षित या फाइन-ट्यून किया जाता है ताकि भाषा मॉडल दृश्य टोकन पर उसी तरह ध्यान देना सीखे जैसे वह ध्यान तंत्र के माध्यम से पाठ टोकन पर ध्यान देता है। कुछ नए सिस्टम, जिनमें Gemini और GPT-4o शामिल हैं, अलग-अलग पूर्व-प्रशिक्षित भागों से इकट्ठे होने के बजाय मूल रूप से एकीकृत मल्टीमॉडल मॉडल के रूप में प्रशिक्षित होते हैं, जिससे VLM और सामान्य मल्टीमॉडल फाउंडेशन मॉडल के बीच की रेखा धुंधली हो जाती है।
क्षमताएं और उपयोग के मामले
VLM छवियों का वर्णन कर सकते हैं, चार्ट और आरेखों के बारे में प्रश्नों के उत्तर दे सकते हैं, एम्बेडेड पाठ को पढ़ और उस पर तर्क कर सकते हैं (OCR के साथ अतिव्यापी), कई छवियों की तुलना कर सकते हैं, और जब टूल उपयोग या एजेंटिक लूप के साथ संयुक्त होते हैं, तो वे जो देखते हैं उसके आधार पर कार्रवाई कर सकते हैं, जैसे कंप्यूटर-उपयोग एजेंट जो सॉफ़्टवेयर संचालित करने के लिए स्क्रीनशॉट की व्याख्या करते हैं। वे पहुंच सुविधाओं, रोबोटिक्स धारणा, चिकित्सा छवि ट्राइएज उपकरण, और सामग्री मॉडरेशन प्रणालियों को रेखांकित करते हैं जिन्हें छवियों को केवल वर्गीकृत करने के बजाय उन पर तर्क करने की आवश्यकता होती है।
मूल्यांकन और सीमाएं
VLM का मूल्यांकन दृश्य प्रश्न-उत्तर, चार्ट और दस्तावेज़ समझ, और सूक्ष्म पहचान को कवर करने वाले बेंचमार्क पर किया जाता है; सटीक गिनती, स्थानिक संबंधों, या छोटे या घुमाए गए पाठ को पढ़ने की आवश्यकता वाले कार्यों पर प्रदर्शन अभी भी घटता है। अन्य मल्टीमॉडल प्रणालियों की तरह, VLM छवि में अनुपस्थित वस्तुओं या विवरणों को मतिभ्रम कर सकते हैं, एक विफलता मोड जिसे "ऑब्जेक्ट हेलुसिनेशन" के रूप में अध्ययन किया जाता है, और उनका व्यवहार प्रतिकूल या भ्रामक दृश्य इनपुट द्वारा हेरफेर किया जा सकता है, जिसमें छवि में एम्बेडेड पाठ शामिल है जिसे मॉडल एक निर्देश के रूप में मानता है, जो प्रॉम्प्ट इंजेक्शन का एक दृश्य रूप है।
उल्लेखनीय उदाहरण
व्यापक रूप से उपयोग किए जाने वाले VLM और VLM-सक्षम प्रणालियों में CLIP एक मौलिक एन्कोडर के रूप में, खुले शोध समुदाय में LLaVA और इसके उत्तराधिकारी, और प्रमुख प्रयोगशालाओं से मल्टीमॉडल रिलीज़ जैसे Claude, Gemini, और GPT-4/GPT-4o शामिल हैं, जो सभी दृश्य समझ को एक सामान्य-उद्देश्य सहायक में शामिल करते हैं बजाय इसे एक स्टैंडअलोन उत्पाद के रूप में पेश करने के।