अंग्रेज़ी से अनुवादित

विज़न-भाषा मॉडल (VLM) एक प्रकार की मल्टीमॉडल AI प्रणाली है जिसे छवियों और पाठ पर संयुक्त रूप से प्रशिक्षित किया जाता है, ताकि छवि कैप्शनिंग, दृश्य प्रश्न-उत्तर, और दोनों मोडैलिटी के बीच आधारित तर्क जैसे कार्य किए जा सकें।

एक विज़न-लैंग्वेज मॉडल (VLM) एक मल्टीमॉडल प्रणाली है जिसे छवियों और पाठ को संयुक्त रूप से समझने के लिए प्रशिक्षित किया जाता है, जिससे छवि कैप्शनिंग, दृश्य प्रश्न-उत्तर, छवि-पाठ पुनर्प्राप्ति, और आधारित तर्क जैसे कार्य सक्षम होते हैं जो भाषा को विशिष्ट दृश्य सामग्री से जोड़ते हैं। VLM व्यापक फाउंडेशन मॉडल श्रेणी के अंतर्गत आते हैं और आमतौर पर ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित होते हैं।

इतिहास

आधुनिक VLM का पता OpenAI के CLIP (2021) से लगाया जा सकता है, जिसने वेब से स्क्रैप किए गए सैकड़ों मिलियन छवि-पाठ जोड़ों पर कंट्रास्टिव लर्निंग का उपयोग करके छवियों और उनके कैप्शन को एक साझा एम्बेडिंग स्पेस में संरेखित किया, बिना हाथ से लेबल की गई श्रेणियों की आवश्यकता के। CLIP के एम्बेडिंग वर्गीकरण से कहीं आगे उपयोगी साबित हुए, जिसने प्रारंभिक टेक्स्ट-टू-इमेज प्रणालियों में मार्गदर्शन तंत्र को शक्ति प्रदान की और बाद के मॉडलों के लिए एक मानक दृश्य एन्कोडर बन गया। 2021-2023 के दौरान, Flamingo, BLIP, और LLaVA जैसे मॉडलों ने एक स्थिर या हल्के-ट्यून किए गए दृश्य एन्कोडर को एक पूर्व-प्रशिक्षित बड़े भाषा मॉडल से जोड़ने के तरीकों की खोज की, जिससे भाषा मॉडल के तर्क और ज्ञान को अपेक्षाकृत कम अतिरिक्त प्रशिक्षण के साथ दृश्य इनपुट तक विस्तारित किया जा सके।

आर्किटेक्चर

अधिकांश VLM एक दृश्य एन्कोडर, जो अक्सर CNN या विज़न ट्रांसफॉर्मर होता है, को एक भाषा मॉडल बैकबोन के साथ जोड़ते हैं, जो एक प्रोजेक्शन परत द्वारा जुड़ा होता है जो छवि सुविधाओं को टोकन एम्बेडिंग स्पेस में मैप करता है जिसे भाषा मॉडल पहले से समझता है। संयुक्त मॉडल को फिर युग्मित छवि-पाठ डेटा पर प्रशिक्षित या फाइन-ट्यून किया जाता है ताकि भाषा मॉडल दृश्य टोकन पर उसी तरह ध्यान देना सीखे जैसे वह ध्यान तंत्र के माध्यम से पाठ टोकन पर ध्यान देता है। कुछ नए सिस्टम, जिनमें Gemini और GPT-4o शामिल हैं, अलग-अलग पूर्व-प्रशिक्षित भागों से इकट्ठे होने के बजाय मूल रूप से एकीकृत मल्टीमॉडल मॉडल के रूप में प्रशिक्षित होते हैं, जिससे VLM और सामान्य मल्टीमॉडल फाउंडेशन मॉडल के बीच की रेखा धुंधली हो जाती है।

क्षमताएं और उपयोग के मामले

VLM छवियों का वर्णन कर सकते हैं, चार्ट और आरेखों के बारे में प्रश्नों के उत्तर दे सकते हैं, एम्बेडेड पाठ को पढ़ और उस पर तर्क कर सकते हैं (OCR के साथ अतिव्यापी), कई छवियों की तुलना कर सकते हैं, और जब टूल उपयोग या एजेंटिक लूप के साथ संयुक्त होते हैं, तो वे जो देखते हैं उसके आधार पर कार्रवाई कर सकते हैं, जैसे कंप्यूटर-उपयोग एजेंट जो सॉफ़्टवेयर संचालित करने के लिए स्क्रीनशॉट की व्याख्या करते हैं। वे पहुंच सुविधाओं, रोबोटिक्स धारणा, चिकित्सा छवि ट्राइएज उपकरण, और सामग्री मॉडरेशन प्रणालियों को रेखांकित करते हैं जिन्हें छवियों को केवल वर्गीकृत करने के बजाय उन पर तर्क करने की आवश्यकता होती है।

मूल्यांकन और सीमाएं

VLM का मूल्यांकन दृश्य प्रश्न-उत्तर, चार्ट और दस्तावेज़ समझ, और सूक्ष्म पहचान को कवर करने वाले बेंचमार्क पर किया जाता है; सटीक गिनती, स्थानिक संबंधों, या छोटे या घुमाए गए पाठ को पढ़ने की आवश्यकता वाले कार्यों पर प्रदर्शन अभी भी घटता है। अन्य मल्टीमॉडल प्रणालियों की तरह, VLM छवि में अनुपस्थित वस्तुओं या विवरणों को मतिभ्रम कर सकते हैं, एक विफलता मोड जिसे "ऑब्जेक्ट हेलुसिनेशन" के रूप में अध्ययन किया जाता है, और उनका व्यवहार प्रतिकूल या भ्रामक दृश्य इनपुट द्वारा हेरफेर किया जा सकता है, जिसमें छवि में एम्बेडेड पाठ शामिल है जिसे मॉडल एक निर्देश के रूप में मानता है, जो प्रॉम्प्ट इंजेक्शन का एक दृश्य रूप है।

उल्लेखनीय उदाहरण

व्यापक रूप से उपयोग किए जाने वाले VLM और VLM-सक्षम प्रणालियों में CLIP एक मौलिक एन्कोडर के रूप में, खुले शोध समुदाय में LLaVA और इसके उत्तराधिकारी, और प्रमुख प्रयोगशालाओं से मल्टीमॉडल रिलीज़ जैसे Claude, Gemini, और GPT-4/GPT-4o शामिल हैं, जो सभी दृश्य समझ को एक सामान्य-उद्देश्य सहायक में शामिल करते हैं बजाय इसे एक स्टैंडअलोन उत्पाद के रूप में पेश करने के।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·multimodal-ai·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास