अंग्रेज़ी से अनुवादित

मल्टीमॉडल एआई उन मॉडलों को संदर्भित करता है जो एक एकीकृत प्रणाली के भीतर, पाठ, चित्र, ऑडियो और वीडियो जैसे एक से अधिक डेटा मोडैलिटी में जानकारी को संसाधित और उत्पन्न करते हैं, बजाय अलग-अलग विशेषीकृत पाइपलाइनों के।

मल्टीमॉडल एआई उन मशीन लर्निंग प्रणालियों का वर्णन करता है, विशेष रूप से आधुनिक फाउंडेशन मॉडल, जो एक ही मॉडल के भीतर एक से अधिक प्रकार के डेटा, जैसे पाठ, चित्र, ऑडियो और वीडियो, को स्वीकार, संसाधित और अक्सर उत्पन्न कर सकते हैं, बजाय अलग-अलग विशेष प्रणालियों को जोड़ने के। यह शब्द पहले के यूनिमॉडल प्रणालियों के विपरीत है, जैसे कि केवल-पाठ बड़ा भाषा मॉडल या केवल-चित्र कन्वोल्यूशनल तंत्रिका नेटवर्क वर्गीकारक, जो एक ही इनपुट और आउटपुट प्रकार को संभालते हैं।

इतिहास

मल्टीमॉडल अनुसंधान मॉडलों की वर्तमान पीढ़ी से पहले का है; प्रारंभिक कार्य ने छवि कैप्शनिंग और दृश्य प्रश्न उत्तर जैसे कार्यों के लिए कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण को जोड़ा, जिसमें अलग-अलग एनकोडर छोटे कनेक्टिव नेटवर्क द्वारा जुड़े थे। एक बड़ा कदम OpenAI के CLIP (2021) के साथ आया, जिसने कंट्रास्टिव प्रीट्रेनिंग के माध्यम से चित्रों और पाठ के लिए एक साझा एम्बेडिंग स्थान सीखा, जिससे मॉडल कार्य-विशिष्ट लेबल के बिना दृश्य और भाषाई अवधारणाओं को संबंधित कर सके। CLIP-शैली एम्बेडिंग बाद के पाठ-से-चित्र प्रणालियों के लिए आधारभूत बन गईं, जिसमें डिफ्यूजन-आधारित जनरेशन का मार्गदर्शन शामिल है।

एकीकृत-मॉडल बदलाव

2023 और 2024 के दौरान, अग्रणी प्रयोगशालाओं ने एक पाठ मॉडल पर विज़न एनकोडर जोड़ने से हटकर वास्तव में एकीकृत ट्रांसफॉर्मर-आधारित आर्किटेक्चर को शुरू से ही अंतःस्थापित पाठ, चित्र, ऑडियो और कभी-कभी वीडियो डेटा पर प्रशिक्षित करने की ओर कदम बढ़ाया। Google का जेमिनी, जिसे मूल रूप से मल्टीमॉडल बताया गया है, और OpenAI का GPT-4o ने इस बदलाव का उदाहरण दिया, जो अलग-अलग उप-मॉडलों के बीच रूटिंग के बजाय एक ही मॉडल के भीतर विभिन्न मोडैलिटी में प्रसंस्करण और जनरेशन करते हैं। इसने दृश्य समझ के साथ वास्तविक समय की आवाज़ वार्तालाप, और एक छवि और उसके साथ के पाठ में संयुक्त रूप से तर्क करने की आवश्यकता वाले प्रश्नों के उत्तर देने जैसी क्षमताओं को सक्षम किया।

आर्किटेक्चर

मल्टीमॉडल मॉडल आमतौर पर प्रत्येक मोडैलिटी को एक साझा प्रतिनिधित्व स्थान में टोकनाइज़ या एम्बेड करते हैं जिसे ट्रांसफॉर्मर बैकबोन समान रूप से संसाधित कर सकता है, कभी-कभी चित्रों या ऑडियो के लिए मोडैलिटी-विशिष्ट एनकोडर का उपयोग करते हुए जिनके आउटपुट पाठ टोकन के समान एम्बेडिंग आयाम में प्रोजेक्ट किए जाते हैं। आउटपुट समान रूप से मल्टीमॉडल हो सकता है: एक मॉडल पाठ उत्पन्न कर सकता है, या जनरेशन को डिफ्यूजन-आधारित छवि डिकोडर को सौंप सकता है, जैसा कि Google के नैनो बनाना छवि संपादक जैसी प्रणालियों में होता है। मुख्य ध्यान तंत्र मॉडल को मोडैलिटी में टोकन को संबंधित करने की अनुमति देता है, उदाहरण के लिए एक पाठ विवरण को विशिष्ट छवि क्षेत्रों में आधारित करना।

अनुप्रयोग

मल्टीमॉडल एआई दस्तावेज़ समझ को सक्षम करता है जो OCR-जैसे एम्बेडेड पाठ पढ़ने को लेआउट और छवि समझ के साथ जोड़ता है, पहुंच उपकरण जो छवियों का वर्णन ज़ोर से करते हैं, वीडियो प्रश्न उत्तर, रोबोटिक्स प्रणालियाँ जो दृश्य धारणा को भाषा निर्देशों के साथ जोड़ती हैं, और उपभोक्ता सहायक जो एक फोटो, स्क्रीनशॉट या लाइव कैमरा फ़ीड की व्याख्या करने में सक्षम हैं। विज़न-भाषा मॉडल एक प्रमुख उपश्रेणी है जो विशेष रूप से संयुक्त छवि-पाठ समझ पर केंद्रित है, जबकि मल्टीमॉडल एआई व्यापक छत्र है जिसमें ऑडियो और वीडियो भी शामिल हैं।

मूल्यांकन और सीमाएँ

मल्टीमॉडल प्रणालियों के लिए बेंचमार्क क्रॉस-मोडल तर्क का परीक्षण करते हैं, जैसे कि चार्ट, आरेख या वीडियो अनुक्रमों के बारे में प्रश्नों के उत्तर देना, और प्रदर्शन अभी भी सटीक स्थानिक तर्क, गिनती, या छवियों में घने छोटे पाठ को पढ़ने की आवश्यकता वाले कार्यों पर मानव क्षमता से पीछे है। मॉडल छवि में मौजूद नहीं होने वाले विवरणों को भी मतिभ्रमित कर सकते हैं, और मोडैलिटी का संयोजन प्रॉम्प्ट इंजेक्शन हमलों के लिए सतह क्षेत्र को बढ़ाता है, क्योंकि दुर्भावनापूर्ण निर्देश केवल पाठ के बजाय एक छवि या ऑडियो क्लिप के अंदर छिपाए जा सकते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:multimodal-ai·deep-learning·generative-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास