मल्टीमॉडल एआई उन मशीन लर्निंग प्रणालियों का वर्णन करता है, विशेष रूप से आधुनिक फाउंडेशन मॉडल, जो एक ही मॉडल के भीतर एक से अधिक प्रकार के डेटा, जैसे पाठ, चित्र, ऑडियो और वीडियो, को स्वीकार, संसाधित और अक्सर उत्पन्न कर सकते हैं, बजाय अलग-अलग विशेष प्रणालियों को जोड़ने के। यह शब्द पहले के यूनिमॉडल प्रणालियों के विपरीत है, जैसे कि केवल-पाठ बड़ा भाषा मॉडल या केवल-चित्र कन्वोल्यूशनल तंत्रिका नेटवर्क वर्गीकारक, जो एक ही इनपुट और आउटपुट प्रकार को संभालते हैं।
इतिहास
मल्टीमॉडल अनुसंधान मॉडलों की वर्तमान पीढ़ी से पहले का है; प्रारंभिक कार्य ने छवि कैप्शनिंग और दृश्य प्रश्न उत्तर जैसे कार्यों के लिए कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण को जोड़ा, जिसमें अलग-अलग एनकोडर छोटे कनेक्टिव नेटवर्क द्वारा जुड़े थे। एक बड़ा कदम OpenAI के CLIP (2021) के साथ आया, जिसने कंट्रास्टिव प्रीट्रेनिंग के माध्यम से चित्रों और पाठ के लिए एक साझा एम्बेडिंग स्थान सीखा, जिससे मॉडल कार्य-विशिष्ट लेबल के बिना दृश्य और भाषाई अवधारणाओं को संबंधित कर सके। CLIP-शैली एम्बेडिंग बाद के पाठ-से-चित्र प्रणालियों के लिए आधारभूत बन गईं, जिसमें डिफ्यूजन-आधारित जनरेशन का मार्गदर्शन शामिल है।
एकीकृत-मॉडल बदलाव
2023 और 2024 के दौरान, अग्रणी प्रयोगशालाओं ने एक पाठ मॉडल पर विज़न एनकोडर जोड़ने से हटकर वास्तव में एकीकृत ट्रांसफॉर्मर-आधारित आर्किटेक्चर को शुरू से ही अंतःस्थापित पाठ, चित्र, ऑडियो और कभी-कभी वीडियो डेटा पर प्रशिक्षित करने की ओर कदम बढ़ाया। Google का जेमिनी, जिसे मूल रूप से मल्टीमॉडल बताया गया है, और OpenAI का GPT-4o ने इस बदलाव का उदाहरण दिया, जो अलग-अलग उप-मॉडलों के बीच रूटिंग के बजाय एक ही मॉडल के भीतर विभिन्न मोडैलिटी में प्रसंस्करण और जनरेशन करते हैं। इसने दृश्य समझ के साथ वास्तविक समय की आवाज़ वार्तालाप, और एक छवि और उसके साथ के पाठ में संयुक्त रूप से तर्क करने की आवश्यकता वाले प्रश्नों के उत्तर देने जैसी क्षमताओं को सक्षम किया।
आर्किटेक्चर
मल्टीमॉडल मॉडल आमतौर पर प्रत्येक मोडैलिटी को एक साझा प्रतिनिधित्व स्थान में टोकनाइज़ या एम्बेड करते हैं जिसे ट्रांसफॉर्मर बैकबोन समान रूप से संसाधित कर सकता है, कभी-कभी चित्रों या ऑडियो के लिए मोडैलिटी-विशिष्ट एनकोडर का उपयोग करते हुए जिनके आउटपुट पाठ टोकन के समान एम्बेडिंग आयाम में प्रोजेक्ट किए जाते हैं। आउटपुट समान रूप से मल्टीमॉडल हो सकता है: एक मॉडल पाठ उत्पन्न कर सकता है, या जनरेशन को डिफ्यूजन-आधारित छवि डिकोडर को सौंप सकता है, जैसा कि Google के नैनो बनाना छवि संपादक जैसी प्रणालियों में होता है। मुख्य ध्यान तंत्र मॉडल को मोडैलिटी में टोकन को संबंधित करने की अनुमति देता है, उदाहरण के लिए एक पाठ विवरण को विशिष्ट छवि क्षेत्रों में आधारित करना।
अनुप्रयोग
मल्टीमॉडल एआई दस्तावेज़ समझ को सक्षम करता है जो OCR-जैसे एम्बेडेड पाठ पढ़ने को लेआउट और छवि समझ के साथ जोड़ता है, पहुंच उपकरण जो छवियों का वर्णन ज़ोर से करते हैं, वीडियो प्रश्न उत्तर, रोबोटिक्स प्रणालियाँ जो दृश्य धारणा को भाषा निर्देशों के साथ जोड़ती हैं, और उपभोक्ता सहायक जो एक फोटो, स्क्रीनशॉट या लाइव कैमरा फ़ीड की व्याख्या करने में सक्षम हैं। विज़न-भाषा मॉडल एक प्रमुख उपश्रेणी है जो विशेष रूप से संयुक्त छवि-पाठ समझ पर केंद्रित है, जबकि मल्टीमॉडल एआई व्यापक छत्र है जिसमें ऑडियो और वीडियो भी शामिल हैं।
मूल्यांकन और सीमाएँ
मल्टीमॉडल प्रणालियों के लिए बेंचमार्क क्रॉस-मोडल तर्क का परीक्षण करते हैं, जैसे कि चार्ट, आरेख या वीडियो अनुक्रमों के बारे में प्रश्नों के उत्तर देना, और प्रदर्शन अभी भी सटीक स्थानिक तर्क, गिनती, या छवियों में घने छोटे पाठ को पढ़ने की आवश्यकता वाले कार्यों पर मानव क्षमता से पीछे है। मॉडल छवि में मौजूद नहीं होने वाले विवरणों को भी मतिभ्रमित कर सकते हैं, और मोडैलिटी का संयोजन प्रॉम्प्ट इंजेक्शन हमलों के लिए सतह क्षेत्र को बढ़ाता है, क्योंकि दुर्भावनापूर्ण निर्देश केवल पाठ के बजाय एक छवि या ऑडियो क्लिप के अंदर छिपाए जा सकते हैं।