अंग्रेज़ी से अनुवादित

बहुविध अधिगम (मल्टीमॉडल लर्निंग) एक प्रकार की गहन अधिगम (डीप लर्निंग) है जो मॉडल प्रदर्शन को बेहतर बनाने के लिए पाठ, ऑडियो, चित्र, या वीडियो जैसे कई डेटा प्रकारों को एकीकृत करती है। इसे 2011 में प्रस्तावित किया गया था और 2023 से बड़े बहुविध मॉडलों (लार्ज मल्टीमॉडल मॉडल्स) के साथ यह तेजी से लोकप्रिय हो गया है।

मल्टीमॉडल लर्निंग एक प्रकार का डीप लर्निंग है जो कई प्रकार के डेटा, जिन्हें मोडैलिटी कहा जाता है, जैसे कि टेक्स्ट, ऑडियो, इमेज या वीडियो, को एकीकृत और संसाधित करता है। यह एकीकरण जटिल डेटा की अधिक समग्र समझ की अनुमति देता है, जिससे विज़ुअल प्रश्न उत्तर, क्रॉस-मोडल रिट्रीवल, टेक्स्ट-से-इमेज जनरेशन, सौंदर्य रैंकिंग और इमेज कैप्शनिंग जैसे कार्यों में मॉडल प्रदर्शन में सुधार होता है। मल्टीमॉडल लर्निंग 2011 में डीप लर्निंग काल की शुरुआत में प्रस्तावित किया गया था। Google Gemini और GPT-4o जैसे बड़े मल्टीमॉडल मॉडल 2023 से तेजी से लोकप्रिय हो गए हैं, जिससे अधिक बहुमुखी प्रतिभा और वास्तविक दुनिया की घटनाओं की व्यापक समझ संभव हुई है।

प्रेरणा

डेटा आमतौर पर विभिन्न मोडैलिटी के साथ आता है जो अलग-अलग जानकारी रखते हैं। उदाहरण के लिए, छवि में प्रस्तुत नहीं की गई जानकारी को व्यक्त करने के लिए छवि को कैप्शन देना बहुत आम है। इसी तरह, कभी-कभी उस जानकारी का वर्णन करने के लिए छवि का उपयोग करना अधिक सीधा होता है जो टेक्स्ट से स्पष्ट नहीं हो सकती है। नतीजतन, यदि समान छवियों में अलग-अलग शब्द दिखाई देते हैं, तो ये शब्द संभवतः एक ही चीज़ का वर्णन करते हैं। इसके विपरीत, यदि एक शब्द का उपयोग स्पष्ट रूप से असमान छवियों का वर्णन करने के लिए किया जाता है, तो ये छवियां एक ही वस्तु का प्रतिनिधित्व कर सकती हैं। इस प्रकार, बहु-मोडल डेटा से निपटने वाले मामलों में, एक ऐसे मॉडल का उपयोग करना महत्वपूर्ण है जो जानकारी को संयुक्त रूप से प्रस्तुत करने में सक्षम हो ताकि मॉडल विभिन्न मोडैलिटी से संयुक्त जानकारी को पकड़ सके।

मल्टीमॉडल ट्रांसफॉर्मर

आधुनिक मल्टीमॉडल सिस्टम अक्सर ट्रांसफॉर्मर आर्किटेक्चर पर निर्भर करते हैं। CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्रीट्रेनिंग) जैसे मॉडल कंट्रास्टिव उद्देश्यों को अनुकूलित करके छवियों और टेक्स्ट के संयुक्त प्रतिनिधित्व सीखते हैं, जिससे मॉडल को छवियों को उनके संबंधित पाठ्य विवरणों के साथ मिलान करने की अनुमति मिलती है। ये दृष्टिकोण बड़े भाषा मॉडल और जनरेटिव एआई में प्रगति पर आधारित हैं, जिसमें OpenAI का GPT-4o और Google DeepMind का Gemini जैसे सिस्टम टेक्स्ट, इमेज और ऑडियो इनपुट में क्षमताओं का प्रदर्शन करते हैं। मल्टी-हेड अटेंशन और क्रॉस-अटेंशन तंत्रों का एकीकरण इन मॉडलों को मोडैलिटी में जानकारी को प्रभावी ढंग से संरेखित करने में सक्षम बनाता है।

मल्टीमॉडल डीप बोल्ट्ज़मैन मशीनें

बोल्ट्ज़मैन मशीन एक प्रकार का स्टोकेस्टिक तंत्रिका नेटवर्क है जिसका आविष्कार 1985 में जेफ्री हिंटन और टेरी सेजनोव्स्की ने किया था। बोल्ट्ज़मैन मशीनों को हॉपफील्ड नेट्स के स्टोकेस्टिक, जनरेटिव समकक्ष के रूप में देखा जा सकता है। उनका नाम सांख्यिकीय यांत्रिकी में बोल्ट्ज़मैन वितरण के नाम पर रखा गया है। बोल्ट्ज़मैन मशीनों में इकाइयों को दो समूहों में विभाजित किया गया है: दृश्य इकाइयाँ और छिपी हुई इकाइयाँ। प्रत्येक इकाई एक न्यूरॉन की तरह है जिसमें एक बाइनरी आउटपुट होता है जो दर्शाता है कि यह सक्रिय है या नहीं। सामान्य बोल्ट्ज़मैन मशीनें किसी भी इकाई के बीच कनेक्शन की अनुमति देती हैं। हालांकि, सामान्य बोल्ट्ज़मैन मशीनों का उपयोग करके सीखना अव्यावहारिक है क्योंकि कम्प्यूटेशनल समय मशीन के आकार के लिए घातीय है। एक अधिक कुशल आर्किटेक्चर को प्रतिबंधित बोल्ट्ज़मैन मशीन कहा जाता है जहां कनेक्शन केवल छिपी हुई इकाई और दृश्य इकाई के बीच अनुमत है।

मल्टीमॉडल डीप बोल्ट्ज़मैन मशीनें विभिन्न प्रकार की जानकारी, जैसे कि छवियों और टेक्स्ट, को एक साथ संसाधित और सीख सकती हैं। यह विशेष रूप से प्रत्येक मोडैलिटी के लिए एक अलग डीप बोल्ट्ज़मैन मशीन रखकर किया जा सकता है, उदाहरण के लिए छवियों के लिए एक और टेक्स्ट के लिए एक, एक अतिरिक्त शीर्ष छिपी परत पर जुड़ा हुआ। ये मॉडल मल्टीमॉडल लर्निंग के शुरुआती दृष्टिकोणों में से थे और कुछ वर्गीकरण और लापता डेटा कार्यों के लिए प्रासंगिक बने हुए हैं।

अनुप्रयोग

मल्टीमॉडल मशीन लर्निंग के विभिन्न डोमेन में कई अनुप्रयोग हैं:

  • क्रॉस-मोडल रिट्रीवल: क्रॉस-मोडल रिट्रीवल उपयोगकर्ताओं को विभिन्न मोडैलिटी में डेटा खोजने की अनुमति देता है (उदाहरण के लिए, टेक्स्ट विवरण के आधार पर छवियों को पुनः प्राप्त करना), मल्टीमीडिया खोज इंजन और सामग्री अनुशंसा प्रणालियों में सुधार करता है।
  • वर्गीकरण और लापता डेटा पुनर्प्राप्ति: मल्टीमॉडल डीप बोल्ट्ज़मैन मशीनें वर्गीकरण कार्यों में सपोर्ट वेक्टर मशीनों और लेटेंट डिरिचलेट आवंटन जैसे पारंपरिक मॉडलों से बेहतर प्रदर्शन करती हैं और मल्टीमॉडल डेटासेट, जैसे कि छवियों और टेक्स्ट में लापता डेटा की भविष्यवाणी कर सकती हैं।
  • स्वास्थ्य देखभाल निदान: मल्टीमॉडल मॉडल चिकित्सा इमेजिंग, जीनोमिक डेटा और रोगी रिकॉर्ड को एकीकृत करते हैं ताकि नैदानिक सटीकता और प्रारंभिक बीमारी का पता लगाने में सुधार हो, विशेष रूप से कैंसर स्क्रीनिंग में।
  • सामग्री निर्माण: DALL-E जैसे मॉडल पाठ्य विवरणों से छवियां उत्पन्न करते हैं, जिससे रचनात्मक उद्योगों को लाभ होता है, जबकि क्रॉस-मोडल रिट्रीवल गतिशील मल्टीमीडिया खोजों को सक्षम बनाता है।
  • रोबोटिक्स और मानव-कंप्यूटर इंटरैक्शन: मल्टीमॉडल लर्निंग भाषण, दृष्टि और स्पर्श जैसे संवेदी इनपुट को एकीकृत करके रोबोटिक्स और एआई में बातचीत में सुधार करता है, स्वायत्त प्रणालियों और मानव-कंप्यूटर इंटरैक्शन में सहायता करता है।
  • भावना पहचान: दृश्य, ऑडियो और टेक्स्ट डेटा को मिलाकर, मल्टीमॉडल सिस्टम भावना विश्लेषण और भावना पहचान को बढ़ाते हैं, जो ग्राहक सेवा, सोशल मीडिया और मार्केटिंग में लागू होते हैं।
  • कोड खोज: स्रोत कोड संरचना (जैसे, अमूर्त सिंटैक्स ट्री) को प्राकृतिक भाषा विवरणों के साथ जोड़ने वाले मल्टीमॉडल प्रतिनिधित्व किसी दिए गए क्वेरी के लिए प्रासंगिक कोड स्निपेट की पुनर्प्राप्ति में सुधार करते हैं। स्रोत कोड को दो-आयामी पिक्सेल छवि के रूप में भी प्रस्तुत किया गया है, उदाहरण के लिए एक विधि के नियंत्रण-प्रवाह ग्राफ को एक काले और सफेद छवि में परिवर्तित करके जिसे कन्वोल्यूशनल तंत्रिका नेटवर्क के साथ संसाधित किया जाता है ताकि मैलवेयर खोजा जा सके।

चुनौतियाँ

मल्टीमॉडल लर्निंग चुनौतीपूर्ण है क्योंकि विभिन्न मोडैलिटी जानकारी को विभिन्न तरीकों से प्रस्तुत और संरचित कर सकती हैं। दो सामान्य चुनौतियाँ हैं संरेखण, यह निर्धारित करना कि विभिन्न मोडैलिटी के कौन से हिस्से एक दूसरे के अनुरूप हैं, और संलयन, यह निर्धारित करना कि मोडैलिटी में जानकारी को कैसे जोड़ा जाना चाहिए। मल्टीमॉडल लर्निंग के वास्तविक दुनिया के अनुप्रयोगों को मल्टीमॉडल एआई के लिए विशिष्ट आगे की चुनौतियों का सामना करना पड़ता है, जिसमें लापता मोडैलिटी शामिल हैं जब एक डेटा स्रोत अनुपलब्ध होता है, उन मोडैलिटी का चयन करना जो अनावश्यक के बजाय पूरक जानकारी प्रदान करते हैं, और डेटा स्रोतों के संयोजन से गोपनीयता जोखिम, जो व्यक्तियों को फिर से पहचाने जाने की अनुमति दे सकते हैं, भले ही वे प्रत्येक स्रोत में अलग से अनाम हों।

भविष्य की दिशाएँ

शोध डेटा संवर्धन और अधिक परिष्कृत संलयन विधियों जैसी तकनीकों के माध्यम से इन चुनौतियों का समाधान करना जारी रखता है। NVIDIA, AMD, और Intel जैसी कंपनियों से कुशल हार्डवेयर का विकास बड़े मल्टीमॉडल मॉडल की कम्प्यूटेशनल मांगों का समर्थन करता है। 2025 तक, मल्टीमॉडल लर्निंग अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है जिसमें उद्योगों में विस्तारित अनुप्रयोग हैं, उपभोक्ता उपकरणों में Apple और Samsung Electronics से लेकर Amazon Web Services, Azure, और Google Cloud जैसे क्लाउड प्रदाताओं तक जो मल्टीमॉडल एआई सेवाएं प्रदान करते हैं।

बाहरी लिंक

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·multimodal-learning·artificial-intelligence·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास