अंग्रेज़ी से अनुवादित

CoDi माइक्रोसॉफ्ट रिसर्च द्वारा विकसित एक मल्टीमॉडल जनरेटिव एआई मॉडल है जो एक एकीकृत डिफ्यूजन-आधारित आर्किटेक्चर का उपयोग करके टेक्स्ट, इमेज, ऑडियो और वीडियो को एक साथ उत्पन्न और समझ सकता है।

CoDi (कम्पोज़ेबल डिफ्यूज़न का संक्षिप्त रूप) जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल है जिसे माइक्रोसॉफ्ट रिसर्च द्वारा विकसित किया गया है, जो एक एकीकृत ढांचे में कई मोडैलिटी - पाठ, चित्र, ऑडियो और वीडियो - को संसाधित और उत्पन्न कर सकता है। पहले के मल्टीमॉडल सिस्टम के विपरीत, जो प्रत्येक डेटा प्रकार के लिए अलग-अलग मॉडल पर निर्भर थे, CoDi एक कम्पोज़ेबल डिफ्यूज़न दृष्टिकोण का उपयोग करता है जो इसे इन मोडैलिटी के किसी भी संयोजन को एक साथ उत्पन्न करने की अनुमति देता है, जैसे कि एक एकल प्रॉम्प्ट से सिंक्रनाइज़ ऑडियो और पाठ कैप्शन के साथ वीडियो बनाना। मॉडल को 2023 के शोध पत्र में पेश किया गया था और यह अधिक एकीकृत मल्टीमॉडल AI प्रणालियों की दिशा में एक कदम का प्रतिनिधित्व करता है।

CoDi डिफ्यूज़न मॉडल की सफलता पर आधारित है, जो मशीन लर्निंग एल्गोरिदम का एक वर्ग है जो यादृच्छिक शोर को संरचित आउटपुट में पुनरावृत्त रूप से परिष्कृत करके डेटा उत्पन्न करता है। इसका प्रमुख नवाचार कई मोडैलिटी-विशिष्ट डिफ्यूज़न प्रक्रियाओं को एक एकल मॉडल में संयोजित करने की क्षमता है, जो प्रशिक्षण के दौरान सभी मोडैलिटी की उपस्थिति की आवश्यकता के बिना क्रॉस-मोडल जनरेशन को सक्षम बनाता है। यह सिस्टम को पिछले दृष्टिकोणों की तुलना में अधिक लचीला और कुशल बनाता है, जिन्हें सभी मोडैलिटी में युग्मित डेटा की आवश्यकता होती थी।

आर्किटेक्चर और डिज़ाइन

CoDi आर्किटेक्चर में कई प्रमुख घटक शामिल हैं। इसके मूल में, यह एक साझा अव्यक्त स्थान का उपयोग करता है जहाँ विभिन्न मोडैलिटी को सतत वैक्टर के रूप में दर्शाया जाता है। प्रत्येक मोडैलिटी का अपना एनकोडर और डिकोडर होता है, लेकिन ये एक कम्पोज़ेबल डिफ्यूज़न ढांचे के माध्यम से जुड़े होते हैं जो मॉडल को किसी भी संयोजन में आउटपुट उत्पन्न करने की अनुमति देता है। मॉडल क्रॉस-मोडल अटेंशन के लिए ट्रांसफॉर्मर-आधारित बैकबोन का उपयोग करता है, जो पाठ, चित्र, ऑडियो और वीडियो डोमेन में प्रतिनिधित्व को संरेखित करने में सक्षम बनाता है।

एक उल्लेखनीय विशेषता प्रशिक्षण के दौरान "ब्रिजिंग" तंत्र का उपयोग है। क्योंकि सभी चार मोडैलिटी में युग्मित डेटा दुर्लभ है, CoDi को चरणों में प्रशिक्षित किया जाता है: पहले व्यक्तिगत मोडैलिटी जोड़ों (जैसे, पाठ-चित्र, पाठ-ऑडियो) पर, फिर त्रिक पर, और अंत में सभी संयोजनों पर। यह चरणबद्ध प्रशिक्षण मॉडल को क्रॉस-मोडल संबंधों को सीखने की अनुमति देता है, भले ही पूर्ण मल्टीमॉडल डेटासेट उपलब्ध न हों।

क्षमताएँ और अनुप्रयोग

CoDi विभिन्न प्रकार के जनरेशन कार्य कर सकता है। उदाहरण के लिए, एक दृश्य का वर्णन करने वाले पाठ प्रॉम्प्ट को देखते हुए, यह सिंक्रनाइज़ ऑडियो और मिलान वाले पाठ विवरण के साथ एक वीडियो उत्पन्न कर सकता है। यह मोडैलिटी में मौजूदा सामग्री को संपादित भी कर सकता है, जैसे कि किसी चित्र की शैली को बदलना जबकि उसकी अर्थ संबंधी सामग्री को संरक्षित रखना, या वीडियो की दृश्य क्रिया से मेल खाने वाले ध्वनि प्रभाव उत्पन्न करना।

मॉडल की कम्पोज़ेबल प्रकृति का अर्थ है कि उपयोगकर्ता किसी भी मोडैलिटी के उपसमुच्चय पर जनरेशन को सशर्त कर सकते हैं। इस लचीलेपन के संभावित अनुप्रयोग सामग्री निर्माण, पहुंच उपकरण (जैसे, चित्रों के लिए ऑडियो विवरण उत्पन्न करना) और इंटरैक्टिव मीडिया उत्पादन में हैं। शोधकर्ताओं ने प्रदर्शित किया है कि CoDi मोडैलिटी में सुसंगत आउटपुट उत्पन्न कर सकता है, उत्पन्न पाठ, दृश्य और ऑडियो के बीच अर्थ संबंधी स्थिरता बनाए रखता है।

प्रशिक्षण और डेटा

CoDi को सार्वजनिक रूप से उपलब्ध डेटासेट पर प्रशिक्षित किया गया था, जिसमें LAION-5B जैसे स्रोतों से चित्र-पाठ जोड़े, ऑडियो-पाठ जोड़े और वीडियो-पाठ डेटासेट शामिल हैं। चरणबद्ध प्रशिक्षण दृष्टिकोण के लिए सावधानीपूर्वक पाठ्यक्रम डिज़ाइन की आवश्यकता थी, जहाँ मॉडल ने पहले सरल जोड़ीवार संरेखण सीखा, इससे पहले कि वह अधिक जटिल मल्टीमॉडल संयोजनों की ओर बढ़े। शोधकर्ताओं ने एनकोडर और डिकोडर को प्रशिक्षित करने के लिए कंट्रास्टिव लर्निंग और डिफ्यूज़न उद्देश्यों के संयोजन का उपयोग किया।

प्रशिक्षण में संबोधित एक चुनौती मोडैलिटी में डेटा उपलब्धता का असंतुलन था। पाठ और चित्र डेटा प्रचुर मात्रा में हैं, जबकि उच्च-गुणवत्ता वाले वीडियो-ऑडियो-पाठ त्रिक दुर्लभ हैं। CoDi का कम्पोज़ेबल डिज़ाइन मॉडल को अप्रत्यक्ष मोडैलिटी संयोजनों को सामान्यीकृत करने के लिए जोड़ीवार डेटा का लाभ उठाने की अनुमति देकर इसे कम करता है।

स्वागत और प्रभाव

CoDi को 2023 के कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में प्रस्तुत किया गया था और मल्टीमॉडल जनरेशन के लिए अपने एकीकृत दृष्टिकोण के लिए ध्यान आकर्षित किया। यह पहले मॉडलों में से एक था जिसने एक एकल ढांचे में सभी चार प्रमुख सामग्री प्रकारों के एक साथ जनरेशन का प्रदर्शन किया, जिसने मल्टीमॉडल लर्निंग और फाउंडेशन मॉडल पर बाद के शोध को प्रभावित किया।

जबकि CoDi मुख्य रूप से एक शोध प्रोटोटाइप था और इसे वाणिज्यिक उत्पाद के रूप में जारी नहीं किया गया था, इसके विचारों ने बाद के एकीकृत मल्टीमॉडल मॉडल पर काम को सूचित किया है, जिसमें OpenAI और Google DeepMind के प्रयास शामिल हैं। मॉडल का कम्पोज़ेबिलिटी और चरणबद्ध प्रशिक्षण पर जोर कुशल मल्टीमॉडल AI की खोज करने वाले अन्य शोध समूहों द्वारा विभिन्न रूपों में अपनाया गया है।

सीमाएँ

CoDi की कई सीमाएँ हैं। इसका आउटपुट रिज़ॉल्यूशन और गुणवत्ता, विशेष रूप से वीडियो के लिए, विशेषीकृत एकल-मोडैलिटी मॉडल की तुलना में कम है। मॉडल लंबी-अवधि की सामग्री और विस्तारित अनुक्रमों पर स्थिरता बनाए रखने में संघर्ष कर सकता है। इसके अतिरिक्त, क्योंकि यह डिफ्यूज़न पर निर्भर करता है, जनरेशन कम्प्यूटेशनल रूप से गहन है, जिसके लिए महत्वपूर्ण GPU संसाधनों की आवश्यकता होती है। चरणबद्ध प्रशिक्षण दृष्टिकोण का यह भी अर्थ है कि दुर्लभ मोडैलिटी संयोजनों पर प्रदर्शन सामान्य जोड़ों की तुलना में कम मजबूत हो सकता है।

नैतिक विचारों में सिंथेटिक मीडिया उत्पन्न करने में दुरुपयोग की संभावना शामिल है। अन्य जनरेटिव मॉडल की तरह, डीपफेक और गलत सूचना के बारे में चिंताएँ हैं, हालाँकि CoDi की शोध स्थिति ने इसके सीधे तैनाती को सीमित कर दिया है।

यह भी देखें

संदर्भ

  • Tang, Z., et al. (2023). CoDi: Composable Diffusion for Real-World Image and Video Generation. CVPR.
  • माइक्रोसॉफ्ट रिसर्च ब्लॉग पोस्ट और CoDi पर तकनीकी दस्तावेज़।
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·multimodal-learning·diffusion-models·microsoft-research
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास