अंग्रेज़ी से अनुवादित

Make-A-Video मेटा का टेक्स्ट-टू-वीडियो जनरेशन मॉडल है, जिसे 2022 में घोषित किया गया था, जो जनरेटिव AI और डिफ्यूज़न तकनीकों का उपयोग करके टेक्स्ट प्रॉम्प्ट को छोटे, उच्च-गुणवत्ता वाले वीडियो क्लिप में बदलता है।

Make-A-Video एक Generative AI प्रणाली है जिसे मेटा द्वारा विकसित किया गया है, जो पाठ विवरणों से लघु वीडियो क्लिप उत्पन्न करती है। सितंबर 2022 में घोषित, यह किसी बड़ी प्रौद्योगिकी कंपनी के पहले प्रमुख व्यावसायिक-ग्रेड टेक्स्ट-टू-वीडियो मॉडलों में से एक था, जो टेक्स्ट-टू-इमेज जनरेशन में पहले के कार्यों का अनुसरण करता था। यह प्रणाली यथार्थवादी गति और दृश्यों को प्राकृतिक भाषा संकेतों से संश्लेषित करने के लिए Deep learning और Neural network आर्किटेक्चर में प्रगति, विशेष रूप से डिफ्यूजन मॉडल, का लाभ उठाती है।

यह मॉडल मेटा के छवि जनरेशन में पूर्व शोध पर आधारित है, विशेष रूप से Make-A-Scene प्रणाली पर, और इसे अस्थायी आयाम तक विस्तारित करता है। कुछ पहले के वीडियो जनरेशन दृष्टिकोणों के विपरीत, जिन्हें युग्मित पाठ-वीडियो प्रशिक्षण डेटा की आवश्यकता होती थी, Make-A-Video को मुख्य रूप से अलेबल वीडियो डेटा पर प्रशिक्षित किया गया था और भाषा और दृश्य सामग्री के बीच मानचित्रण सीखने के लिए छवि-पाठ जोड़े का उपयोग किया गया था। इसने इसे व्यापक वीडियो कैप्शनिंग डेटासेट के बिना वीडियो उत्पन्न करने की अनुमति दी, जो एक महत्वपूर्ण व्यावहारिक लाभ था।

Architecture and Training

Make-A-Video तीन-चरणीय पाइपलाइन का उपयोग करता है। पहले, एक पाठ एनकोडर, जो Transformer (architecture) आर्किटेक्चर पर आधारित है, इनपुट संकेत को एक सिमेंटिक एम्बेडिंग में परिवर्तित करता है। दूसरे, एक डिफ्यूजन मॉडल अनुक्रमिक लेटेंट फ्रेम उत्पन्न करता है, जो स्थानिक संरचना और अस्थायी गतिशीलता दोनों को पकड़ता है। तीसरे, एक डिकोडर इन लेटेंट को पूर्ण-रिज़ॉल्यूशन वीडियो फ्रेम में अपस्केल करता है। प्रशिक्षण प्रक्रिया में दो चरण शामिल थे: एक स्थानिक मॉडल जो वस्तु की उपस्थिति और लेआउट को समझने के लिए छवि-पाठ जोड़े पर प्रशिक्षित था, और एक अस्थायी मॉडल जो गति पैटर्न सीखने के लिए अलेबल वीडियो पर प्रशिक्षित था। इस पृथक्करण ने महंगे वीडियो-पाठ डेटासेट की आवश्यकता को कम कर दिया।

मॉडल को सार्वजनिक रूप से उपलब्ध छवियों और वीडियो के एक बड़े संग्रह पर प्रशिक्षित किया गया था, हालांकि मेटा ने सटीक डेटासेट आकारों का खुलासा नहीं किया। प्रणाली 768x768 पिक्सेल तक के रिज़ॉल्यूशन और लगभग पांच सेकंड की लंबाई के वीडियो उत्पन्न कर सकती थी, जिसमें लगभग 16 फ्रेम प्रति सेकंड की फ्रेम दर थी। यह स्रोत छवि के विविधताएं उत्पन्न करने, एक सुचारू संक्रमण बनाने के लिए दो छवियों के बीच अंतर्वेशन करने और एक स्थिर छवि को एनिमेट करने जैसी अतिरिक्त क्षमताओं का भी समर्थन करता था।

Capabilities and Limitations

Make-A-Video जानवरों और वस्तुओं से लेकर अमूर्त अवधारणाओं तक दृश्यों की एक विस्तृत श्रृंखला उत्पन्न कर सकता था, जिसमें सुसंगत गति और संकेत के प्रति उचित पालन था। उदाहरण के लिए, "एक टेडी बियर चित्र बना रहा है जैसा संकेत एक ब्रश चलाते हुए भालू की एक लघु क्लिप उत्पन्न करेगा। हालांकि, मॉडल की उल्लेखनीय सीमाएं थीं। यह जटिल भौतिकी के साथ संघर्ष करता था, जैसे सटीक प्रतिबिंब या वस्तुओं के बीच यथार्थवादी अंतःक्रिया, और कभी-कभी आकार बदलने या झिलमिलाते बनावट जैसे कलाकृतियां उत्पन्न करता था। वीडियो के भीतर पाठ प्रतिपादन भी खराब था, और मॉडल ऑडियो उत्पन्न नहीं कर सकता था। ये मुद्दे प्रारंभिक टेक्स्ट-टू-वीडियो प्रणालियों में आम थे।

मॉडल की आउटपुट गुणवत्ता संकेत विशिष्टता के साथ भिन्न होती थी। अस्पष्ट संकेत अक्सर सामान्य या दोहराव वाली गति उत्पन्न करते थे, जबकि विस्तृत संकेतों ने निष्ठा में सुधार किया। मेटा ने जोर दिया कि प्रणाली एक शोध प्रदर्शन थी, एक परिष्कृत उत्पाद नहीं, और इसे कभी सार्वजनिक API या ओपन-सोर्स मॉडल के रूप में जारी नहीं किया गया। इसके बजाय, मेटा ने एक शोध पत्र और नमूना वीडियो के साथ एक डेमो पृष्ठ प्रकाशित किया, जिसने महत्वपूर्ण मीडिया ध्यान उत्पन्न किया।

Comparison with Contemporaries

Make-A-Video एक प्रतिस्पर्धी परिदृश्य में उभरा। OpenAI ने पहले छवियों के लिए DALL-E 2 जारी किया था, और 2022 में Imagen Video नामक एक वीडियो मॉडल भी पेश किया, हालांकि इसे सार्वजनिक रूप से तैनात नहीं किया गया था। Google DeepMind ने Phenaki, एक टेक्स्ट-टू-वीडियो मॉडल, प्रदर्शित किया था, और Alibaba Cloud और NVIDIA जैसी अन्य प्रयोगशालाएं समान तकनीक की खोज कर रही थीं। Make-A-Video अलेबल वीडियो प्रशिक्षण के उपयोग के लिए अलग खड़ा था, जिसने डेटा आवश्यकताओं को कम किया, और उस समय अपेक्षाकृत उच्च दृश्य गुणवत्ता के लिए। हालांकि, यह पहला नहीं था; सिंघुआ विश्वविद्यालय और चीनी प्रौद्योगिकी कंपनी BAAI के CogVideo जैसी पहले की प्रणालियों ने 2021 में बुनियादी टेक्स्ट-टू-वीडियो जनरेशन दिखाया था।

एक प्रमुख अंतर मेटा का उपयोगकर्ता-अनुकूल आउटपुट और छवि-आधारित प्रायर का एकीकरण था। मॉडल एक एकल छवि ले सकता था और इसे एनिमेट कर सकता था, एक विशेषता जिसने समीक्षकों को प्रभावित किया। इसके विपरीत, कई प्रतियोगियों को कई इनपुट फ्रेम या लंबे संकेतों की आवश्यकता होती थी। व्यापार-बंद यह था कि Make-A-Video के वीडियो छोटे थे और कैमरा कोणों या वस्तु प्रक्षेपवक्र पर बारीक नियंत्रण की कमी थी।

Reception and Impact

Make-A-Video के मीडिया कवरेज काफी हद तक सकारात्मक थे, आउटलेट्स ने मॉडल की सनकी और सुसंगत क्लिप उत्पन्न करने की क्षमता की प्रशंसा की। तकनीकी टिप्पणीकारों ने नोट किया कि यह Artificial intelligence अनुसंधान में स्थिर छवियों से गतिशील सामग्री की ओर बदलाव का संकेत देता है। मॉडल ने नैतिक चिंताएं भी उठाईं, विशेष रूप से डीपफेक और गलत सूचना की संभावना के संबंध में। मेटा ने इन जोखिमों को स्वीकार किया और कहा कि सुरक्षा उपाय विकसित होने तक यह मॉडल सार्वजनिक रूप से जारी नहीं करेगा। कंपनी ने वॉटरमार्किंग और सामग्री उत्पत्ति उपकरणों पर भी चर्चा की, हालांकि इन्हें Make-A-Video के लिए स्वयं लागू नहीं किया गया था।

शोध समुदाय के भीतर, Make-A-Video ने वीडियो डिफ्यूजन मॉडल पर बाद के कार्यों को प्रभावित किया। इसकी आर्किटेक्चर ने मेटा के स्वयं के Emu Video और ModelScope के टेक्स्ट-टू-वीडियो जैसे ओपन-सोर्स परियोजनाओं जैसे बाद की प्रणालियों को प्रेरित किया। "Make-A-Video: Text-to-Video Generation without Text-Video Data" शीर्षक वाला पेपर 2023 के इंटरनेशनल कॉन्फ्रेंस ऑन लर्निंग रिप्रेजेंटेशन्स (ICLR) में प्रस्तुत किया गया था और व्यापक रूप से उद्धृत किया गया है।

Legacy and Future Directions

Make-A-Video एक अंतिम उत्पाद के बजाय एक कदम था। 2023 तक, मेटा अधिक उन्नत वीडियो जनरेशन अनुसंधान पर आगे बढ़ चुका था, जिसमें Emu Video मॉडल शामिल है, जिसने अस्थायी स्थिरता और रिज़ॉल्यूशन में सुधार किया। टेक्स्ट-टू-वीडियो जनरेशन का व्यापक क्षेत्र तेजी से आगे बढ़ा, जिसमें Runway के Gen-2 और Google DeepMind के Lumiere जैसे मॉडल लंबे और अधिक यथार्थवादी आउटपुट पेश करते हैं। Make-A-Video की विरासत यह प्रदर्शित करने में निहित है कि विशाल युग्मित डेटासेट के बिना पाठ से उच्च-गुणवत्ता वाली वीडियो जनरेशन संभव थी, और शोधकर्ताओं और जनता दोनों के बीच अवधारणा को लोकप्रिय बनाने में।

मॉडल ने रचनात्मक उपकरणों के लोकतंत्रीकरण के बारे में चर्चाओं में भी योगदान दिया। हालांकि इसे जारी नहीं किया गया था, इसके सार्वजनिक डेमो ने दिखाया कि कैसे जनरेटिव AI वीडियो उत्पादन की बाधा को कम कर सकता है। 2024 तक, टेक्स्ट-टू-वीडियो मॉडल अधिक सुलभ हो गए हैं, लेकिन Make-A-Video Machine learning-आधारित मीडिया जनरेशन के विकास में एक उल्लेखनीय प्रारंभिक मील का पत्थर बना हुआ है।

See Also

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-video·meta·diffusion-model
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास