Make-A-Video एक Generative AI प्रणाली है जिसे मेटा द्वारा विकसित किया गया है, जो पाठ विवरणों से लघु वीडियो क्लिप उत्पन्न करती है। सितंबर 2022 में घोषित, यह किसी बड़ी प्रौद्योगिकी कंपनी के पहले प्रमुख व्यावसायिक-ग्रेड टेक्स्ट-टू-वीडियो मॉडलों में से एक था, जो टेक्स्ट-टू-इमेज जनरेशन में पहले के कार्यों का अनुसरण करता था। यह प्रणाली यथार्थवादी गति और दृश्यों को प्राकृतिक भाषा संकेतों से संश्लेषित करने के लिए Deep learning और Neural network आर्किटेक्चर में प्रगति, विशेष रूप से डिफ्यूजन मॉडल, का लाभ उठाती है।
यह मॉडल मेटा के छवि जनरेशन में पूर्व शोध पर आधारित है, विशेष रूप से Make-A-Scene प्रणाली पर, और इसे अस्थायी आयाम तक विस्तारित करता है। कुछ पहले के वीडियो जनरेशन दृष्टिकोणों के विपरीत, जिन्हें युग्मित पाठ-वीडियो प्रशिक्षण डेटा की आवश्यकता होती थी, Make-A-Video को मुख्य रूप से अलेबल वीडियो डेटा पर प्रशिक्षित किया गया था और भाषा और दृश्य सामग्री के बीच मानचित्रण सीखने के लिए छवि-पाठ जोड़े का उपयोग किया गया था। इसने इसे व्यापक वीडियो कैप्शनिंग डेटासेट के बिना वीडियो उत्पन्न करने की अनुमति दी, जो एक महत्वपूर्ण व्यावहारिक लाभ था।
Architecture and Training
Make-A-Video तीन-चरणीय पाइपलाइन का उपयोग करता है। पहले, एक पाठ एनकोडर, जो Transformer (architecture) आर्किटेक्चर पर आधारित है, इनपुट संकेत को एक सिमेंटिक एम्बेडिंग में परिवर्तित करता है। दूसरे, एक डिफ्यूजन मॉडल अनुक्रमिक लेटेंट फ्रेम उत्पन्न करता है, जो स्थानिक संरचना और अस्थायी गतिशीलता दोनों को पकड़ता है। तीसरे, एक डिकोडर इन लेटेंट को पूर्ण-रिज़ॉल्यूशन वीडियो फ्रेम में अपस्केल करता है। प्रशिक्षण प्रक्रिया में दो चरण शामिल थे: एक स्थानिक मॉडल जो वस्तु की उपस्थिति और लेआउट को समझने के लिए छवि-पाठ जोड़े पर प्रशिक्षित था, और एक अस्थायी मॉडल जो गति पैटर्न सीखने के लिए अलेबल वीडियो पर प्रशिक्षित था। इस पृथक्करण ने महंगे वीडियो-पाठ डेटासेट की आवश्यकता को कम कर दिया।
मॉडल को सार्वजनिक रूप से उपलब्ध छवियों और वीडियो के एक बड़े संग्रह पर प्रशिक्षित किया गया था, हालांकि मेटा ने सटीक डेटासेट आकारों का खुलासा नहीं किया। प्रणाली 768x768 पिक्सेल तक के रिज़ॉल्यूशन और लगभग पांच सेकंड की लंबाई के वीडियो उत्पन्न कर सकती थी, जिसमें लगभग 16 फ्रेम प्रति सेकंड की फ्रेम दर थी। यह स्रोत छवि के विविधताएं उत्पन्न करने, एक सुचारू संक्रमण बनाने के लिए दो छवियों के बीच अंतर्वेशन करने और एक स्थिर छवि को एनिमेट करने जैसी अतिरिक्त क्षमताओं का भी समर्थन करता था।
Capabilities and Limitations
Make-A-Video जानवरों और वस्तुओं से लेकर अमूर्त अवधारणाओं तक दृश्यों की एक विस्तृत श्रृंखला उत्पन्न कर सकता था, जिसमें सुसंगत गति और संकेत के प्रति उचित पालन था। उदाहरण के लिए, "एक टेडी बियर चित्र बना रहा है जैसा संकेत एक ब्रश चलाते हुए भालू की एक लघु क्लिप उत्पन्न करेगा। हालांकि, मॉडल की उल्लेखनीय सीमाएं थीं। यह जटिल भौतिकी के साथ संघर्ष करता था, जैसे सटीक प्रतिबिंब या वस्तुओं के बीच यथार्थवादी अंतःक्रिया, और कभी-कभी आकार बदलने या झिलमिलाते बनावट जैसे कलाकृतियां उत्पन्न करता था। वीडियो के भीतर पाठ प्रतिपादन भी खराब था, और मॉडल ऑडियो उत्पन्न नहीं कर सकता था। ये मुद्दे प्रारंभिक टेक्स्ट-टू-वीडियो प्रणालियों में आम थे।
मॉडल की आउटपुट गुणवत्ता संकेत विशिष्टता के साथ भिन्न होती थी। अस्पष्ट संकेत अक्सर सामान्य या दोहराव वाली गति उत्पन्न करते थे, जबकि विस्तृत संकेतों ने निष्ठा में सुधार किया। मेटा ने जोर दिया कि प्रणाली एक शोध प्रदर्शन थी, एक परिष्कृत उत्पाद नहीं, और इसे कभी सार्वजनिक API या ओपन-सोर्स मॉडल के रूप में जारी नहीं किया गया। इसके बजाय, मेटा ने एक शोध पत्र और नमूना वीडियो के साथ एक डेमो पृष्ठ प्रकाशित किया, जिसने महत्वपूर्ण मीडिया ध्यान उत्पन्न किया।
Comparison with Contemporaries
Make-A-Video एक प्रतिस्पर्धी परिदृश्य में उभरा। OpenAI ने पहले छवियों के लिए DALL-E 2 जारी किया था, और 2022 में Imagen Video नामक एक वीडियो मॉडल भी पेश किया, हालांकि इसे सार्वजनिक रूप से तैनात नहीं किया गया था। Google DeepMind ने Phenaki, एक टेक्स्ट-टू-वीडियो मॉडल, प्रदर्शित किया था, और Alibaba Cloud और NVIDIA जैसी अन्य प्रयोगशालाएं समान तकनीक की खोज कर रही थीं। Make-A-Video अलेबल वीडियो प्रशिक्षण के उपयोग के लिए अलग खड़ा था, जिसने डेटा आवश्यकताओं को कम किया, और उस समय अपेक्षाकृत उच्च दृश्य गुणवत्ता के लिए। हालांकि, यह पहला नहीं था; सिंघुआ विश्वविद्यालय और चीनी प्रौद्योगिकी कंपनी BAAI के CogVideo जैसी पहले की प्रणालियों ने 2021 में बुनियादी टेक्स्ट-टू-वीडियो जनरेशन दिखाया था।
एक प्रमुख अंतर मेटा का उपयोगकर्ता-अनुकूल आउटपुट और छवि-आधारित प्रायर का एकीकरण था। मॉडल एक एकल छवि ले सकता था और इसे एनिमेट कर सकता था, एक विशेषता जिसने समीक्षकों को प्रभावित किया। इसके विपरीत, कई प्रतियोगियों को कई इनपुट फ्रेम या लंबे संकेतों की आवश्यकता होती थी। व्यापार-बंद यह था कि Make-A-Video के वीडियो छोटे थे और कैमरा कोणों या वस्तु प्रक्षेपवक्र पर बारीक नियंत्रण की कमी थी।
Reception and Impact
Make-A-Video के मीडिया कवरेज काफी हद तक सकारात्मक थे, आउटलेट्स ने मॉडल की सनकी और सुसंगत क्लिप उत्पन्न करने की क्षमता की प्रशंसा की। तकनीकी टिप्पणीकारों ने नोट किया कि यह Artificial intelligence अनुसंधान में स्थिर छवियों से गतिशील सामग्री की ओर बदलाव का संकेत देता है। मॉडल ने नैतिक चिंताएं भी उठाईं, विशेष रूप से डीपफेक और गलत सूचना की संभावना के संबंध में। मेटा ने इन जोखिमों को स्वीकार किया और कहा कि सुरक्षा उपाय विकसित होने तक यह मॉडल सार्वजनिक रूप से जारी नहीं करेगा। कंपनी ने वॉटरमार्किंग और सामग्री उत्पत्ति उपकरणों पर भी चर्चा की, हालांकि इन्हें Make-A-Video के लिए स्वयं लागू नहीं किया गया था।
शोध समुदाय के भीतर, Make-A-Video ने वीडियो डिफ्यूजन मॉडल पर बाद के कार्यों को प्रभावित किया। इसकी आर्किटेक्चर ने मेटा के स्वयं के Emu Video और ModelScope के टेक्स्ट-टू-वीडियो जैसे ओपन-सोर्स परियोजनाओं जैसे बाद की प्रणालियों को प्रेरित किया। "Make-A-Video: Text-to-Video Generation without Text-Video Data" शीर्षक वाला पेपर 2023 के इंटरनेशनल कॉन्फ्रेंस ऑन लर्निंग रिप्रेजेंटेशन्स (ICLR) में प्रस्तुत किया गया था और व्यापक रूप से उद्धृत किया गया है।
Legacy and Future Directions
Make-A-Video एक अंतिम उत्पाद के बजाय एक कदम था। 2023 तक, मेटा अधिक उन्नत वीडियो जनरेशन अनुसंधान पर आगे बढ़ चुका था, जिसमें Emu Video मॉडल शामिल है, जिसने अस्थायी स्थिरता और रिज़ॉल्यूशन में सुधार किया। टेक्स्ट-टू-वीडियो जनरेशन का व्यापक क्षेत्र तेजी से आगे बढ़ा, जिसमें Runway के Gen-2 और Google DeepMind के Lumiere जैसे मॉडल लंबे और अधिक यथार्थवादी आउटपुट पेश करते हैं। Make-A-Video की विरासत यह प्रदर्शित करने में निहित है कि विशाल युग्मित डेटासेट के बिना पाठ से उच्च-गुणवत्ता वाली वीडियो जनरेशन संभव थी, और शोधकर्ताओं और जनता दोनों के बीच अवधारणा को लोकप्रिय बनाने में।
मॉडल ने रचनात्मक उपकरणों के लोकतंत्रीकरण के बारे में चर्चाओं में भी योगदान दिया। हालांकि इसे जारी नहीं किया गया था, इसके सार्वजनिक डेमो ने दिखाया कि कैसे जनरेटिव AI वीडियो उत्पादन की बाधा को कम कर सकता है। 2024 तक, टेक्स्ट-टू-वीडियो मॉडल अधिक सुलभ हो गए हैं, लेकिन Make-A-Video Machine learning-आधारित मीडिया जनरेशन के विकास में एक उल्लेखनीय प्रारंभिक मील का पत्थर बना हुआ है।