Make-A-Video मेटा द्वारा विकसित एक जनरेटिव आर्टिफिशियल इंटेलिजेंस प्रणाली है जो पाठ विवरणों को छोटे वीडियो क्लिप में परिवर्तित करती है। 29 सितंबर, 2022 को घोषित, यह एक प्रमुख प्रौद्योगिकी कंपनी से सार्वजनिक रूप से प्रदर्शित पहले टेक्स्ट-टू-वीडियो मॉडलों में से एक था, जो पाठ-से-छवि निर्माण में पिछली प्रगति पर आधारित था। प्रणाली ने डीप लर्निंग और न्यूरल नेटवर्क आर्किटेक्चर के संयोजन का उपयोग करके 768x768 पिक्सेल रिज़ॉल्यूशन पर पांच सेकंड तक के वीडियो तैयार किए, जिसमें विस्तारित क्लिप के लिए वैकल्पिक अतिरिक्त फ्रेम शामिल थे।
यह रिलीज़ मेटा को जनरेटिव एआई के तेजी से विस्तारित क्षेत्र में स्थापित करती है, जिसने उस वर्ष की शुरुआत में छवि संश्लेषण में सफलताएँ देखी थीं। पिछले वीडियो निर्माण प्रयासों के विपरीत, जिन्हें बड़े युग्मित पाठ-वीडियो डेटासेट की आवश्यकता थी, Make-A-Video ने मौजूदा पाठ-छवि प्रशिक्षण डेटा और अनपर्यवेक्षित वीडियो फुटेज का लाभ उठाया, जिससे महंगे लेबल वाले वीडियो कॉर्पोरा की आवश्यकता कम हुई। इस दृष्टिकोण ने मॉडल को अलेबल वीडियो से गति पैटर्न सीखने की अनुमति दी, जबकि पाठ-छवि जोड़ों में दृश्य अर्थशास्त्र को आधारित किया।
तकनीकी आर्किटेक्चर
प्रणाली में तीन मुख्य घटक शामिल थे: एक पाठ-से-छवि आधार मॉडल, एक अस्थायी डिकोडर, और एक फ्रेम इंटरपोलेशन नेटवर्क। पाठ एन्कोडर, जो ट्रांसफॉर्मर आर्किटेक्चर पर आधारित था, पाठ संकेतों को एक अव्यक्त प्रतिनिधित्व में मैप करता था। छवि निर्माण मॉड्यूल, जो मेटा के पहले के Make-A-Scene मॉडल के समान था, पाठ पर आधारित एक स्थिर छवि उत्पन्न करता था। अस्थायी डिकोडर ने फिर इसे फ्रेम के अनुक्रम में विस्तारित किया, संभावित गति गतिशीलता की भविष्यवाणी करना सीखा। अंत में, फ्रेम इंटरपोलेशन नेटवर्क ने चिकनी वीडियो आउटपुट उत्पन्न करने के लिए फ्रेम दर बढ़ाई।
मेटा के शोधकर्ताओं ने मॉडल को 10 मिलियन पाठ-छवि जोड़ों और सार्वजनिक वेब डेटा से प्राप्त 5 मिलियन अनलेबल वीडियो के डेटासेट का उपयोग करके प्रशिक्षित किया। प्रशिक्षण प्रक्रिया में दो चरण शामिल थे: पहले, स्थिर छवियों पर छवि निर्माण घटकों का प्रीट्रेनिंग, फिर वीडियो डेटा पर अस्थायी परतों का फाइन-ट्यूनिंग। इस पदानुक्रमित प्रशिक्षण योजना ने एंड-टू-एंड वीडियो प्रशिक्षण की तुलना में कम्प्यूटेशनल लागत कम की, जिसे आमतौर पर बड़े युग्मित डेटासेट की आवश्यकता होती है।
क्षमताएँ और सीमाएँ
Make-A-Video विविध संकेतों से वीडियो उत्पन्न कर सकता था, जैसे "एक कुत्ता जो सुपरहीरो पोशाक पहने हुए है" या "एक टेडी बियर जो चित्र बना रहा है।" यह छवि-से-वीडियो निर्माण का भी समर्थन करता था, जहाँ उपयोगकर्ता एक स्थिर छवि प्रदान करता था और मॉडल इसे एनिमेट करता था, और वीडियो-से-वीडियो संपादन, जो मौजूदा क्लिप की शैली या सामग्री को बदलता था। प्रणाली 16 फ्रेम प्रति सेकंड पर वीडियो उत्पन्न कर सकती थी, जिसकी अवधि लगभग पांच सेकंड थी, और इंटरपोलेशन नेटवर्क का उपयोग करके लंबे अनुक्रमों तक विस्तारित हो सकती थी।
हालाँकि, मॉडल में उल्लेखनीय सीमाएँ थीं। यह कई वस्तुओं से जुड़े जटिल दृश्यों से जूझता था, अक्सर आकार बदलने या असंगत भौतिकी जैसे कलाकृतियाँ उत्पन्न करता था। वीडियो में पाठ प्रतिपादन अक्सर गड़बड़ होता था, और प्रणाली ऑडियो उत्पन्न नहीं कर सकती थी। रिज़ॉल्यूशन, उस समय के लिए उच्च होते हुए भी, प्रसारण गुणवत्ता से नीचे रहा। मेटा ने इन कमियों को स्वीकार किया, यह देखते हुए कि तकनीक एक शोध प्रदर्शन थी, न कि एक परिष्कृत उत्पाद।
व्यापक संदर्भ और स्वागत
यह रिलीज़ जनरेटिव मॉडल में रुचि की वृद्धि के बीच हुई। 2022 की शुरुआत में, ओपनएआई ने पाठ-से-छवि निर्माण के लिए DALL-E 2 का अनावरण किया था, और गूगल डीपमाइंड ने Imagen का प्रदर्शन किया था। Make-A-Video ने इस प्रतिमान को अस्थायी क्षेत्र तक विस्तारित किया, जिससे शोधकर्ताओं और जनता का ध्यान आकर्षित हुआ। मीडिया कवरेज ने रचनात्मक क्षमता और नैतिक जोखिमों दोनों पर प्रकाश डाला, जिसमें भ्रामक या हानिकारक सामग्री उत्पन्न करने की संभावना शामिल थी।
मेटा ने तुरंत मॉडल को जनता के लिए जारी नहीं किया, इसके बजाय चुनिंदा उपयोगकर्ताओं के लिए एक सीमित वेब डेमो की पेशकश की। कंपनी ने कहा कि यह सुरक्षा उपायों को लागू करने के बाद ही पहुँच की अनुमति देगा, जैसे कि हिंसक, यौन या अन्यथा अनुचित सामग्री को रोकने के लिए फ़िल्टर। यह सतर्क रोलआउट उस समय उद्योग प्रथाओं को प्रतिबिंबित करता था, क्योंकि कंपनियाँ जनरेटिव एआई की दोहरे उपयोग प्रकृति से जूझ रही थीं।
प्रभाव और विरासत
Make-A-Video की रिलीज़ ने पाठ-से-वीडियो निर्माण में आगे के शोध को उत्प्रेरित किया। कुछ महीनों के भीतर, अलीबाबा क्लाउड और विभिन्न शैक्षणिक प्रयोगशालाओं सहित अन्य संगठनों ने समान प्रणालियों की घोषणा की। अंतर्निहित तकनीकें, विशेष रूप से अस्थायी डिकोडर और फ्रेम इंटरपोलेशन का उपयोग, मेटा के अपने Emu Video और रनवे के Gen-2 जैसे तृतीय-पक्ष प्रणालियों सहित बाद के मॉडलों को प्रभावित किया। वीडियो एनोटेशन लागत को कम करने के लिए पाठ-छवि डेटा का लाभ उठाने पर जोर क्षेत्र में एक मानक अभ्यास बन गया।
2024 तक, पाठ-से-वीडियो मॉडल काफी उन्नत हो गए थे, जिनमें लंबे, उच्च-रिज़ॉल्यूशन क्लिप ऑडियो के साथ उत्पन्न करने में सक्षम प्रणालियाँ शामिल थीं। Make-A-Video को इस प्रक्षेपवक्र में एक प्रारंभिक मील का पत्थर माना जाता है, जो अकेले भाषा से सुसंगत गति को संश्लेषित करने की व्यवहार्यता प्रदर्शित करता है। इसकी आर्किटेक्चर और प्रशिक्षण पद्धति ने अनुवर्ती कार्यों की एक पीढ़ी को सूचित किया, जिससे आर्टिफिशियल इंटेलिजेंस और रचनात्मक उपकरणों के इतिहास में इसकी जगह मजबूत हुई।
सुरक्षा और नैतिक विचार
मेटा की घोषणा में दुरुपयोग की संभावना की चर्चा शामिल थी। कंपनी ने जिम्मेदार एआई विकास के प्रति अपनी प्रतिबद्धता पर जोर दिया, यह देखते हुए कि मॉडल का उपयोग दुष्प्रचार या गैर-सहमति वाली सामग्री बनाने के लिए किया जा सकता है। इन जोखिमों को कम करने के लिए, मेटा ने उत्पन्न वीडियो पर वॉटरमार्क लगाने और अंतर्निहित मॉडल तक पहुँच को प्रतिबंधित करने की योजना बनाई। कंपनी ने सिंथेटिक मीडिया के लिए पहचान विधियों में चल रहे शोध के लिए भी प्रतिबद्धता जताई, एक क्षेत्र जो जनरेटिव क्षमताओं के साथ बढ़ेगा।
आलोचकों ने बताया कि ऐसे सुरक्षा उपाय प्रतिक्रियात्मक थे, न कि निवारक, और जनरेटिव एआई विकास की तीव्र गति नियामक ढाँचों से आगे निकल गई। यह बहस, जो बाद के मॉडलों के साथ तेज हुई, 2022 में सार्वजनिक प्रवचन में पहले से ही मौजूद थी। इस प्रकार Make-A-Video ने न केवल एक तकनीकी उपलब्धि के रूप में, बल्कि जनरेटिव एआई द्वारा उत्पन्न सामाजिक चुनौतियों में एक केस स्टडी के रूप में भी कार्य किया।