टेक्स्ट-टू-वीडियो जनरेशन एक प्राकृतिक-भाषा प्रॉम्प्ट से वीडियो क्लिप, आमतौर पर कुछ सेकंड लंबी, बनाने का कार्य है। यह टेक्स्ट-टू-इमेज तकनीकों को समय आयाम में विस्तारित करता है, जिसके लिए मॉडल को एक स्थिर छवि उत्पन्न करने के बजाय फ्रेम्स में विषयों, प्रकाश और भौतिकी को सुसंगत रखना आवश्यक होता है।
इतिहास
2022 में प्रारंभिक शोध प्रणालियों, जिनमें मेटा का Make-A-Video और Google का Imagen Video शामिल थे, ने छवि जनरेशन से डिफ्यूजन-मॉडल तकनीकों को अपनाया, लेकिन उन्होंने छोटे, कम-रिज़ॉल्यूशन और अक्सर असंगत क्लिप उत्पन्न किए। रनवे के Gen-1 और Gen-2 मॉडल, जो 2023 में जारी हुए, पहले व्यापक रूप से सुलभ वाणिज्यिक उपकरणों में से थे। इस क्षेत्र का सबसे चर्चित क्षण फरवरी 2024 में ओपनएआई के सोरा के साथ आया, जिसे एक मिनट लंबे, उच्च-रिज़ॉल्यूशन क्लिप उत्पन्न करने में सक्षम के रूप में प्रदर्शित किया गया और ओपनएआई द्वारा सामान्य-उद्देश्य "विश्व सिमुलेटर" की दिशा में एक कदम के रूप में वर्णित किया गया, हालांकि इसे बाद तक व्यापक रूप से जारी नहीं किया गया। गूगल-डीपमाइंड का वीओ समान प्रक्षेपवक्र पर चला, 2025 में Veo 3 ने सिंक्रनाइज़ ऑडियो जनरेशन और YouTube के रचनात्मक उपकरणों में एकीकरण जोड़ा। चीनी प्रयोगशालाओं ने भी इस क्षेत्र में तेज़ी से प्रवेश किया: कुआइशो का क्लिंग और बाइटडांस का सीडांस दोनों 2025 के दौरान स्वतंत्र वीडियो-जनरेशन लीडरबोर्ड में शीर्ष पर रहे, जो एक तेजी से वैश्विक और प्रतिस्पर्धी क्षेत्र को दर्शाता है।
तकनीकी दृष्टिकोण
अधिकांश टेक्स्ट-टू-वीडियो सिस्टम एक लेटेंट डिफ्यूजन मॉडल को अस्थायी परतों के साथ विस्तारित करते हैं जो फ्रेम्स में गति को मॉडल करती हैं, कभी-कभी एक ट्रांसफॉर्मर-आधारित आर्किटेक्चर के साथ संयुक्त, जो एकल छवियों के बजाय स्पेसटाइम पैच पर काम करता है, यह दृष्टिकोण ओपनएआई ने सोरा के लिए वर्णित किया था। एक सुसंगत वीडियो उत्पन्न करना एक एकल छवि की तुलना में काफी कठिन है क्योंकि मॉडल को वस्तु स्थिरता, प्रशंसनीय भौतिकी और समय के साथ सुसंगत प्रकाश बनाए रखना चाहिए, और त्रुटियां फ्रेम्स में बढ़ती जाती हैं। कई सिस्टम इमेज-टू-वीडियो का भी समर्थन करते हैं, जो उपयोगकर्ता द्वारा प्रदान की गई स्थिर छवि को एनिमेट करते हैं, और कुछ कैमरा आंदोलन पर नियंत्रण या मौजूदा क्लिप के विस्तार की अनुमति देते हैं।
अनुप्रयोग और स्वागत
टेक्स्ट-टू-वीडियो उपकरण विज्ञापन, प्रीविज़ुअलाइज़ेशन, सोशल मीडिया सामग्री और लघु-रूप मनोरंजन के लिए अपनाए गए हैं, कुछ स्टूडियो पिच सामग्री या पृष्ठभूमि फुटेज के लिए तकनीक के साथ प्रयोग कर रहे हैं। इस तकनीक ने टेक्स्ट-टू-इमेज जनरेशन और संगीत-जनरेशन में पहले के व्यवधानों से तुलना आकर्षित की, जिसमें अभिनेताओं, फिल्म निर्माताओं और यूनियनों की ओर से प्रशिक्षण डेटा में कॉपीराइट फुटेज के उपयोग और उत्पादन नौकरियों के संभावित विस्थापन पर आपत्तियां शामिल थीं; 2023 के हॉलीवुड हड़तालों ने एआई-जनित प्रदर्शन और समानता संबंधी चिंताओं को एक केंद्रीय मुद्दे के रूप में उद्धृत किया। डीपफेक दुरुपयोग के बारे में चिंताएं वीडियो के लिए विशेष रूप से गंभीर हैं, क्योंकि एक वास्तविक व्यक्ति का यथार्थवादी नकली क्लिप एक स्थिर छवि की तुलना में तेज़ी से फैल सकता है और अधिक प्रेरक हो सकता है, जिससे कई प्लेटफार्मों ने एआई-जनित वीडियो के लिए एआई-वॉटरमार्किंग की आवश्यकता या अन्वेषण किया है।
सीमाएं
2025 तक, अधिकांश सार्वजनिक रूप से उपलब्ध सिस्टम कुछ सेकंड से लेकर लगभग एक मिनट तक के क्लिप तक सीमित हैं, जिसमें लागत और कंप्यूट संसाधन रिज़ॉल्यूशन और लंबाई के साथ तेज़ी से बढ़ते हैं। सटीक संवाद, जटिल बहु-चरित्र इंटरैक्शन और दीर्घ-सीमा कथा सुसंगतता पर बारीक नियंत्रण खुली समस्याएं बनी रहीं, जो ओपनएआई, गूगल डीपमाइंड, रनवे और बाइटडांस-एआई के बीच सक्रिय प्रतिस्पर्धा का क्षेत्र है।