Veo 2 एक Generative AI वीडियो मॉडल है जिसे Google DeepMind द्वारा विकसित किया गया है। 16 दिसंबर 2024 को सार्वजनिक रूप से जारी किया गया, यह टेक्स्ट प्रॉम्प्ट से वीडियो उत्पन्न करता है, जो इसके पूर्ववर्ती Veo की नींव पर आधारित है, जिसे वर्ष की शुरुआत में Google I/O में लॉन्च किया गया था। मॉडल को 4K (4096x2304 पिक्सेल) तक के रिज़ॉल्यूशन पर वीडियो बनाने के लिए डिज़ाइन किया गया है और आठ सेकंड तक की अवधि का समर्थन करता है, कुछ टूल में विस्तारित क्लिप के विकल्प के साथ।
मॉडल एक Machine learning आर्किटेक्चर पर काम करता है जो Deep learning तकनीकों का लाभ उठाता है, विशेष रूप से एक Transformer (architecture)-आधारित ढांचा। यह टेक्स्ट इनपुट को टोकनाइज़र के माध्यम से संसाधित करता है और फ्रेम को संश्लेषित करने के लिए एक अस्थायी प्रसार प्रक्रिया का उपयोग करता है, जिन्हें बाद में U-Net-आधारित परिष्करण नेटवर्क का उपयोग करके अपस्केल किया जाता है। यह दो-चरणीय दृष्टिकोण - पहले अव्यक्त वीडियो प्रतिनिधित्व उत्पन्न करना, फिर उन्हें पूर्ण रिज़ॉल्यूशन तक बढ़ाना - Veo 2 को सुसंगत गति, प्रकाश और भौतिकी के साथ जटिल दृश्यों को संभालने की अनुमति देता है।
क्षमताएँ
Veo 2 प्राकृतिक-भाषा समझ में उत्कृष्ट है, विस्तृत प्रॉम्प्ट को दृश्य रूप से सुसंगत फुटेज में अनुवादित करता है। यह कैमरा गतिविधियों (पैन, ज़ूम, टिल्ट) जैसे सिनेमाई प्रभावों को संभालता है और विभिन्न लेंस प्रकारों का अनुकरण कर सकता है, जिसमें उथली क्षेत्र-गहराई और वाइड-एंगल शॉट शामिल हैं। मॉडल संश्लेषित वीडियो के लिए ऑडियो उत्पादन का भी समर्थन करता है, जो सिंक्रनाइज़ ध्वनि प्रभाव और परिवेशी शोर उत्पन्न करता है, एक सुविधा जो संयुक्त वीडियो-ऑडियो उत्पादन पाइपलाइन के माध्यम से एकीकृत है।
सार्वजनिक बेंचमार्क में, Veo 2 ने 92% की सटीकता दर हासिल की। अंततः, यह आंकड़ा प्रॉम्प्ट पालन और अस्थायी सुसंगतता को मापने वाले आंतरिक परीक्षणों पर इसके प्रदर्शन को दर्शाता है, जो मानव मूल्यांकनकर्ताओं द्वारा किए गए साइड-बाय-साइड मूल्यांकन में OpenAI के Sora और Anthropic-समर्थित टूल जैसे प्रतिद्वंद्वी मॉडलों को पीछे छोड़ देता है।
रिलीज़ और उपलब्धता
Veo 2 को Google के Google Cloud Vertex AI प्लेटफ़ॉर्म के माध्यम से पेश किया गया था, जिससे उद्यम उपयोगकर्ता API के माध्यम से इसे एक्सेस कर सकते हैं। यह Google के उपभोक्ता उत्पादों में भी उपलब्ध हुआ, जिसमें Google VideoFX टूल और YouTube की प्रयोगात्मक सुविधाएँ जैसे Shorts के लिए Dream Screen शामिल हैं। मॉडल को पहले Veo के उत्तराधिकारी के रूप में स्थापित किया गया था, जिसकी सीमित पहुँच थी, और इसके रोलआउट के साथ Google DeepMind की SynthID तकनीक के माध्यम से वॉटरमार्किंग की गई थी ताकि AI-जनित सामग्री को चिह्नित किया जा सके।
दिसंबर 2024 की रिलीज़ तिथि ने Veo 2 को अन्य वीडियो जनरेटरों के साथ प्रतिस्पर्धी परिदृश्य में रखा, जिसमें Runway का Gen-3 और OpenAI का Sora Turbo दोनों 2024 के अंत में लॉन्च हुए। Google DeepMind ने सुरक्षा उपायों पर जोर दिया, इच्छित प्रॉम्प्ट के साथ आउटपुट को संरेखित करने और हानिकारक सामग्री को कम करने के लिए Reinforcement Learning from AI Feedback (RLAIF) (कृत्रिम प्रतिक्रिया से सुदृढीकरण सीखना) लागू किया।
तकनीकी विशिष्टताएँ
इनपुट प्रोसेसिंग एक टोकनाइज़र का उपयोग करती है जो टेक्स्ट को अव्यक्त स्थान में मैप करता है, जो Large language model प्रणालियों के समान है जो Google DeepMind के Multi-Head Attention पर शोध से प्रभावित हैं। उत्पादन 360p रिज़ॉल्यूशन पर एक आधार फ्रेम से शुरू होता है, जिसे एक सुपर-रिज़ॉल्यूशन नेटवर्क के माध्यम से पुनरावृत्त रूप से परिष्कृत और अंतिम आउटपुट तक अपस्केल किया जाता है। मॉडल के प्रशिक्षण में 10,000 घंटे से अधिक लाइसेंस प्राप्त वीडियो फुटेज का डेटासेट शामिल था, हालांकि सटीक विवरण कॉर्पोरेट गोपनीयता के तहत अज्ञात रहते हैं।
अनुमान समय हार्डवेयर के अनुसार भिन्न होता है: एकल NVIDIA A100 GPU पर, पाँच-सेकंड का 1080p क्लिप लगभग 21 मिनट में उत्पन्न किया जा सकता है, जबकि Google Cloud के TPU v5e क्लस्टर पर तैनाती इसे दो मिनट से कम कर देती है। मॉडल के पैरामीटर गणना लगभग 15 बिलियन होने का अनुमान है, जो पेटेंट फाइलिंग और तकनीकी व्हाइटपेपर पर आधारित है, हालांकि Google DeepMind ने इस आंकड़े की आधिकारिक पुष्टि नहीं की है।
सीमाएँ
प्रगति के बावजूद, Veo 2 कुछ कार्यों में संघर्ष करता है। उत्पन्न वीडियो मानव सिल्हूट पर दृश्य कलाकृतियाँ प्रदर्शित कर सकते हैं, जैसे विकृत उंगलियाँ या अप्राकृतिक आँख की गतिविधियाँ, विशेष रूप से कम-रोशनी वाले दृश्यों में। फ्रेम के भीतर टेक्स्ट रेंडरिंग, जैसे संकेत या उपशीर्षक, अक्सर गैर-लैटिन लिपियों के लिए गड़बड़ आउटपुट उत्पन्न करती है। मॉडल की निश्चित उत्पादन लंबाई आठ सेकंड है; लंबे अनुरोधों के लिए कई क्लिप को जोड़ने की आवश्यकता होती है, जो प्रकाश में असंतुलन पैदा कर सकता है।
भौतिकी सिमुलेशन, हालांकि बेहतर है, पूर्ण नहीं है - जटिल अंतःक्रियाओं में वस्तुएँ सतहों से टकरा सकती हैं या गलत गुरुत्वाकर्षण के साथ गिर सकती हैं। आंतरिक परीक्षणों में मानव निर्णय ने Veo 2 को 38% नमूनों में "वास्तविक से अप्रभेद्य" के रूप में मूल्यांकित किया, जो फोटोग्राफिक यथार्थवाद के लिए 50% सीमा से नीचे है।
नैतिक और कानूनी संदर्भ
Veo 2 की तैनाती ने Deep learning दुरुपयोग के बारे में चिंताएँ उठाईं, जिससे Google ने शुरू में अनुमोदित भागीदारों तक पहुँच प्रतिबंधित कर दी। यूरोपीय संघ में, मॉडल का रोलआउट AI अधिनियम के अनुपालन के कारण विलंबित हुआ, विशेष रूप से पारदर्शिता आवश्यकताओं के संबंध में। शैक्षणिक शोधकर्ताओं, जिनमें Carnegie Mellon University और MIT CSAIL समूह शामिल हैं, ने इसकी पहचान भेद्यताओं का अध्ययन किया है, यह पाते हुए कि SynthID वॉटरमार्क संपीड़न के माध्यम से बना रहता है लेकिन प्रतिकूल संपादन के साथ हटाया जा सकता है।
कुछ प्रतिस्पर्धियों के विपरीत, Veo 2 में D-Wave या क्वांटम-कंप्यूटिंग तत्व शामिल नहीं हैं; यह पूरी तरह से शास्त्रीय Neural network त्वरण पर निर्भर करता है। मॉडल की वास्तुकला Runway के Gen-2 जैसी ओपन-सोर्स परियोजनाओं के साथ डिज़ाइन सिद्धांतों को साझा करती है, लेकिन प्रति-फ्रेम यथार्थवाद पर अस्थायी सुसंगतता को प्राथमिकता देने वाले स्वामित्व प्रशिक्षण उद्देश्यों का उपयोग करती है।
स्वागत और भविष्य
उद्योग विश्लेषकों ने Veo 2 को Google DeepMind के लिए एक महत्वपूर्ण कदम के रूप में नोट किया, जो प्रयोगशाला को वास्तविक-विश्व वीडियो संश्लेषण में अग्रणी के रूप में स्थापित करता है। फिल्म निर्माण में प्रारंभिक अपनाने वालों, जैसे Waymo के सिमुलेशन में प्रतिस्पर्धियों, ने सार्वजनिक परिणाम जारी किए बिना प्रशिक्षण परिदृश्य बनाने के लिए इसका परीक्षण किया है। 2025 की शुरुआत तक, Google DeepMind मॉडल पर पुनरावृत्ति जारी रखता है, बढ़ी हुई अवधि और इंटरैक्टिव संपादन के साथ Veo 3 की अटकलों के साथ, हालांकि कोई आधिकारिक घोषणा नहीं की गई है।