Phenaki एक जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल है जिसे गूगल डीपमाइंड द्वारा पाठ्य विवरणों से वीडियो उत्पन्न करने के लिए विकसित किया गया है। इसे प्राकृतिक भाषा संकेतों के आधार पर छोटे क्लिप से लेकर लंबी कथाओं तक, परिवर्तनीय लंबाई के अस्थायी रूप से सुसंगत वीडियो अनुक्रम उत्पन्न करने के लिए डिज़ाइन किया गया है। मॉडल को 2022 में एक शोध पत्र में पेश किया गया था और यह टेक्स्ट-टू-वीडियो जनरेशन में एक महत्वपूर्ण कदम का प्रतिनिधित्व करता है, जो आर्टिफिशियल इंटेलिजेंस, मशीन लर्निंग और डीप लर्निंग तकनीकों को जोड़ता है।
Phenaki की मुख्य वास्तुकला एक ट्रांसफॉर्मर मॉडल पर आधारित है, जो एक प्रकार का तंत्रिका नेटवर्क है जो आधुनिक AI में, विशेष रूप से अनुक्रमिक डेटा से जुड़े कार्यों के लिए, मौलिक बन गया है। पहले के वीडियो जनरेशन मॉडल के विपरीत, जो अक्सर निश्चित-लंबाई, कम-रिज़ॉल्यूशन क्लिप उत्पन्न करते थे, Phenaki परिवर्तनीय संख्या में फ्रेम वाले वीडियो उत्पन्न कर सकता है, जिससे अधिक लचीले और गतिशील आउटपुट की अनुमति मिलती है। यह वीडियो को असतत टोकन के अनुक्रम में संपीड़ित करके प्राप्त करता है, जैसे बड़े भाषा मॉडल पाठ को संसाधित करते हैं, और फिर इनपुट पाठ पर आधारित इन टोकन को ऑटोरेग्रेसिव रूप से उत्पन्न करता है।
वास्तुकला और प्रशिक्षण
Phenaki दो-चरणीय दृष्टिकोण का उपयोग करता है। पहले, एक वीडियो टोकनाइज़र 3D कन्वोल्यूशनल एनकोडर-डिकोडर का उपयोग करके स्पेटियोटेम्पोरल डेटा को दृश्य टोकन के एक कॉम्पैक्ट अनुक्रम में संपीड़ित करता है। यह टोकनाइज़र, वीडियो के एक बड़े डेटासेट पर प्रशिक्षित, आवश्यक दृश्य जानकारी को संरक्षित करते हुए आयामीता को कम करता है। दूसरे, एक ट्रांसफॉर्मर-आधारित ऑटोरेग्रेसिव मॉडल, जो भाषा मॉडलिंग में उपयोग किए जाने वाले मॉडलों के समान है, इन टोकन को अनुक्रमिक रूप से उत्पन्न करता है, जो पाठ संकेत और पहले उत्पन्न टोकन पर आधारित होता है। मॉडल को वीडियो-पाठ जोड़ों के डेटासेट पर प्रशिक्षित किया जाता है, जो दृश्य सामग्री को भाषाई विवरणों के साथ संरेखित करना सीखता है।
प्रशिक्षण प्रक्रिया में एक मास्क्ड टोकन मॉडलिंग उद्देश्य शामिल है, जहां मॉडल एक अनुक्रम में मास्क्ड टोकन की भविष्यवाणी करना सीखता है, जिससे यह एक प्रारंभिक टोकन या पाठ संकेत से सुसंगत वीडियो उत्पन्न करने में सक्षम होता है। यह दृष्टिकोण Phenaki को मनमानी लंबाई के वीडियो उत्पन्न करने की अनुमति देता है, क्योंकि मॉडल एक रोक स्थिति पूरी होने तक टोकन उत्पन्न करना जारी रख सकता है, जैसे अधिकतम लंबाई या एक अंत-अनुक्रम टोकन।
क्षमताएं और विशेषताएं
Phenaki कई प्रकार के पाठ संकेतों से वीडियो उत्पन्न कर सकता है, जिसमें क्रियाओं, दृश्यों और यहां तक कि अस्थायी परिवर्तनों का वर्णन करने वाले संकेत शामिल हैं। उदाहरण के लिए, "एक बिल्ली समुद्र तट पर चल रही है" जैसा संकेत एक बिल्ली के समुद्र तट पर चलने का वीडियो उत्पन्न करेगा, जिसमें मॉडल फ्रेम में अस्थायी स्थिरता सुनिश्चित करता है। मॉडल शून्य-शॉट सामान्यीकरण का भी समर्थन करता है, जिसका अर्थ है कि यह उन संकेतों को संभाल सकता है जो प्रशिक्षण के दौरान स्पष्ट रूप से नहीं देखे गए थे, भाषा और दृश्य अवधारणाओं की अपनी समझ का लाभ उठाकर।
एक उल्लेखनीय विशेषता कई दृश्यों या घटनाओं वाले वीडियो उत्पन्न करने की क्षमता है, क्योंकि मॉडल समय के साथ विभिन्न दृश्य अवस्थाओं के बीच संक्रमण कर सकता है। यह टोकन के ऑटोरेग्रेसिव जनरेशन के माध्यम से प्राप्त किया जाता है, जो मॉडल को आगे की योजना बनाने और कथा सुसंगतता बनाए रखने की अनुमति देता है। हालांकि, आउटपुट रिज़ॉल्यूशन अपेक्षाकृत कम है, आमतौर पर लगभग 128x128 पिक्सेल, और वीडियो छोटे होते हैं, अक्सर कुछ सेकंड, हालांकि लंबाई बढ़ाई जा सकती है।
अन्य मॉडलों के साथ तुलना
Phenaki को अन्य टेक्स्ट-टू-वीडियो मॉडल, जैसे ओपनएआई और अन्य शोध समूहों के मॉडल के आसपास विकसित किया गया था। कुछ मॉडलों के विपरीत जो प्रसार-आधारित दृष्टिकोण का उपयोग करते हैं, Phenaki की ट्रांसफॉर्मर-आधारित विधि एक अलग व्यापार-बंद प्रदान करती है: यह लंबे अनुक्रम उत्पन्न कर सकता है लेकिन उच्च रिज़ॉल्यूशन पर बारीक विवरण के साथ संघर्ष कर सकता है। मॉडल की परिवर्तनीय-लंबाई क्षमता एक प्रमुख विभेदक है, क्योंकि कई समकालीन मॉडल निश्चित-लंबाई क्लिप तक सीमित थे।
जनरेटिव AI के व्यापक संदर्भ में, Phenaki पाठ और वीडियो को जोड़ने वाले मल्टीमॉडल मॉडल के विकास में योगदान देता है। इसकी वास्तुकला ने वीडियो जनरेशन में बाद के शोध को प्रभावित किया है, विशेष रूप से अस्थायी डेटा के लिए टोकनाइजेशन और ऑटोरेग्रेसिव मॉडलिंग के उपयोग में।
सीमाएं और भविष्य की दिशाएं
Phenaki, एक शोध प्रोटोटाइप के रूप में, कई सीमाएं हैं। उत्पन्न वीडियो कम रिज़ॉल्यूशन के होते हैं और कलाकृतियों, जैसे झिलमिलाहट या असंगत वस्तु उपस्थिति, प्रदर्शित कर सकते हैं। मॉडल को प्रशिक्षण और अनुमान के लिए महत्वपूर्ण कम्प्यूटेशनल संसाधनों की भी आवश्यकता होती है, जो इसकी पहुंच को सीमित करता है। इसके अतिरिक्त, प्रशिक्षण डेटा में पूर्वाग्रह हो सकते हैं, और मॉडल उन पूर्वाग्रहों को प्रतिबिंबित करने वाली सामग्री उत्पन्न कर सकता है, जो इसकी तैनाती के बारे में नैतिक चिंताएं उठाता है।
इस क्षेत्र में भविष्य के कार्य का उद्देश्य रिज़ॉल्यूशन, अस्थायी स्थिरता और उत्पन्न सामग्री पर नियंत्रण में सुधार करना है। शोधकर्ता ट्रांसफॉर्मर और प्रसार विधियों को संयोजित करने वाले हाइब्रिड दृष्टिकोण, साथ ही अधिक कुशल टोकनाइजेशन तकनीकों की खोज कर रहे हैं। 2025 तक, टेक्स्ट-टू-वीडियो जनरेशन में काफी प्रगति हुई है, जिसमें उच्च-रिज़ॉल्यूशन और लंबे वीडियो उत्पन्न करने में सक्षम मॉडल हैं, लेकिन Phenaki क्षेत्र में एक मौलिक योगदान बना हुआ है।
प्रभाव और स्वागत
Phenaki की शुरुआत AI शोध समुदाय में रुचि के साथ मिली, क्योंकि इसने एक एकीकृत ट्रांसफॉर्मर वास्तुकला का उपयोग करके पाठ से सुसंगत वीडियो उत्पन्न करने की व्यवहार्यता प्रदर्शित की। इसने जटिल स्पेटियोटेम्पोरल डेटा को संभालने के लिए डीप लर्निंग मॉडल की क्षमता को उजागर किया और रचनात्मक अनुप्रयोगों, जैसे स्वचालित वीडियो उत्पादन और कहानी कहने के लिए सहायक उपकरण, के लिए नए रास्ते खोले। हालांकि व्यावसायिक रूप से तैनात नहीं किया गया, Phenaki के सिद्धांतों ने बाद के मॉडलों को सूचित किया है और चल रहे शोध में प्रासंगिक बने हुए हैं।
यह भी देखें
संदर्भ
- Phenaki: Variable Length Video Generation from Open Domain Textual Descriptions (2022), Google DeepMind शोध पत्र।
- टेक्स्ट-टू-वीडियो संश्लेषण और ऑटोरेग्रेसिव वीडियो जनरेशन में संबंधित कार्य।