Wan 2.1 जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल है जिसे Alibaba Cloud द्वारा पाठ्य विवरणों से चित्र और वीडियो बनाने के लिए विकसित किया गया है। इसे 2025 में एक ओपन-सोर्स मॉडल के रूप में जारी किया गया था, जिससे शोधकर्ताओं और डेवलपर्स इसे विभिन्न अनुप्रयोगों के लिए डाउनलोड और उपयोग कर सकते हैं। यह मॉडल Wan मॉडलों के व्यापक परिवार का हिस्सा है और इसे छवि और वीडियो निर्माण कार्यों दोनों को संभालने के लिए डिज़ाइन किया गया है, जिसमें चीनी और अंग्रेजी सहित कई भाषाओं में टेक्स्ट प्रॉम्प्ट के लिए समर्थन शामिल है।
यह मॉडल डीप लर्निंग आर्किटेक्चर पर आधारित है जो ट्रांसफॉर्मर नेटवर्क और डिफ्यूजन तकनीकों का लाभ उठाता है। यह उच्च-रिज़ॉल्यूशन छवियां और छोटे वीडियो क्लिप उत्पन्न कर सकता है, जिसमें टेक्स्ट-टू-इमेज, टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो निर्माण जैसी क्षमताएं शामिल हैं। Wan 2.1 अपनी दक्षता और गुणवत्ता के लिए उल्लेखनीय है, जो VBench वीडियो निर्माण मूल्यांकन सूट जैसे बेंचमार्क पर प्रतिस्पर्धी परिणाम प्राप्त करता है।
आर्किटेक्चर और प्रशिक्षण
Wan 2.1 U-Net-आधारित डिफ्यूजन बैकबोन का उपयोग मल्टी-हेड अटेंशन तंत्र के साथ करता है, जो अन्य आधुनिक वीडियो निर्माण मॉडल के समान है। मॉडल को युग्मित टेक्स्ट और दृश्य डेटा के बड़े डेटासेट पर प्रशिक्षित किया जाता है, जिसमें सामान्यीकरण में सुधार के लिए डेटा ऑग्मेंटेशन और करिकुलम लर्निंग जैसी तकनीकों का उपयोग किया जाता है। यह परिवर्तनशील पहलू अनुपात और रिज़ॉल्यूशन का समर्थन करता है, जिसमें विशिष्ट आउटपुट आकार वीडियो के लिए 480p से 720p तक और छवियों के लिए 1080p तक होते हैं।
प्रशिक्षण प्रक्रिया Adam ऑप्टिमाइज़ेशन का उपयोग लर्निंग रेट शेड्यूलिंग और ग्रेडिएंट क्लिपिंग के साथ करती है ताकि अभिसरण को स्थिर किया जा सके। मॉडल कई पैरामीटर आकारों में उपलब्ध है, जिसमें छवियों के लिए 1.3 बिलियन पैरामीटर संस्करण और वीडियो निर्माण के लिए 14 बिलियन पैरामीटर संस्करण शामिल है, जिसमें उपभोक्ता हार्डवेयर के लिए अनुकूलित छोटे वेरिएंट हैं।
क्षमताएं और उपयोग के मामले
Wan 2.1 24 फ्रेम प्रति सेकंड पर 5 सेकंड तक की लंबाई के वीडियो उत्पन्न कर सकता है, जिसमें चीनी और अंग्रेजी दोनों प्रॉम्प्ट के लिए समर्थन है। यह एक इमेज-टू-वीडियो सुविधा भी प्रदान करता है, जहां एक स्थिर छवि को टेक्स्ट विवरण के अनुसार एनिमेट किया जा सकता है। मॉडल को रचनात्मक सामग्री निर्माण, विज्ञापन और शैक्षिक मीडिया में अनुप्रयोगों के लिए डिज़ाइन किया गया है, और इसे उद्यम उपयोग के लिए Alibaba Cloud के Model Studio प्लेटफॉर्म में एकीकृत किया गया है।
निर्माण के अलावा, Wan 2.1 में टेक्स्ट-टू-इमेज संपादन क्षमता शामिल है, जो उपयोगकर्ताओं को पाठ्य निर्देशों के आधार पर मौजूदा छवियों को संशोधित करने की अनुमति देती है। मॉडल अवांछित तत्वों को बाहर करने के लिए नकारात्मक प्रॉम्प्ट का समर्थन करता है और कैमरा गति और शैली पर नियंत्रण प्रदान करता है, जिससे यह पेशेवर वीडियो संपादन वर्कफ्लो के लिए उपयुक्त है।
रिलीज़ और उपलब्धता
Wan 2.1 को Apache 2.0 लाइसेंस के तहत ओपन-सोर्स किया गया था, जिसमें मॉडल वेट और इन्फ्रेंस कोड Hugging Face और GitHub जैसे प्लेटफार्मों पर जारी किए गए थे। रिलीज़ में कई वेरिएंट शामिल थे, जैसे Wan2.1-T2V-1.3B और Wan2.1-T2V-14B, जो विभिन्न कंप्यूटेशनल बजट को पूरा करते हैं। ओपन-सोर्स प्रकृति ने सामुदायिक अनुकूलन को जन्म दिया है, जिसमें क्वांटाइज़ेशन और फाइन-ट्यूनिंग स्क्रिप्ट शामिल हैं, जो कम मेमोरी आवश्यकताओं के साथ उपभोक्ता GPU पर तैनाती को सक्षम बनाती हैं।
Alibaba Cloud भी मॉडल को एक प्रबंधित सेवा के रूप में प्रदान करता है, जिसमें वाणिज्यिक उपयोगकर्ताओं के लिए API पहुंच शामिल है। मॉडल को wikiprompt प्लेटफॉर्म पर 423 से अधिक प्रॉम्प्ट में उद्धृत किया गया है, जो AI उत्साही और शोधकर्ताओं के बीच इसकी लोकप्रियता को दर्शाता है।
प्रदर्शन और स्वीकृति
बेंचमार्क मूल्यांकन से पता चलता है कि Wan 2.1 टेक्स्ट-टू-वीडियो निर्माण जैसे कार्यों पर मजबूत प्रदर्शन प्राप्त करता है, जिसमें गति गुणवत्ता और अस्थायी स्थिरता जैसे मेट्रिक्स पर उच्च स्कोर शामिल हैं। स्वतंत्र समीक्षाओं ने जटिल दृश्यों को संभालने और बहुभाषी समर्थन की इसकी क्षमता की प्रशंसा की है, हालांकि कुछ उपयोगकर्ता ध्यान देते हैं कि बड़े वेरिएंट के लिए पर्याप्त GPU मेमोरी की आवश्यकता होती है। मॉडल को OpenAI के Sora और Google DeepMind के Veo जैसे अन्य मॉडलों के साथ ओपन-सोर्स वीडियो निर्माण में एक महत्वपूर्ण योगदान माना जाता है, हालांकि Wan 2.1 पूरी तरह से ओपन-सोर्स होने से खुद को अलग करता है।
यह भी देखें
- Alibaba Cloud
- जनरेटिव AI
- डिफ्यूजन मॉडल
- वीडियो निर्माण