वान (वीडियो मॉडल परिवार)

अंग्रेज़ी से अनुवादित

Wan एलिबाबा के टोंगयी लैब द्वारा विकसित ओपन-वेट वीडियो जनरेशन मॉडल का एक परिवार है, जिसे पहली बार फरवरी 2025 में जारी किया गया था, जिसने उपभोक्ता हार्डवेयर पर स्थानीय टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो जनरेशन को व्यावहारिक बना दिया।

वान ओपन-वेट वीडियो जनरेशन मॉडलों का एक परिवार है, जिसे अलीबाबा की टोंगी वानशियांग प्रयोगशाला द्वारा विकसित किया गया है। पहला ओपन रिलीज़, वान 2.1, फरवरी 2025 में आया, जिसमें मॉडल वेट हगिंग फेस पर एक अनुमेय लाइसेंस के तहत प्रकाशित किए गए, और यह जल्दी ही संदर्भ ओपन-वेट वीडियो मॉडल बन गया, जिसने AI वीडियो के लिए वह भूमिका निभाई जो स्टेबल डिफ्यूजन ने 2022 में छवि जनरेशन के लिए निभाई थी।

वान 2.1

वान 2.1 दो मुख्य आकारों में आया: गुणवत्ता के लिए 14B-पैरामीटर मॉडल और 1.3B-पैरामीटर संस्करण जो लगभग 8 GB VRAM वाले उपभोक्ता GPU पर चलता है। दोनों 480p और 720p पर टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो जनरेशन का समर्थन करते हैं, जो एक डिफ्यूजन Transformer (architecture) आर्किटेक्चर पर आधारित है, जिसमें स्पेटियोटेम्पोरल संपीड़न के लिए 3D कॉज़ल वैरिएशनल ऑटोएनकोडर शामिल है। रिलीज़ के समय, वान 2.1 ने ओपन मॉडलों के बीच VBench लीडरबोर्ड में शीर्ष स्थान प्राप्त किया और कई बंद प्रणालियों के साथ प्रतिस्पर्धी था।

बाद के रिलीज़

वान 2.2, जुलाई 2025 में जारी, एक मिश्रण-ऑफ-एक्सपर्ट्स डिज़ाइन में स्थानांतरित हुआ और बेहतर गति गुणवत्ता तथा प्रकाश और संरचना के लिए सिनेमाई-नियंत्रण शब्दावली जोड़ी। यह परिवार 2025 और 2026 के माध्यम से तेजी से रिलीज़ की लहर में क्लिंग (कुआइशो) और सीडेंस (बाइटडांस) जैसे अन्य चीनी वीडियो मॉडलों के साथ खड़ा है, जिसने ओपन/बंद विभाजन के दोनों पक्षों पर वीडियो बेंचमार्क को आगे बढ़ाया।

पारिस्थितिकी तंत्र और स्वागत

क्योंकि वेट ओपन हैं, वान को हफ्तों के भीतर स्थानीय जनरेशन पारिस्थितिकी तंत्र में शामिल कर लिया गया: ComfyUI वर्कफ़्लो, LoRA फाइन-ट्यून, क्वांटाइज़्ड बिल्ड और उपभोक्ता फ्रंट एंड के साथ एकीकरण। स्टेबल डिफ्यूजन के आसपास बना समुदाय वान को अपने वीडियो इंजन के रूप में अपनाया, और ओपन मूल्यांकन डेटासेट (जैसे रैपिडाटा के मानव प्राथमिकता अध्ययन) दिखाते हैं कि इसके आउटपुट प्राकृतिक दृश्यों, वायुमंडलीय शॉट्स और एकल-विषय गति पर वाणिज्यिक प्रणालियों के करीब रेटेड हैं, जबकि जटिल बहु-विषय कोरियोग्राफी और सुपाठ्य पाठ पर कमजोर प्रदर्शन है।

वान के रिलीज़ अक्सर ओपन बनाम बंद बहस में इस बात के प्रमाण के रूप में उद्धृत किए जाते हैं कि फ्रंटियर-निकट वीडियो क्षमता लंबे समय तक मालिकाना नहीं रहती। इसके परिणाम वीडियो लीडरबोर्ड पर दिखाई देते हैं, जिन्हें LMArena और अन्य एरेना द्वारा ट्रैक किया जाता है, जहां वान मॉडल नियमित रूप से सबसे मजबूत ओपन प्रविष्टियों के रूप में रैंक करते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:video-generation·open-source
इस पृष्ठ को अंतिम बार संपादित किया गया 3 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास