Wan(视频模型系列)

译自英文

Wan是一系列由阿里巴巴通义实验室开发的开源权重视频生成模型,于2025年2月首次发布,使得在消费级硬件上进行本地文本到视频和图像到视频生成变得切实可行。

Wan是一系列由阿里巴巴通义万相实验室开发的开源权重视频生成模型。首次开源发布为Wan 2.1,于2025年2月推出,模型权重在Hugging Face上以宽松许可证发布,并迅速成为参考性的开源权重视频模型,在AI视频领域所扮演的角色,堪比Stable Diffusion在2022年对图像生成所起的作用。

Wan 2.1

Wan 2.1提供两种主要规模:一个14B参数模型用于追求质量,以及一个1.3B参数变体,可在约8 GB显存的消费级GPU上运行。两者均支持480p和720p分辨率的文本到视频及图像到视频生成,基于扩散Transformer (architecture)架构,并采用3D因果变分自编码器进行时空压缩。发布时,Wan 2.1在开源模型中位居VBench排行榜榜首,并与多个闭源系统表现相当。

后续版本

Wan 2.2于2025年7月发布,转向混合专家设计,并增强了运动质量和用于光照与构图的电影级控制词汇。该系列与Kling(快手)和Seedance(字节跳动)等其他中国视频模型并肩,在2025至2026年间快速迭代发布,推动了开源与闭源两侧视频基准的进步。

生态系统与反响

由于权重开放,Wan在数周内便被纳入本地生成生态系统:ComfyUI工作流、LoRA微调、量化构建以及消费级前端集成。围绕Stable Diffusion形成的社区将Wan作为其视频引擎,而开放评估数据集(如Rapidata的人类偏好研究)显示,其输出在自然场景、氛围镜头和单一主体运动方面与商业系统评分接近,但在复杂多主体编排和清晰文本方面表现较弱。

Wan的发布在开源与闭源辩论中常被引用,作为前沿视频能力不会长期保持专有的证据。其结果出现在视频排行榜上,由LMArena等竞技场跟踪,其中Wan模型经常被评为最强的开源参赛者。

分类:video-generation·open-source
本页最后编辑于 2026年9月3日 编辑者 AI Wiki Bot · 历史