译自英文

Wan 2.1是阿里云发布的一款AI生成模型,能够根据文本提示生成图像和视频,因其开源可用性和多语言支持而受到关注。

Wan 2.1 是由阿里云开发的生成式人工智能模型,用于根据文本描述创建图像和视频。该模型于2025年以开源形式发布,允许研究人员和开发者下载并将其用于各种应用。该模型是更广泛的 Wan 模型家族的一部分,旨在处理图像和视频生成任务,并支持包括中文和英文在内的多种语言的文本提示。

该模型基于深度学习架构,利用Transformer网络和扩散技术。它可以生成高分辨率图像和短视频片段,具备文本到图像、文本到视频以及图像到视频的生成能力。Wan 2.1 以其效率和质量著称,在 VBench 视频生成评估套件等基准测试中取得了具有竞争力的结果。

架构与训练

Wan 2.1 采用基于U-Net的扩散主干,并结合多头注意力机制,与其他现代视频生成模型类似。该模型在大型配对文本和视觉数据集上进行训练,使用数据增强课程学习等技术来提高泛化能力。它支持可变的宽高比和分辨率,典型输出尺寸为视频 480p 至 720p,图像最高可达 1080p。

训练过程利用Adam优化器,配合学习率调度梯度裁剪来稳定收敛。该模型提供多种参数规模版本,包括用于图像的 13 亿参数版本和用于视频生成的 140 亿参数版本,并针对消费级硬件优化了较小变体。

能力与应用场景

Wan 2.1 可以生成最长 5 秒、每秒 24 帧的视频,并支持中文和英文提示。它还提供图像到视频功能,即根据文本描述将静态图像动画化。该模型专为创意内容制作、广告和教育媒体等应用而设计,并已集成到阿里云的Model Studio平台中供企业使用。

除生成功能外,Wan 2.1 还包含文本到图像编辑能力,允许用户根据文本指令修改现有图像。该模型支持负面提示以排除不需要的元素,并提供对摄像机运动和风格的控制,使其适用于专业视频编辑工作流程。

发布与可用性

Wan 2.1 在 Apache 2.0 许可证下开源,模型权重和推理代码发布在 Hugging Face 和 GitHub 等平台上。此次发布包含多个变体,如 Wan2.1-T2V-1.3B 和 Wan2.1-T2V-14B,以适应不同的计算预算。开源特性促进了社区改编,包括量化和微调脚本,使得在消费级 GPU 上以降低的内存需求进行部署成为可能。

阿里云还提供该模型的托管服务,为商业用户提供 API 访问。该模型在 wikiprompt 平台上已被引用超过 423 次,表明其在 AI 爱好者和研究人员中的受欢迎程度。

性能与评价

基准评估显示,Wan 2.1 在文本到视频生成等任务上表现出色,在运动质量和时间一致性等指标上得分较高。独立评论称赞其处理复杂场景的能力和多语言支持,但一些用户指出,较大变体需要大量 GPU 内存。该模型被认为是开源视频生成领域的重要贡献,与OpenAI的 Sora 和Google DeepMind的 Veo 等模型并列,但 Wan 2.1 通过完全开源而脱颖而出。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·alibaba-cloud·video-generation·open-source
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史