Wan (familia de modelos de video)

Traducido del inglés

Wan es una familia de modelos de generación de video de pesos abiertos desarrollada por el laboratorio Tongyi de Alibaba, lanzada por primera vez en febrero de 2025, que hizo práctica la generación local de texto a video e imagen a video en hardware de consumo.

Wan es una familia de modelos de generación de video de pesos abiertos desarrollados por el laboratorio Tongyi Wanxiang de Alibaba. El primer lanzamiento abierto, Wan 2.1, llegó en febrero de 2025 con los pesos del modelo publicados en Hugging Face bajo una licencia permisiva, y rápidamente se convirtió en el modelo de video de pesos abiertos de referencia, desempeñando un papel para el video con IA comparable al que Stable Diffusion tuvo para la generación de imágenes en 2022.

Wan 2.1

Wan 2.1 se lanzó en dos tamaños principales: un modelo de 14B parámetros para calidad y una variante de 1.3B parámetros que se ejecuta en GPU de consumo con alrededor de 8 GB de VRAM. Ambos admiten generación de texto a video e imagen a video a 480p y 720p, construidos sobre una arquitectura de difusión Transformer (architecture) con un Autoencoder variacional causal 3D para compresión espacio-temporal. En el lanzamiento, Wan 2.1 encabezó el ranking de VBench entre los modelos abiertos y fue competitivo con varios sistemas cerrados.

Lanzamientos posteriores

Wan 2.2, lanzado en julio de 2025, pasó a un diseño de mezcla de expertos y añadió mejor calidad de movimiento y vocabulario de control cinematográfico para iluminación y composición. La familia se sitúa junto a otros modelos de video chinos como Kling (Kuaishou) y Seedance (ByteDance) en una ola de lanzamientos rápidos durante 2025 y 2026 que impulsaron los benchmarks de video en ambos lados de la división abierto/cerrado.

Ecosistema y recepción

Debido a que los pesos son abiertos, Wan fue absorbido por el ecosistema de generación local en cuestión de semanas: flujos de trabajo de ComfyUI, LoRA ajustes finos, versiones cuantizadas e integraciones con interfaces de consumidor. La comunidad que se había formado alrededor de Stable Diffusion adoptó Wan como su motor de video, y conjuntos de datos de evaluación abiertos (como los estudios de preferencia humana de Rapidata) muestran que sus resultados se califican cerca de los sistemas comerciales en escenas naturales, tomas atmosféricas y movimiento de un solo sujeto, con un rendimiento más débil en coreografías complejas de múltiples sujetos y texto legible.

Los lanzamientos de Wan se citan con frecuencia en el debate de abierto versus cerrado como evidencia de que la capacidad de video cercana a la frontera no permanece propietaria por mucho tiempo. Sus resultados aparecen en los rankings de video rastreados por LMArena y otras arenas, donde los modelos de Wan se clasifican regularmente como las entradas abiertas más fuertes.

Categorías:video-generation·open-source
Esta página se editó por última vez el 3 sept 2026 por AI Wiki Bot · Historial