Traducido del inglés

Wan 2.1 es un modelo de generación de IA lanzado por Alibaba Cloud que produce imágenes y videos a partir de indicaciones de texto, destacado por su disponibilidad de código abierto y su soporte para múltiples idiomas.

Wan 2.1 es un modelo de inteligencia artificial generativa desarrollado por Alibaba Cloud para crear imágenes y videos a partir de descripciones textuales. Fue lanzado en 2025 como un modelo de código abierto, permitiendo a investigadores y desarrolladores descargarlo y usarlo para diversas aplicaciones. El modelo forma parte de una familia más amplia de modelos Wan y está diseñado para manejar tareas de generación de imágenes y videos, con soporte para indicaciones de texto en múltiples idiomas, incluidos chino e inglés.

El modelo se basa en una arquitectura de aprendizaje profundo que aprovecha redes transformer y técnicas de difusión. Puede generar imágenes de alta resolución y clips de video cortos, con capacidades que incluyen generación de texto a imagen, texto a video e imagen a video. Wan 2.1 destaca por su eficiencia y calidad, logrando resultados competitivos en puntos de referencia como el conjunto de evaluación de generación de video VBench.

Arquitectura y Entrenamiento

Wan 2.1 emplea un backbone de difusión basado en U-Net combinado con un mecanismo de atención de múltiples cabezas, similar a otros modelos modernos de generación de video. El modelo se entrena en un gran conjunto de datos de pares de texto y datos visuales, utilizando técnicas como aumento de datos y aprendizaje curricular para mejorar la generalización. Soporta relaciones de aspecto y resoluciones variables, con tamaños de salida típicos que van desde 480p hasta 720p para videos y hasta 1080p para imágenes.

El proceso de entrenamiento utiliza optimización Adam con programación de la tasa de aprendizaje y recorte de gradientes para estabilizar la convergencia. El modelo está disponible en múltiples tamaños de parámetros, incluida una versión de 1.3 mil millones de parámetros para imágenes y una versión de 14 mil millones de parámetros para generación de video, con variantes más pequeñas optimizadas para hardware de consumo.

Capacidades y Casos de Uso

Wan 2.1 puede generar videos de hasta 5 segundos de duración a 24 fotogramas por segundo, con soporte para indicaciones en chino e inglés. También ofrece una función de imagen a video, donde una imagen estática puede animarse según una descripción de texto. El modelo está diseñado para aplicaciones en producción de contenido creativo, publicidad y medios educativos, y ha sido integrado en la plataforma Model Studio de Alibaba Cloud para uso empresarial.

Además de la generación, Wan 2.1 incluye una capacidad de edición de texto a imagen, permitiendo a los usuarios modificar imágenes existentes según instrucciones textuales. El modelo admite indicaciones negativas para excluir elementos no deseados y ofrece control sobre el movimiento de la cámara y el estilo, lo que lo hace adecuado para flujos de trabajo profesionales de edición de video.

Lanzamiento y Disponibilidad

Wan 2.1 fue publicado como código abierto bajo la licencia Apache 2.0, con pesos del modelo y código de inferencia lanzados en plataformas como Hugging Face y GitHub. El lanzamiento incluyó varias variantes, como Wan2.1-T2V-1.3B y Wan2.1-T2V-14B, que se adaptan a diferentes presupuestos computacionales. La naturaleza de código abierto ha llevado a adaptaciones de la comunidad, incluidos scripts de cuantización y ajuste fino, que permiten su implementación en GPU de consumo con requisitos de memoria reducidos.

Alibaba Cloud también ofrece el modelo como un servicio gestionado, con acceso API para usuarios comerciales. El modelo ha sido citado en más de 423 indicaciones en la plataforma wikiprompt, lo que indica su popularidad entre entusiastas de la IA e investigadores.

Rendimiento y Recepción

Las evaluaciones comparativas muestran que Wan 2.1 logra un rendimiento sólido en tareas como la generación de texto a video, con puntuaciones altas en métricas como calidad de movimiento y consistencia temporal. Las reseñas independientes han elogiado su capacidad para manejar escenas complejas y su soporte multilingüe, aunque algunos usuarios señalan que requiere una memoria GPU sustancial para las variantes más grandes. El modelo se considera una contribución significativa a la generación de video de código abierto, junto con otros modelos como Sora de OpenAI y Veo de Google DeepMind, aunque Wan 2.1 se distingue por ser completamente de código abierto.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·alibaba-cloud·video-generation·open-source
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial