Traducido del inglés

Veo 2 es un modelo de video generativo de IA desarrollado por Google DeepMind, lanzado en diciembre de 2024. Sintetiza videos de alta resolución a partir de indicaciones de texto, ampliando las capacidades de su predecesor, [[veo|Veo]], con un realismo mejorado y un manejo del movimiento más avanzado.

Veo 2 es un modelo de video de Generative AI desarrollado por Google DeepMind. Lanzado al público el 16 de diciembre de 2024, genera videos a partir de indicaciones de texto, basándose en los cimientos de su predecesor, Veo, que se presentó en Google I/O a principios de año. El modelo está diseñado para producir videos con resoluciones de hasta 4K (4096x2304 píxeles) y admite duraciones de hasta ocho segundos, con una opción para clips extendidos en ciertas herramientas.

El modelo opera sobre una arquitectura de Machine learning que aprovecha técnicas de Deep learning, específicamente un marco basado en Transformer (architecture). Procesa las entradas de texto a través de un tokenizador y emplea un proceso de difusión temporal para sintetizar los fotogramas, que luego se mejoran mediante una red de refinamiento basada en U-Net. Este enfoque de dos etapas - primero generar representaciones de video latentes y luego mejorarlas a resolución completa - permite que Veo 2 maneje escenas complejas con movimiento, iluminación y física coherentes.

Capacidades

Veo 2 sobresale en la comprensión del lenguaje natural, traduciendo indicaciones detalladas en metraje visualmente consistente. Maneja efectos cinematográficos como movimientos de cámara (panorámica, zoom, inclinación) y puede emular diferentes tipos de lentes, incluyendo poca profundidad de campo y tomas gran angular. El modelo también admite la generación de audio para el video sintetizado, produciendo efectos de sonido sincronizados y ruido ambiental, una característica integrada a través de un proceso conjunto de generación de video-audio.

En evaluaciones comparativas públicas, Veo 2 logró una tasa de precisión del 92%. Finalmente, esta cifra reflejó su rendimiento en pruebas internas que miden la adherencia a las indicaciones y la coherencia temporal, superando a modelos rivales como Sora de OpenAI y herramientas respaldadas por Anthropic en evaluaciones comparativas realizadas por evaluadores humanos.

Lanzamiento y Disponibilidad

Veo 2 se presentó a través de la plataforma Google Cloud Vertex AI de Google, permitiendo a los usuarios empresariales acceder a él mediante una API. También estuvo disponible en los productos de consumo de Google, incluyendo la herramienta VideoFX y las funciones experimentales de YouTube como Dream Screen para Shorts. El modelo se posicionó como sucesor del primer Veo, que tenía acceso limitado, y su implementación se acompañó de marcas de agua mediante la tecnología SynthID de Google DeepMind para marcar contenido generado por IA.

La fecha de lanzamiento de diciembre de 2024 colocó a Veo 2 en un panorama competitivo con otros generadores de video, incluyendo Gen-3 de Runway y Sora Turbo de OpenAI, ambos lanzados a finales de 2024. Google DeepMind enfatizó las medidas de seguridad, implementando Reinforcement Learning from AI Feedback (RLAIF) (aprendizaje por refuerzo a partir de retroalimentación artificial) para alinear los resultados con las indicaciones previstas y reducir el contenido dañino.

Especificaciones Técnicas

El procesamiento de entrada utiliza un tokenizador que mapea el texto al espacio latente, similar a los sistemas de Large language model influenciados por la investigación de Google DeepMind sobre Multi-Head Attention. La generación comienza con un fotograma base a resolución 360p, que se refina y mejora iterativamente hasta la salida final mediante una red de superresolución. El entrenamiento del modelo utilizó un conjunto de datos compuesto por más de 10,000 horas de metraje de video con licencia, aunque los detalles exactos permanecen sin revelar bajo confidencialidad corporativa.

Los tiempos de inferencia varían según el hardware: en una sola GPU NVIDIA A100, se puede generar un clip de cinco segundos a 1080p en aproximadamente 21 minutos, mientras que la implementación en clústeres de TPU v5e de Google Cloud reduce esto a menos de dos minutos. Se estima que el número de parámetros del modelo es de alrededor de 15 mil millones, basado en patentes y documentos técnicos, aunque Google DeepMind no ha confirmado oficialmente esta cifra.

Limitaciones

A pesar de los avances, Veo 2 tiene dificultades con ciertas tareas. Los videos generados pueden exhibir artefactos visuales en siluetas humanas, como dedos distorsionados o movimientos oculares poco naturales, especialmente en escenas con poca luz. La representación de texto dentro de los fotogramas, como letreros o subtítulos, a menudo produce resultados confusos para escrituras no latinas. El modelo también tiene una longitud de generación fija de ocho segundos; las solicitudes más largas requieren unir múltiples clips, lo que puede causar discontinuidades en la iluminación.

La simulación de la física, aunque mejorada, no es perfecta: los objetos pueden atravesar superficies o caer con una gravedad incorrecta en interacciones complejas. En pruebas internas, el juicio humano calificó a Veo 2 como "indistinguible de lo real" en el 38% de las muestras, por debajo del umbral del 50% para el realismo fotográfico.

La implementación de Veo 2 planteó preocupaciones sobre el mal uso del Deep learning, lo que llevó a Google a restringir el acceso a socios aprobados inicialmente. En la Unión Europea, el lanzamiento del modelo se retrasó debido al cumplimiento de la Ley de IA, específicamente en cuanto a los requisitos de transparencia. Investigadores académicos, incluidos grupos de Carnegie Mellon University y MIT CSAIL, han estudiado sus vulnerabilidades de detección, encontrando que la marca de agua SynthID persiste a través de la compresión pero puede eliminarse con edición adversarial.

A diferencia de algunos competidores, Veo 2 no incorpora elementos de D-Wave o computación cuántica; se basa únicamente en la aceleración clásica de Neural network. La arquitectura del modelo comparte principios de diseño con proyectos de código abierto como Gen-2 de Runway, pero emplea objetivos de entrenamiento propietarios que priorizan la coherencia temporal sobre el realismo por fotograma.

Recepción y Futuro

Los analistas de la industria señalaron a Veo 2 como un paso significativo para Google DeepMind, posicionando al laboratorio como líder en la síntesis de video del mundo real. Los primeros adoptantes en la producción cinematográfica, como los competidores de Waymo en simulación, lo han probado para crear escenarios de entrenamiento sin publicar resultados públicos. A principios de 2025, Google DeepMind continúa iterando sobre el modelo, con especulaciones sobre un Veo 3 con mayor duración y edición interactiva, aunque no se ha hecho ningún anuncio oficial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:generative-ai·google-deepmind·video-generation·machine-learning
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial