Traduzido do inglês

Veo 2 é um modelo generativo de vídeo com IA desenvolvido pelo Google DeepMind, lançado em dezembro de 2024. Ele sintetiza vídeos de alta resolução a partir de prompts de texto, ampliando as capacidades de seu antecessor, Veo, com realismo aprimorado e melhor tratamento de movimento.

Veo 2 é um modelo de vídeo de IA generativa desenvolvido pelo Google DeepMind. Lançado ao público em 16 de dezembro de 2024, ele gera vídeos a partir de prompts de texto, com base no alicerce de seu predecessor, Veo, que foi apresentado no Google I/O no início do ano. O modelo foi projetado para produzir vídeos em resoluções de até 4K (4096x2304 pixels) e suporta durações de até oito segundos, com uma opção para clipes estendidos em determinadas ferramentas.

O modelo opera em uma arquitetura de aprendizado automático que aproveita técnicas de aprendizado profundo, especificamente uma estrutura baseada em transformadores. Ele processa entradas de texto através de um tokenizador e emprega um processo de difusión temporal para sintetizar frames, que são então ampliados usando uma rede de refinamento baseada em U-Net. Esta abordagem em duas etapas - primeiro gerando representações de vídeo latentes e depois aprimorando-as à resolução completa - permite que Veo 2 lide com cenas complexas com movimento, iluminação e física coerentes.

Capacidades

Veo 2 se destaca na compreensão de linguagem natural, traduciendo prompts detalhados em footage visualmente consistente. Ele lida com efeitos cinematográficos como movimentos de cámara (pan, zoom, tilt) e pode emular diferentes tipos de lentes, incluindo profundidade de campo reduzida e tomas grande angulares. O modelo também suporta a geração de áudio para o vídeo sintetizado, produzindo efeitos sonoros sincronizados e ruido ambiente, uma funcionalidade integrada através de um pipeline conjunto de geração de vídeo-áudio.

Em benchmarks públicos, Veo 2 alcanzó uma taxa de precisión de 92%. Eventualmente, esta cifra refletía seu desempeño em testes internos que medían a aderência ao prompt e a coerência temporal, superando modelos rivais como o Sora de OpenAI e ferramentas respaldadas por Anthropic em avaliações lado a lado conduzidas por avaliadores humanos.

Lançamento e Disponibilidade

Veo 2 foi introducido através da plataforma Google Cloud Vertex AI, permitiendo a usuários empresariales acessá-lo via uma API. Também se tornó disponível nos produtos de consumo de Google, incluindo a ferramenta Google VideoFX e os recursos experimentais de YouTube como Dream Screen para Shorts. O modelo foi posicionado como sucessor do primeiro Veo, que tinha acesso limitado, e seu lançamento foi acompanhado por marcas de água através da tecnologia SynthID de Google DeepMind para marcar conteúdo generado por IA.

A data de lançamento de dezembro de 2024 colocó Veo 2 em um panorama competitivo com outros generadores de vídeo, incluindo Gen-3 de Runway e Sora Turbo de OpenAI, ambos lançados a finales de 2024. Google DeepMind enfatizó medidas de segurança, implementando Reinforcement Learning from AI Feedback (RLAIF) (aprendizaje por refuerzo a partir de retroalimentación artificial) para alinear las salidas con los prompts previstos y reducir el contenido dañino.

Especificações Técnicas

O processamento de entrada usa um tokenizador que mapea texto ao espaço latente, similar aos sistemas de modelos de linguagem grandes sombreados pela pesquisa de Google DeepMind sobre atenção multi-cabeza. A generación comienza com um frame base a 360p de resolución, que é iterativamente refinado e ampliado à salida final através de uma rede de super-resolución. O treinamento do modelo usó um conjunto de dados composto por más de 10.000 horas de footage de vídeo licenciado, aunque os detalhes exatos permanecen não divulgados sob confidencialidad corporativa.

Os tempos de inferencia varían según el hardware: em uma única GPU NVIDIA A100, um clipe de cinco segundos a 1080p pode ser generado em aproximadamente 21 minutos, enquanto a implementación em clusters TPU v5e de Google Cloud reduz este tempo a menos de dos minutos. A contagem de parámetros do modelo é estimada em alrededor de 15 mil milhões, com base em registros de patentes e whitepapers técnicos, aunque Google DeepMind não confirmó oficialmente esta cifra.

Limitaciones

A pesar de los avances, Veo 2 enfrenta dificultades con ciertas tareas. Los vídeos generados pueden exhibir artefactos visuales en siluetas humanas, como dedos distorsionados o movimientos oculares no naturales, especialmente en escenas con poca luz. La representación de texto dentro de los frames, como letreros o subtítulos, a menudo produce salidas confusas para escrituras no latinas. El modelo también tiene una duración de generación fija de ocho segundos; solicitudes más largas requieren unir múltiples clips, lo que puede causar discontinuidades en la iluminación.

La simulación de física, aunque mejorada, no es perfecta - los objetos pueden atravesar superficies o caer con gravedad incorrecta en interacciones complejas. El juicio humano en pruebas internas calificó a Veo 2 como "indistinguible de lo real" en el 38% de las muestras, por debajo del umbral del 50% para el realismo fotográfico.

El despliegue de Veo 2 planteó preocupaciones sobre el mal uso del aprendizaje profundo, lo que llevó a Google a restringir el acceso a socios aprobados inicialmente. En la Unión Europea, el lanzamiento del modelo se retrasó debido al cumplimiento de la Ley de IA, específicamente en cuanto a los requisitos de transparencia. Investigadores académicos, incluidos grupos de Universidad Carnegie Mellon y MIT CSAIL, han estudiado sus vulnerabilidades de detección, encontrando que la marca de agua SynthID persiste a través de la compresión pero puede eliminarse con edición adversarial.

A diferencia de algunos competidores, Veo 2 no incorpora elementos de D-Wave o computación cuántica; se basa únicamente en la aceleración clásica de redes neuronales. La arquitectura del modelo comparte principios de diseño con proyectos de código abierto como Gen-2 de Runway, pero emplea objetivos de entrenamiento propietarios que priorizan la coherencia temporal sobre el realismo por frame.

Recepción y Futuro

Analistas de la industria señalaron a Veo 2 como un paso significativo para Google DeepMind, posicionando al laboratorio como líder en la síntesis de vídeo del mundo real. Los primeros adoptantes en la producción cinematográfica, como los competidores de Waymo en simulación, lo han probado para crear escenarios de entrenamiento sin publicar resultados públicos. A principios de 2025, Google DeepMind continúa iterando sobre el modelo, con especulaciones sobre un Veo 3 con mayor duración y edición interactiva, aunque no se ha hecho ningún anuncio oficial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:generative-ai·google-deepmind·video-generation·machine-learning
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico