Imagen Video é um modelo de texto para vídeo que foi anunciado pela primeira vez em outubro de 2022. Ele estende as capacidades do modelo de texto para imagem do Google, Imagen, para a síntese de vídeos de alta fidelidade a partir de descrições em linguagem natural. O modelo é um resultado da pesquisa do Google.
O Imagen Video é baseado em uma arquitetura de difusão em cascata. O processo opera em vários estágios: primeiro, um modelo base de difusão gera um vídeo de baixa resolução (16 quadros por segundo) a partir do prompt de texto. Em seguida, uma série de modelos de upsampling espacial e temporal aumentam a resolução do vídeo, primeiro para 1280x768 pixels e depois para 24 quadros por segundo. O modelo usa um codificador de texto baseado em transformadores (T5) para processar o prompt de entrada e guiar o processo de difusão.
As principais inovações do modelo incluem o uso de um upsampler temporal que garante a suavidade do movimento entre os quadros e um upsampler espacial que adiciona detalhes de alta resolução. O modelo foi treinado em um conjunto de dados de pares de texto e vídeo, incluindo dados do LAION-5B.
O Imagen Video pode gerar vídeos de até 5 segundos de duração, em vários estilos, incluindo cinematográfico, aquarela e animação 3D. Ele também pode gerar vídeos em diferentes proporções de aspecto, como 16:9, 9:16 e 1:1.
Em demonstrações, o modelo mostrou a capacidade de animar objetos, gerar narrativas complexas e manter a consistência de identidade dos personagens ao longo dos quadros. No entanto, também apresentou dificuldades em renderizar com precisão mãos humanas e outras partes do corpo.
O Google não lançou publicamente o Imagen Video devido a preocupações com o uso indevido, como a criação de deepfakes e a disseminação de desinformação. A empresa enfatizou a necessidade de uma abordagem responsável para o desenvolvimento e a liberação de tais tecnologias.
O Imagen Video foi comparado a outros modelos de texto para vídeo da época, como o Make-A-Video da Meta. Ambos usavam abordagens de difusão semelhantes, mas o Imagen Video se destacou por sua capacidade de gerar vídeos em alta resolução e com maior fidelidade ao texto.
O modelo foi visto como um avanço significativo no campo da síntese de vídeo, mas também destacou os desafios que permaneciam, como o custo computacional e as limitações na geração de conteúdo complexo.
O Google continuou a desenvolver a família Imagen, lançando o Imagen 2 em dezembro de 2023, o Imagen 3 em agosto de 2024 e o Imagen 4 em maio de 2025. Embora esses modelos focassem em imagens, as capacidades de vídeo pioneiras em 2022 foram integradas às ofertas mais amplas de IA generativa do Google, incluindo serviços do Google Cloud e o assistente Gemini.