Geração de texto para vídeo é a tarefa de produzir um clipe de vídeo, tipicamente com alguns segundos de duração, a partir de um prompt em linguagem natural. Ela estende as técnicas de texto para imagem para a dimensão temporal, exigindo que um modelo mantenha sujeitos, iluminação e física consistentes entre os quadros, em vez de gerar uma única imagem estática.
História
Os primeiros sistemas de pesquisa em 2022, incluindo o Make-A-Video da Meta e o Imagen Video do Google, adaptaram técnicas de modelo de difusão da geração de imagens, mas produziam clipes curtos, de baixa resolução e frequentemente incoerentes. Os modelos Gen-1 e Gen-2 da Runway, lançados em 2023, estiveram entre as primeiras ferramentas comerciais amplamente acessíveis. O momento mais publicizado do campo veio com o Sora da OpenAI em fevereiro de 2024, apresentado como capaz de gerar clipes de alta resolução com um minuto de duração e descrito pela OpenAI como um passo em direção a "simuladores de mundo" de propósito geral, embora não tenha sido lançado amplamente até mais tarde. O Veo do Google DeepMind seguiu uma trajetória semelhante, com o Veo 3 em 2025 adicionando geração de áudio sincronizada e integração às ferramentas criativas do YouTube. Laboratórios chineses também entraram rapidamente no espaço: o Kling da Kuaishou e o Seedance da ByteDance lideraram os rankings independentes de geração de vídeo durante 2025, refletindo um campo cada vez mais global e competitivo.
Abordagem técnica
A maioria dos sistemas de texto para vídeo estende um modelo de difusão latente com camadas temporais que modelam o movimento entre os quadros, às vezes combinado com uma arquitetura baseada em transformador que opera sobre patches de espaço-tempo em vez de imagens individuais, uma abordagem que a OpenAI descreveu para o Sora. Gerar um vídeo coerente é substancialmente mais difícil do que gerar uma única imagem, pois o modelo deve manter a permanência dos objetos, física plausível e iluminação consistente ao longo do tempo, e os erros tendem a se acumular entre os quadros. Muitos sistemas também suportam imagem para vídeo, animando uma imagem estática fornecida pelo usuário, e alguns permitem controle sobre o movimento da câmera ou a extensão de um clipe existente.
Aplicações e recepção
As ferramentas de texto para vídeo foram adotadas para publicidade, pré-visualização, conteúdo de mídia social e entretenimento de curta duração, com alguns estúdios experimentando a tecnologia para materiais de pitch ou imagens de fundo. A tecnologia atraiu comparações com disrupções anteriores na geração de texto para imagem e na geração de música, incluindo objeções de atores, cineastas e sindicatos sobre o uso de filmagens protegidas por direitos autorais nos dados de treinamento e o potencial deslocamento de empregos na produção; as greves de Hollywood de 2023 citaram preocupações com desempenho e semelhança gerados por IA como uma questão central. As preocupações sobre o uso indevido de deepfakes são especialmente agudas no vídeo, pois um clipe fabricado e realista de uma pessoa real pode se espalhar mais rápido e ser mais persuasivo do que uma imagem estática, levando várias plataformas a exigir ou explorar marca d'água de IA para vídeo gerado por IA.
Limitações
Em 2025, a maioria dos sistemas disponíveis publicamente permanece limitada a clipes de alguns segundos a aproximadamente um minuto, com custo e computação aumentando acentuadamente com resolução e duração. O controle fino sobre diálogos precisos, interações complexas entre múltiplos personagens e coerência narrativa de longo alcance permaneciam problemas em aberto, uma área de competição ativa entre OpenAI, Google DeepMind, Runway e ByteDance AI.