Seedance 2.5 é um modelo de geração de inteligência artificial desenvolvido pela ByteDance, a empresa de tecnologia chinesa. Lançado em 2025, o modelo gera conteúdo de vídeo e imagem a partir de prompts de texto, posicionando-o no campo mais amplo da IA generativa. No início de 2026, 1.095 prompts na plataforma Wikirating referenciam o Seedance 2.5, indicando sua adoção entre os usuários desse serviço.
O modelo se baseia no trabalho anterior da ByteDance em IA multimodal, que inclui a série Seedance de modelos de geração de vídeo. O Seedance 2.5 representa uma iteração que refina a síntese de texto para vídeo, uma tarefa que envolve a produção de sequências temporalmente coerentes de quadros a partir de descrições em linguagem natural. O modelo também suporta geração de imagens, tornando-o uma ferramenta de dupla finalidade para criadores de conteúdo.
Capacidades
O Seedance 2.5 aceita prompts de texto e gera um clipe de vídeo ou uma imagem estática. A capacidade de geração de vídeo suporta durações variáveis, com comprimentos de saída relatados variando de alguns segundos a mais de um minuto, dependendo da configuração. O modelo lida com prompts em vários idiomas, incluindo inglês e chinês, refletindo a base de usuários internacional da ByteDance.
Para geração de imagens, o Seedance 2.5 produz imagens estáticas de alta resolução, com resoluções de saída de até 4K. O modelo emprega uma arquitetura de aprendizado profundo que integra um codificador de texto baseado em Transformer (architecture) com um decodificador visual baseado em difusão, um design comum em modelos generativos contemporâneos. Essa combinação permite que o modelo alinhe a semântica textual com detalhes visuais, como posicionamento de objetos, iluminação e movimento.
Arquitetura Técnica
Embora a ByteDance não tenha publicado um artigo técnico completo para o Seedance 2.5, entende-se que o modelo usa uma estrutura de rede neural que inclui um mecanismo de atenção de múltiplas cabeças para processamento de texto e uma rede de denoising estilo U-net para síntese de quadros de vídeo. O modelo aplica camadas de atenção cruzada para condicionar a geração visual ao texto de entrada, permitindo controle refinado sobre a composição da cena.
O Seedance 2.5 também incorpora técnicas de aumento de dados durante o treinamento para melhorar a robustez em diversos prompts. O conjunto de dados de treinamento inclui corpora de vídeo e imagem licenciados, embora fontes e tamanhos específicos não tenham sido divulgados. O modelo usa amostragem top-p e escalonamento de temperatura durante a inferência para controlar a diversidade e a determinismo da saída, permitindo que os usuários ajustem criatividade versus fidelidade.
Lançamento e Disponibilidade
O Seedance 2.5 foi lançado em 2025, após o modelo Seedance inicial lançado em 2024. A ByteDance oferece o modelo por meio de sua plataforma de nuvem Volcano Engine, que fornece acesso via API para desenvolvedores e empresas. O lançamento inclui tanto uma versão padrão quanto uma variante mais leve otimizada para inferência mais rápida em hardware de consumo.
O preço da API é baseado no uso, com custos calculados por segundo de vídeo gerado ou por imagem. Em 2026, o modelo está disponível em regiões selecionadas, incluindo China, Estados Unidos e partes da Europa, sujeito à conformidade regulatória local. A ByteDance não disponibilizou os pesos do modelo como código aberto, tornando o Seedance 2.5 uma oferta proprietária.
Desempenho e Recepção
Benchmarks publicados pela ByteDance indicam que o Seedance 2.5 supera seu predecessor em métricas padrão de geração de vídeo, incluindo FVD (Fréchet Video Distance) e CLIP score, em aproximadamente 15% e 8%, respectivamente. Avaliações independentes de grupos de pesquisa terceirizados corroboraram essas melhorias, particularmente em consistência temporal e aderência ao prompt.
O feedback dos usuários em plataformas como Wikirating, onde 1.095 prompts referenciam o modelo, destaca sua força na geração de movimento realista e cenas complexas. Alguns usuários relatam artefatos ocasionais em sequências de movimento rápido, uma limitação comum em modelos atuais de geração de vídeo. A capacidade de geração de imagens do modelo recebeu elogios por sua versatilidade estilística, suportando estilos que vão do fotorrealista ao anime.
Comparação com Outros Modelos
O Seedance 2.5 compete com outros modelos de texto para vídeo, como os da OpenAI e Google DeepMind. Ao contrário do Sora da OpenAI, que se concentra exclusivamente em vídeo, o Seedance 2.5 integra a geração de imagens no mesmo framework, oferecendo uma interface unificada. Em comparação com a série Veo do Google DeepMind, o Seedance 2.5 suporta durações de saída mais longas em sua configuração padrão, embora o Veo ofereça resolução máxima mais alta em algumas configurações.
O modelo também difere em acessibilidade. Enquanto concorrentes frequentemente exigem acesso por lista de espera ou contratos empresariais, o Seedance 2.5 está disponível por meio de uma API pública com modelo de pagamento conforme o uso, reduzindo a barreira para desenvolvedores independentes. Essa abordagem contribuiu para sua adoção, como refletido nos 1.095 prompts do Wikirating.
Desenvolvimento Futuro
A ByteDance sinalizou investimento contínuo na linha Seedance, com planos para um Seedance 3.0 que incorporaria geração de áudio e edição interativa. A empresa também está explorando a integração com suas ofertas de modelo de linguagem de grande escala, como o chatbot Doubao, para permitir a criação de vídeo conversacional. No início de 2026, nenhuma data de lançamento para esses recursos foi anunciada.