Por três anos, todo modelo de vídeo com IA te entregou basicamente a mesma coisa: um clipe lindo de cinco segundos que acaba bem quando fica interessante. Toda a prática de vídeo com IA foi construída em cima dessa restrição — fazer storyboard em batidas, gerar em fragmentos, costurar na edição e torcer para a jaqueta do personagem ter a mesma cor no take quatro que tinha no take um.
Seedance 2.5, o novo modelo de vídeo da ByteDance, é o primeiro lançamento mainstream que ataca a restrição em si, não apenas os pixels. Ele gera 30 segundos completos em uma única passada — sem costura, sem emendar cenas, sem remendos para esconder. Essa única mudança reverbera em tudo: como você faz o prompt, como você orça e quanto do seu tempo de edição sobrevive.
Este post é sobre o que de fato mudou, onde ele é genuinamente melhor e — tão importante quanto — os dois pontos em que ele é pior do que o que você já usa.
Principais pontos
- Seedance 2.5 gera 30 segundos contínuos em uma única passada, mantendo identidade dos personagens, iluminação e física ao longo de todo o clipe.
- O áudio é gerado junto com a imagem, não dublado depois, então a sincronia labial e o timing de impactos caem no quadro certo.
- Reference-to-video aceita até 50 entradas multimodais, o que transforma consistência de um truque de prompt em um insumo fornecido.
- Existem trade-offs reais: a saída chega a 720p no máximo e o preço por segundo é premium — use um modelo 4K para cenas hero.
O que o Seedance 2.5 realmente é
Seedance é a família de geração de vídeo da ByteDance — a mesma empresa por trás de TikTok e CapCut, o que já diz algo sobre o ritmo e o enquadramento incorporados nele. Seedance 2.5 foi anunciado em junho de 2026 na conferência Volcano Engine FORCE e lançado no fim de julho de 2026, chegando primeiro aos apps Dreamina e Jimeng da ByteDance antes de chegar à API.
Ele roda três modos: texto-para-vídeo a partir de um prompt escrito, imagem-para-vídeo a partir de um still e reference-to-video, que é aquele que vale reorganizar seu fluxo de trabalho. Você pode usar o Seedance 2.5 no Vivideo sem conta da ByteDance, junto com 30+ outros modelos em uma única assinatura.
As especificações principais, sem rodeios:
- 30 segundos, gerados nativamente em uma única passada (um modo ultralongo vai até 180 segundos, ainda em beta)
- Áudio nativo, gerado em conjunto com o vídeo
- Até 50 entradas de referência — cerca de 30 imagens, 10 clipes de vídeo e 10 arquivos de áudio
- Saída em 480p e 720p, em proporções de 21:9 cinematográfico até 9:16 vertical
- Cerca de 20% melhor aderência ao prompt que a geração anterior
Os 30 segundos são toda a história

É tentador ler "30 segundos" como um upgrade de quantidade — seis vezes mais vídeo por geração. Isso subestima. A diferença é a continuidade, não a duração.
Quando você costura seis clipes de cinco segundos, você está gerenciando deriva. O rosto muda levemente. A temperatura de cor perambula. Uma mão vira seis dedos no terceiro take e você regenera, o que muda o enquadramento, o que faz o corte não casar mais. Quem já montou um anúncio de 30 segundos com IA sabe que o custo real não é o tempo de geração — é o trabalho de reconciliação depois.
Uma única passada de 30 segundos remove a reconciliação. Identidade, figurino, iluminação e física são decididos uma vez e mantidos. É por isso que 30 segundos importam especificamente: é a duração de um slot padrão de anúncio, um bloco completo de explicação de produto ou um vídeo vertical inteiro. É a primeira duração em que a saída do modelo é o entregável, e não matéria-prima para a edição.
Se o seu fluxo atual é baseado em encadear clipes curtos, nosso guia sobre como fazer vídeos com IA com mais de 60 segundos ainda vale — você só vai encadear bem menos peças, e bem mais longas.
Áudio gerado com a imagem, não depois

A maior parte do "vídeo com IA e som" é dois sistemas debaixo do mesmo casaco: gerar o vídeo, depois gerar ou dublar o áudio e alinhar. Funciona até algo precisar cair no quadro exato — um passo, uma porta batendo, uma sílaba.
Seedance 2.5 gera som e imagem em conjunto. Na prática, isso significa que sincronia labial, timing de impacto e coerência de ambiente são decididos na mesma passada do movimento que os causa. O truque útil: coloque uma fala entre aspas duplas no seu prompt, e o personagem a entrega, com lipsync.
Para formatos dirigidos por diálogo — depoimentos, esquetes, cenas explicativas com apresentador — isso colapsa um pipeline multi-etapas em uma única geração. Você ainda pode sobrepor narração com IA, vozes clonadas ou uma trilha musical depois quando a criação pedir.
A aritmética que ninguém menciona
Pegue um spot padrão de produto de 30 segundos. No modelo antigo você gera seis clipes de cinco segundos cada. Considere uma taxa realista de acerto de uma tomada utilizável em três — dá 18 gerações. Aí você gasta uma hora na edição igualando cor, cortando no movimento e escondendo as duas transições onde o reflexo do produto muda.
Em um modelo de passada única, o mesmo spot é uma geração. A taxa de acerto é menor por tentativa, porque mais coisas podem dar errado em 30 segundos do que em cinco — chame de uma em quatro. São quatro gerações e nenhuma edição de reconciliação.
Menos tentativas não é automaticamente o ponto; o desaparecimento da etapa de reconciliação é. O trabalho de costura nunca foi faturável, nunca foi criativo e nunca ficou mais fácil com prática.
Multissujeitos em movimento é onde ele brilha
O outro salto real de capacidade é a interação. O Seedance 2.5 foi feito para lidar com vários sujeitos afetando uns aos outros — esportes, dança, luta, objetos colidindo — em vez de um único sujeito se movendo diante de um fundo.
Esse é o tipo de tomada que historicamente quebrava mais rápido. Duas pessoas passando uma bola geravam uma bola que muda de tamanho ou mãos que atravessam uma à outra, porque o modelo não tinha uma noção persistente de nenhum dos corpos. Em 30 segundos, esse modo de falha se acumula; o fato de o Seedance 2.5 mirar exatamente nisso, exatamente nessa duração, não é coincidência.
Na prática: se seu storyboard tem duas ou mais coisas se tocando, agora este é um modelo razoável para testar primeiro, não o último recurso.
Edição por região e o beta de 180 segundos
Duas funções ficam um pouco atrás do grande destaque, mas mudam como você itera.
A edição por região permite alterar parte de um quadro sem regenerar o clipe inteiro. Em um único plano de 30 segundos isso importa demais — no fluxo antigo, um elemento errado significava descartar toda a geração e jogar os dados de novo. Conseguir corrigir uma região mantendo tudo que você já aprovou é o que torna viável iterar em um plano único longo.
O modo ultralongo estende uma única geração para 180 segundos. É beta, e vale tratar como tal: use para explorar o que um plano contínuo de três minutos torna possível, não para prometer a um cliente uma entrega na semana que vem.
Cinquenta referências: consistência vira insumo

O recurso discreto de manchete é referência-para-vídeo. O Seedance 2.5 aceita até 50 referências multimodais — imagens, clipes de vídeo e áudio — e mantém todas durante a geração.
Isso muda a natureza da consistência de marca. Historicamente você apenas tentava chegar à consistência: descrevendo um personagem em detalhes obsessivos e torcendo para o modelo convergir. Agora você fornece a própria coisa. Um produto em três ângulos. O rosto de um apresentador. Um local. Uma voz. O modelo corresponde em vez de aproximar.
Para campanhas, isso é a diferença entre “nossas tomadas parecem relacionadas” e “nossas tomadas parecem do mesmo set”. Se você vinha mantendo um documento de prompt para manter um personagem estável ao longo de uma série, referências substituem a maior parte dele.
O que isso te custa
Dois trade-offs honestos, porque ambos importam ao escolher um modelo para um job.
A resolução chega até 720p. O Seedance 2.5 gera 480p e 720p — não 1080p e não 4K, apesar de alguma cobertura de lançamento que confundiu com o refresh 2.0. Para trabalhos social-first entregues no celular, 720p geralmente basta. Para um hero shot em uma landing page ou qualquer coisa destinada a uma tela grande, gere essa tomada com um modelo capaz de 4K como o Veo 3.1.
A precificação por segundo é premium. Nativamente, o Seedance 2.5 é tarifado por segundo de saída, e 720p custa aproximadamente o dobro de 480p. Trinta segundos são muitos segundos. Fluxo prático: rascunhe em 480p até o prompt ficar no ponto, depois faça o passe final em 720p. No Vivideo o modelo está incluído em uma assinatura, não tarifado por clipe, o que elimina a maior parte da ansiedade do rascunho.
Seedance 2.5 vs Seedance 2.0: quando usar qual
O Seedance 2.0 não está obsoleto, e escolher certo economiza dinheiro.
Use o 2.5 quando o clipe é o entregável: um spot de 30 segundos, uma cena de diálogo, qualquer coisa em que um personagem ou produto precise permanecer idêntico do começo ao fim, ou quando o áudio tem que bater em quadros específicos.
Use o 2.0 quando você precisa de um corte curto, marcante e de alta movimentação — um gancho de três segundos, uma transição, um pico de energia para uma edição rápida — ou quando você quer 1080p e não precisa de duração. Sua qualidade de movimento continua excelente, e gerações curtas são mais baratas.
A comparação para internalizar: o 2.0 otimiza o plano, o 2.5 otimiza a cena.
Como criar prompts para o Seedance 2.5
Trinta segundos de continuidade pedem um tipo de prompt bem diferente de cinco segundos de espetáculo. Alguns padrões que funcionam:
Escreva um beat sheet, não uma descrição. Com cinco segundos você descreve um momento. Com trinta, descreve um pequeno arco: o que acontece primeiro, o que muda, onde termina. O modelo tem espaço para executar uma progressão — dê uma a ele, ou ele vai inventar preenchimento.
Nomeie o comportamento da câmera uma vez. Uma tomada contínua única implica uma única câmera. Decida se ela está fixa, aproximando lentamente, ou na mão, e diga isso uma vez. Brigar com a câmera no meio do prompt é a maneira mais rápida de introduzir os cortes que você estava tentando evitar.
Coloque falas entre aspas duplas. Esse é o gatilho documentado para fala com lip-sync. Mantenha falas curtas o bastante para serem ditas confortavelmente no tempo disponível — um clipe de 30 segundos comporta bem menos diálogo do que as pessoas imaginam.
Forneça referências em vez de adjetivos. Se você tem o rosto, o produto ou a locação, anexe. Cada referência que você adiciona é um parágrafo de descrição que você não precisa escrever — e é muito mais confiável.
Nosso guia mais amplo sobre como escrever prompts de vídeo com IA cobre os fundamentos que valem para qualquer modelo.
Um exemplo prático
Aqui está o formato que tende a funcionar, para um spot de produto de 30 segundos:
Uma única tomada contínua, câmera na mão, em uma cozinha iluminada pelo sol. Uma mulher de trinta e poucos anos tira um moedor de café de uma caixa no balcão, gira-o nas mãos e o coloca ao lado da chaleira. Ela olha para cima e diz: "Sinceramente? É mais silencioso que o meu antigo." Ela sorri e começa a moer. Luz suave de manhã, profundidade de campo rasa, leve deriva da câmera para a direita ao longo de toda a tomada.
Note o que ele faz: uma instrução de câmera dita uma vez, um arco de três batidas (desembalar, posicionar, usar), uma fala curta entre aspas, do tamanho do momento, e a iluminação descrita uma vez em vez de por batida. Adicione a foto real do produto como referência e você remove a única parte que o modelo teria que adivinhar.
Compare isso com o vício dos cinco segundos — "plano cinematográfico de um moedor de café, iluminação dramática, 8k" — que não dá a um modelo de 30 segundos nada para fazer em 25 deles.
Proporções de tela são uma escolha central
Seedance 2.5 vai de 21:9 a 9:16, incluindo 16:9, 4:3, 1:1 e 3:4. Escolha deliberadamente na geração em vez de recortar depois: uma tomada de 30 segundos composta para 9:16 mantém o assunto enquadrado por toda a duração, enquanto recortar uma tomada 16:9 para vertical vai sair do quadro em algum ponto desses trinta segundos e você voltará a cortar.
Onde ele se encaixa ao lado de Veo, Sora e Kling
Nenhum modelo vence em tudo, e tratar o conjunto como uma caixa de ferramentas é melhor do que lealdade a um só nome.
Seedance 2.5 domina a duração contínua com áudio sincronizado. Veo 3.1 continua sendo a escolha para fidelidade 4K. Sora 2 é forte em plausibilidade física e entendimento de prompt. Kling lida bem com movimento humano expressivo e imagem para vídeo.
A configuração pragmática para uma peça de 30 segundos: gere a cena principal com o Seedance 2.5, substitua qualquer close hero por um modelo 4K e monte tudo. É exatamente para isso que uma plataforma multimodelo existe — veja como o cenário atual se compara no nosso compilado dos melhores geradores de vídeo com IA para 2026.
Você deve migrar esta semana?
Sim, se você produz spots sociais de 30 segundos, cenas com diálogo, depoimentos ou anúncios estilo UGC; se consistência de personagem ou produto em uma campanha é uma dor recorrente; ou se uma fatia significativa da sua semana some costurando clipes e igualando cor.
Ainda não, se seu output é principalmente tela grande ou 4K; se você precisa de clipes abaixo de dez segundos, onde o 2.0 e outros modelos são mais baratos e tão bons quanto; ou se seu pipeline já está ajustado para gerações curtas e o custo de troca supera o tempo de edição economizado.
Teste de qualquer forma se você está escolhendo um stack para o próximo trimestre. Um modelo que entrega o material final em uma passada é um tipo de ferramenta diferente de um que gera matéria-prima — e essa diferença é mais fácil de sentir em uma tarde de uso do que deduzir de uma ficha técnica.
A versão curta
Seedance 2.5 é o primeiro modelo em que a duração do output combina com o tamanho do que as pessoas de fato publicam. Trinta segundos contínuos com áudio coerente e personagens travados por referência eliminam uma categoria inteira de retrabalho de pós-produção, e o preço disso é resolução e custo por segundo.
Se o seu trabalho é short-form, social, guiado por diálogo ou consistente em campanha, é o lançamento mais útil do ano até agora. Se você precisa de masters em 4K, mantenha-o como uma ferramenta entre várias.
Você pode experimentar o Seedance 2.5 grátis na Vivideo — sem conta da ByteDance, exports sem marca-d'água em um plano pago e mais de 30 outros modelos ao lado quando um take precisar de algo diferente.
