Durante tres años, cada modelo de IA de video te ha dado más o menos lo mismo: un clip precioso de cinco segundos que termina justo cuando se pone interesante. Todo el oficio del video con IA se ha construido alrededor de esa limitación: guion en beats, generación por fragmentos, montaje para coserlos y rezar para que la chaqueta del personaje sea del mismo color en el plano cuatro que en el uno.
Seedance 2.5, el nuevo modelo de video de ByteDance, es el primer lanzamiento mainstream que ataca la limitación en sí y no los píxeles. Genera 30 segundos completos en una sola pasada: sin cosidos, sin empalmes de escenas, sin costuras que ocultar. Ese único cambio se propaga a todo lo demás: cómo haces el prompt, cómo presupuestas y cuánto de tu tiempo de edición sobrevives.
Este post trata de lo que cambió de verdad, dónde es genuinamente mejor y —igual de importante— los dos casos en los que es peor que lo que ya usas.
Puntos clave
- Seedance 2.5 genera 30 segundos continuos en una sola pasada, manteniendo la identidad del personaje, la iluminación y la física en todo el clip.
- El audio se genera junto con la imagen, no doblado después, así que el lip sync y el timing de impactos caen en el fotograma correcto.
- La referencia a video acepta hasta 50 entradas multimodales, convirtiendo la consistencia de truco de prompt a insumo suministrado.
- Hay sacrificios reales: la salida llega hasta 720p y el precio por segundo es premium — usa un modelo 4K para planos hero.
Qué es realmente Seedance 2.5
Seedance es la familia de generación de video de ByteDance — la misma empresa detrás de TikTok y CapCut, lo que ya dice algo sobre el ritmo y el encuadre incorporados. Seedance 2.5 se anunció en junio de 2026 en la conferencia Volcano Engine FORCE y se lanzó a finales de julio de 2026, llegando primero a las apps Dreamina y Jimeng de ByteDance antes de llegar a la API.
Funciona en tres modos: texto a video desde un prompt escrito, imagen a video desde una foto fija, y referencia a video, que es el que merece reordenar tu flujo de trabajo. Puedes usar Seedance 2.5 en Vivideo sin cuenta de ByteDance, junto a 30+ modelos con una sola suscripción.
Las especificaciones principales, claras:
- 30 segundos, generados de forma nativa en una sola pasada (un modo ultralargo se extiende a 180 segundos, aún en beta)
- Audio nativo, generado conjuntamente con el video
- Hasta 50 entradas de referencia — aprox. 30 imágenes, 10 clips de video y 10 archivos de audio
- Salida 480p y 720p, en relaciones de aspecto desde cinematográfico 21:9 hasta vertical 9:16
- Aproximadamente 20% mejor adherencia al prompt que la generación anterior
Los 30 segundos son toda la historia

Es tentador leer "30 segundos" como una mejora de cantidad — seis veces más video por generación. Eso se queda corto. La diferencia es la continuidad, no la duración.
Cuando coses seis clips de cinco segundos, gestionas deriva. La cara cambia un poco. La temperatura de luz se desplaza. Una mano se vuelve seis dedos en el tercer plano y regenera, lo que cambia el encuadre, lo que hace que el corte ya no cuadre. Quien haya montado un spot de 30 segundos con IA sabe que el verdadero coste no es el tiempo de generación — es la reconciliación después.
Una sola pasada de 30 segundos elimina la reconciliación. Identidad, vestuario, iluminación y física se deciden una vez y se mantienen. Por eso 30 segundos importan específicamente: es la duración de un bloque de anuncio estándar, un beat completo de un explicador de producto o un video vertical entero. Es la primera duración en la que la salida del modelo es el entregable, y no materia prima para el montaje.
Si tu flujo actual se basa en encadenar clips cortos, nuestra guía para hacer videos con IA de más de 60 segundos sigue aplicando — solo que encadenarás muchas menos piezas, y más largas.
Audio generado con la imagen, no después

La mayoría del "video con IA y sonido" son dos sistemas disfrazados: generas el video, luego generas o doblas audio y lo alineas. Funciona hasta que algo debe caer en un fotograma exacto — un paso, un portazo, una sílaba.
Seedance 2.5 genera sonido e imagen de forma conjunta. En la práctica, eso significa que el lip sync, el timing de impactos y la coherencia ambiental se deciden en la misma pasada que el movimiento que los causa. El truco útil: pon una línea de diálogo entre comillas dobles dentro de tu prompt, y el personaje la dirá con sincronización labial.
Para formatos guiados por diálogo — testimoniales, sketches, escenas explicativas con presentador — esto colapsa una cadena de varios pasos en una sola generación. Aun así puedes superponer voiceover de IA, voces clonadas o una cama musical después cuando la creatividad lo pida.
La aritmética que nadie menciona
Toma un spot estándar de producto de 30 segundos. Con el modelo antiguo generas seis clips de cinco segundos cada uno. Asume una tasa realista de acierto de una toma útil de cada tres — son 18 generaciones. Luego pasas una hora en la edición igualando color, cortando en movimiento y ocultando las dos transiciones donde cambia el reflejo del producto.
Con un modelo de pasada única, el mismo spot es una generación. La tasa de acierto por intento es menor, porque más cosas pueden fallar en 30 segundos que en cinco — digamos una de cada cuatro. Son cuatro generaciones y sin edición de reconciliación.
Menos intentos no es automáticamente el punto; la desaparición del paso de reconciliación sí lo es. Ese trabajo de cosido nunca fue facturable, nunca creativo y nunca se volvió más fácil con la práctica.
El movimiento con múltiples sujetos es donde más brilla
El otro salto real de capacidad es la interacción. Seedance 2.5 se diseñó para manejar varios sujetos que se afectan entre sí —deportes, baile, lucha, objetos colisionando— en lugar de un solo sujeto moviéndose frente a un fondo.
Esta es la clase de toma que históricamente se rompía más rápido. Dos personas pasándose una pelota solían producir una pelota que cambia de tamaño o manos que se atraviesan, porque el modelo no tenía una noción persistente de ninguno de los cuerpos. A lo largo de 30 segundos, ese modo de fallo se agrava; el hecho de que Seedance 2.5 apunte exactamente a esto, y exactamente a esta duración, no es una coincidencia.
La lectura práctica: si tu storyboard tiene dos o más cosas tocándose entre sí, ahora este es un modelo razonable para intentar primero en lugar de un último recurso.
Edición por región y el beta de 180 segundos
Dos funciones están un poco detrás del titular, pero cambian cómo iteras.
Edición a nivel de región te permite cambiar parte de un fotograma sin regenerar todo el clip. En una toma única de 30 segundos eso importa muchísimo: con el flujo anterior, un elemento mal significaba tirar toda la generación y volver a jugártela. Poder arreglar una región mientras mantienes todo lo que ya aprobaste es lo que hace viable iterar sobre una toma larga de una sola pasada.
El modo ultralargo extiende una sola generación a 180 segundos. Es beta, y conviene tratarlo como tal: úsalo para explorar lo que hace posible una toma continua de tres minutos, no para prometer a un cliente un entregable la próxima semana.
Cincuenta referencias: la coherencia se vuelve un insumo

La función silenciosa de cabecera es referencia a video. Seedance 2.5 acepta hasta 50 referencias multimodales —imágenes, clips de video y audio— y las mantiene a lo largo de la generación.
Esto cambia la naturaleza de la coherencia de marca. Históricamente uno impulsaba la coherencia con prompts: describiendo un personaje con detalle obsesivo y esperando que el modelo convergiera. Ahora proporcionas la cosa en sí. Un producto desde tres ángulos. La cara de un presentador. Una ubicación. Una voz. El modelo iguala en lugar de aproximar.
Para trabajo de campaña, esta es la diferencia entre “nuestras tomas parecen relacionadas” y “nuestras tomas parecen del mismo rodaje”. Si has estado manteniendo un documento de prompts para mantener estable a un personaje en una serie, las referencias reemplazan la mayor parte.
Lo que te cuesta
Dos concesiones honestas, porque ambas importan al elegir un modelo para un trabajo.
La resolución llega hasta 720p. Seedance 2.5 genera 480p y 720p —no 1080p, y no 4K— pese a alguna cobertura de lanzamiento que lo confundió con la actualización 2.0. Para trabajo social-first entregado a teléfono, 720p suele bastar. Para una toma hero en una landing o cualquier cosa destinada a una pantalla grande, genera esa toma con un modelo capaz de 4K como Veo 3.1 en su lugar.
El precio por segundo es premium. Nativamente, Seedance 2.5 se factura por segundo de salida, y 720p cuesta aproximadamente el doble que 480p. Treinta segundos son muchos segundos. El flujo práctico: maqueta en 480p hasta que el prompt esté afinado, luego comprométete a un pase final en 720p. En Vivideo el modelo está incluido en una sola suscripción en lugar de cobrarse por clip, lo que elimina la mayor parte de la ansiedad al iterar.
Seedance 2.5 vs Seedance 2.0: cuándo usar cuál
Seedance 2.0 no está obsoleto, y elegir bien ahorra dinero.
Elige 2.5 cuando el clip es el entregable: un spot de 30 segundos, una escena de diálogo, cualquier cosa donde un personaje o producto deba permanecer idéntico de principio a fin, o donde el audio tenga que caer en fotogramas específicos.
Elige 2.0 cuando necesites un corte corto, potente y de alto movimiento —un gancho de tres segundos, una transición, una ráfaga de energía destinada a un montaje rápido— o cuando quieras 1080p y no necesites duración. Su calidad de movimiento sigue siendo excelente, y las generaciones cortas son más baratas.
La comparación para interiorizar: 2.0 optimiza la toma, 2.5 optimiza la escena.
Cómo hacer prompts para Seedance 2.5
Treinta segundos de continuidad requieren un tipo de prompt distinto a cinco segundos de espectáculo. Algunos patrones que funcionan:
Escribe un beat sheet, no una descripción. Con cinco segundos describes un momento. Con treinta describes un pequeño arco: qué pasa primero, qué cambia, dónde termina. El modelo tiene espacio para ejecutar una progresión: dásela, o inventará relleno.
Nombra el comportamiento de la cámara una sola vez. Una toma continua implica una sola cámara. Decide si está fija, si hace un suave push-in o si es al hombro, y dilo una vez. Pelear con la cámara a mitad del prompt es la forma más rápida de introducir los cortes que querías evitar.
Pon el diálogo entre comillas dobles. Es el disparador documentado para el lip sync. Mantén las líneas lo bastante cortas para poder ser dichas cómodamente en el tiempo disponible: un clip de 30 segundos admite mucho menos diálogo de lo que la gente estima.
Aporta referencias en lugar de adjetivos. Si tienes la cara, el producto o la ubicación, adjúntalos. Cada referencia que añades equivale a un párrafo de descripción que no tienes que escribir, y es más fiable.
Nuestra guía más amplia sobre cómo escribir prompts de video con IA cubre los fundamentos que se trasladan a cualquier modelo.
Un ejemplo práctico
Esta es la forma que suele funcionar para un spot de producto de 30 segundos:
Una toma continua al hombro en una cocina iluminada por el sol. Una mujer de treinta y tantos saca un molinillo de café de una caja sobre la encimera, lo gira entre las manos y lo deja junto a la tetera. Levanta la vista y dice: "¿Honestamente? Es más silencioso que el anterior". Sonríe y empieza a moler. Luz cálida de la mañana, poca profundidad de campo, deriva suave de la cámara hacia la derecha durante toda la toma.
Fíjate en lo que hace: una instrucción de cámara dicha una vez, un arco de tres beats (desempaquetar, colocar, usar), una línea corta entrecomillada acorde al momento, y la iluminación descrita una vez en lugar de por beat. Añade la foto real del producto como referencia y habrás eliminado la única parte que el modelo tendría que adivinar.
Compáralo con el hábito de cinco segundos — "plano cinematográfico de un molinillo de café, iluminación dramática, 8k" — que no le da nada que hacer a un modelo de 30 segundos durante 25 de esos segundos.
Las relaciones de aspecto son una elección de primer orden
Seedance 2.5 abarca de 21:9 a 9:16, incluyendo 16:9, 4:3, 1:1 y 3:4. Elige deliberadamente en el momento de generar en lugar de recortar después: una toma de 30 segundos compuesta para 9:16 mantiene al sujeto encuadrado durante toda la duración, mientras que recortar una toma 16:9 a vertical se saldrá de cuadro en algún punto de esos treinta segundos y volverás a cortar.
Dónde encaja junto a Veo, Sora y Kling
Ningún modelo gana en todo, y tratar la lista como una caja de herramientas supera la lealtad a un solo nombre.
Seedance 2.5 domina la duración continua con audio sincronizado. Veo 3.1 sigue siendo la elección para fidelidad 4K. Sora 2 es fuerte en verosimilitud física y comprensión del prompt. Kling maneja bien el movimiento humano expresivo y el image-to-video.
El enfoque pragmático para una pieza de 30 segundos: genera la escena principal con Seedance 2.5, sustituye cualquier plano detalle hero con un modelo 4K y móntalos juntos. Para eso existe exactamente una plataforma multimodelo: mira cómo se compara el panorama actual en nuestro resumen de los mejores generadores de videos IA para 2026.
¿Deberías cambiar esta semana?
Sí, si produces spots sociales de 30 segundos, escenas con diálogo, testimonios o anuncios estilo UGC; si la consistencia de personajes o productos a lo largo de una campaña es un dolor recurrente; o si una parte significativa de tu semana se va en coser y emparejar color de clips.
Aún no, si tu salida es principalmente de gran pantalla o 4K; si necesitas clips de menos de diez segundos, donde 2.0 y otros modelos son más baratos e igual de buenos; o si tu pipeline ya está afinado para generaciones cortas y el coste de cambiar supera el tiempo de edición que ahorras.
Pruébalo en cualquier caso si estás eligiendo un stack para el próximo trimestre. Un modelo que hace el entregable en una sola pasada es una herramienta distinta de uno que hace materia prima, y esa diferencia es más fácil de sentir en una tarde de uso que de razonar desde una ficha técnica.
La versión corta
Seedance 2.5 es el primer modelo donde la duración de salida coincide con la longitud de lo que la gente realmente publica. Treinta segundos continuos con audio coherente y personajes fijados por referencia eliminan toda una categoría de trabajo mecánico de postproducción, y el precio de eso es la resolución y el coste por segundo.
Si tu trabajo es de formato corto, social, con diálogo o consistente a nivel de campaña, es el lanzamiento más útil del año hasta ahora. Si necesitas masters en 4K, mantenlo como una herramienta entre varias.
Puedes probar Seedance 2.5 gratis en Vivideo — sin cuenta de ByteDance, exportaciones sin marca de agua en un plan de pago y más de 30 modelos adicionales para cuando un plano necesite algo diferente.
