BlogXu hướng

Seedance 2.5: Mẫu 30 giây của ByteDance thực sự thay đổi gì

Seedance 2.5 tạo 30 giây trong một lần chạy, có âm thanh gốc và tới 50 tham chiếu. Đây là những gì thực sự thay đổi, chi phí bao nhiêu và khi nào nên dùng.

Trong ba năm, hầu hết các mô hình video AI đều cho bạn cùng một thứ: một clip 5 giây đẹp mắt kết thúc đúng lúc bắt đầu thú vị. Toàn bộ “nghề” làm video AI đã xây quanh ràng buộc đó — dựng storyboard theo nhịp, tạo từng mảnh, ráp trong hậu kỳ, và cầu mong chiếc áo khoác của nhân vật ở cảnh bốn có cùng màu như cảnh một.

Seedance 2.5, mô hình video mới nhất của ByteDance, là bản phát hành phổ thông đầu tiên tấn công thẳng vào ràng buộc thay vì vào pixel. Nó tạo ra trọn 30 giây trong một lượt duy nhất — không ráp nối, không cắt cảnh ghép vào, không đường may để che. Chỉ một thay đổi đó đã lan ra mọi thứ khác: cách bạn viết prompt, cách bạn tính ngân sách, và bao nhiêu thời gian hậu kỳ của bạn còn giữ được.

Bài viết này nói về những gì thực sự đã thay đổi, nơi nó thật sự tốt hơn, và — cũng quan trọng không kém — hai điểm nó kém hơn so với thứ bạn đang dùng.

Điểm chính rút ra

- Seedance 2.5 tạo 30 giây liên tục trong một lượt, giữ được nhận dạng nhân vật, ánh sáng và vật lý xuyên suốt toàn bộ clip.

- Âm thanh được tạo cùng lúc với hình ảnh chứ không lồng sau, nên đồng bộ khẩu hình và thời điểm va chạm rơi đúng khung hình.

- Reference-to-video chấp nhận tới 50 đầu vào đa phương thức, biến tính nhất quán từ một mẹo prompt thành một đầu vào được cung cấp.

- Có đánh đổi thực sự: đầu ra tối đa 720p, giá theo giây ở mức cao — hãy dùng mô hình 4K cho các cảnh “hero”.

Seedance 2.5 thực chất là gì

Seedance là dòng mô hình tạo video của ByteDance — cùng công ty đứng sau TikTok và CapCut, điều này nói lên phần nào bản năng về nhịp điệu và khung hình được “nhúng” sẵn. Seedance 2.5 được công bố tháng 6/2026 tại hội nghị Volcano Engine FORCE và phát hành cuối tháng 7/2026, xuất hiện trước trong các ứng dụng Dreamina và Jimeng của ByteDance rồi mới tới API.

Nó chạy ba chế độ: text-to-video từ prompt văn bản, image-to-video từ ảnh tĩnh, và reference-to-video — chính là chế độ đáng để bạn sắp xếp lại quy trình làm việc. Bạn có thể dùng Seedance 2.5 trên Vivideo mà không cần tài khoản ByteDance, cùng với hơn 30 mô hình khác chỉ với một gói đăng ký.

Thông số chính, rõ ràng:

Chuyện 30 giây chính là toàn bộ câu chuyện

Illustration: one unbroken take replacing a pile of stitched clips

Dễ lầm tưởng “30 giây” là nâng cấp về lượng — gấp sáu lần video mỗi lượt. Nói vậy là đánh giá thấp. Khác biệt nằm ở tính liên tục, không phải độ dài.

Khi bạn ráp sáu clip 5 giây lại, bạn đang quản lý độ trôi. Gương mặt lệch nhẹ. Nhiệt độ ánh sáng lang thang. Bàn tay thành sáu ngón ở cảnh thứ ba rồi bạn tạo lại, điều này đổi khung hình, và cú cắt vì thế không còn khớp. Ai từng ráp một TVC AI 30 giây đều biết chi phí thật không phải thời gian tạo — mà là khâu hòa giải sau đó.

Một lượt 30 giây duy nhất loại bỏ việc hòa giải. Nhận dạng, trang phục, ánh sáng và vật lý được quyết định một lần và giữ nguyên. Đó là lý do 30 giây đặc biệt quan trọng: đó là độ dài của một slot quảng cáo chuẩn, một nhịp diễn giải sản phẩm trọn vẹn, hoặc một video dọc đầy đủ. Đây là độ dài đầu tiên mà đầu ra của mô hình chính là sản phẩm bàn giao thay vì nguyên liệu thô cho hậu kỳ.

Nếu quy trình hiện tại của bạn xây quanh việc xâu chuỗi clip ngắn, hướng dẫn của chúng tôi về cách làm video AI dài hơn 60 giây vẫn đúng — chỉ là bạn sẽ xâu chuỗi ít mảnh hơn và mỗi mảnh dài hơn nhiều.

Âm thanh được tạo cùng hình ảnh, không phải sau đó

Illustration: audio and picture generated as one strand

Đa số “video AI có âm thanh” là hai hệ thống khoác chung một chiếc áo: tạo video, rồi tạo hoặc lồng âm và canh thẳng. Nó hoạt động cho tới khi cần trúng một khung hình chính xác — tiếng bước chân, tiếng cửa đập, một âm tiết.

Seedance 2.5 tạo âm và hình cùng nhau. Về thực tế, điều đó nghĩa là đồng bộ khẩu hình, thời điểm va chạm và không khí nền được quyết định trong cùng một lượt với chuyển động gây ra chúng. Mẹo hữu ích: đặt một câu thoại trong dấu ngoặc kép kép trong prompt của bạn, và nhân vật sẽ nói nó, khớp khẩu hình.

Với các định dạng dẫn dắt bởi đối thoại — lời chứng thực, tiểu phẩm, cảnh giải thích có người dẫn — điều này gom một pipeline nhiều bước thành một lượt tạo. Bạn vẫn có thể lồng voiceover AI, giọng nói nhân bản, hoặc nhạc nền sau đó khi ý tưởng cần.

Phép tính mà ít ai nhắc tới

Hãy lấy một spot sản phẩm 30 giây tiêu chuẩn. Theo mô hình cũ, bạn tạo sáu clip mỗi clip 5 giây. Giả sử tỷ lệ trúng thực tế là một bản dùng được trong ba — tức 18 lượt tạo. Rồi bạn tốn một giờ trong phòng dựng để khớp màu, cắt theo chuyển động và che hai chỗ chuyển cảnh nơi phản chiếu của sản phẩm thay đổi.

Theo mô hình một lượt, cùng spot đó là một lượt tạo. Tỷ lệ trúng thấp hơn trên mỗi lần thử, vì có nhiều thứ có thể sai trong 30 giây hơn 5 giây — coi như một trên bốn. Tức là bốn lượt tạo và không có khâu hòa giải trong dựng.

Ít lần thử hơn không tự động là mục tiêu; sự biến mất của bước hòa giải mới là điều quan trọng. Công việc ráp nối đó chưa từng tính phí được, không sáng tạo, và không hề dễ hơn theo thời gian.## Chuyển động nhiều chủ thể là nơi nó tỏa sáng

Bước nhảy năng lực thực sự còn lại là tương tác. Seedance 2.5 được xây dựng để xử lý nhiều chủ thể ảnh hưởng lẫn nhau — thể thao, nhảy múa, chiến đấu, va chạm vật thể — thay vì một chủ thể di chuyển trước phông nền.

Đây là lớp cảnh quay vốn dễ vỡ trận nhất trong lịch sử. Hai người chuyền bóng có thể tạo ra quả bóng thay đổi kích thước, hoặc bàn tay xuyên qua nhau, vì mô hình không có khái niệm bền vững về bất kỳ cơ thể nào. Trong 30 giây, kiểu lỗi đó tích lũy; việc Seedance 2.5 nhắm đúng vào điều này, với đúng độ dài này, không phải tình cờ.

Kết luận thực tế: nếu storyboard của bạn có từ hai đối tượng trở lên chạm vào nhau, đây giờ là mô hình hợp lý để thử đầu tiên thay vì giải pháp cuối cùng.

Chỉnh sửa theo vùng và bản beta 180 giây

Hai tính năng không quá giật tít nhưng thay đổi cách bạn lặp.

Chỉnh sửa theo vùng cho phép bạn thay đổi một phần khung hình mà không phải tạo lại toàn bộ clip. Trong một cú máy đơn 30 giây, điều đó cực kỳ quan trọng — theo quy trình cũ, một yếu tố sai đồng nghĩa vứt cả bản tạo và quay xổ số lại từ đầu. Khả năng sửa một vùng trong khi giữ nguyên mọi thứ bạn đã duyệt chính là điều khiến một cú máy dài khả thi để lặp chỉnh.

Chế độ siêu dài kéo dài một lần tạo lên 180 giây. Nó đang ở bản beta, và nên được đối xử như vậy: dùng để khám phá xem một cú máy liên tục ba phút mở ra điều gì, chứ không phải để hứa hẹn với khách hàng một sản phẩm giao ngay tuần sau.

Năm mươi tham chiếu: tính nhất quán trở thành đầu vào

Tính năng âm thầm nhưng đáng giá là tham chiếu-đến-video. Seedance 2.5 chấp nhận tối đa 50 tham chiếu đa phương thức — hình ảnh, clip video và âm thanh — và giữ chúng xuyên suốt quá trình tạo.

Điều này thay đổi bản chất của tính nhất quán thương hiệu. Trước đây bạn phải mô tả để “hướng tới” nhất quán: mô tả một nhân vật cực chi tiết và hy vọng mô hình hội tụ. Giờ bạn cung cấp chính đối tượng. Một sản phẩm từ ba góc. Khuôn mặt người dẫn. Một địa điểm. Một giọng nói. Mô hình sẽ khớp, không còn chỉ xấp xỉ.

Với công việc chiến dịch, đây là khác biệt giữa “các cảnh trông có liên quan” và “các cảnh trông như cùng một buổi quay”. Nếu bạn từng duy trì tài liệu prompt để giữ nhân vật ổn định qua một series, tham chiếu sẽ thay thế phần lớn việc đó.

Cái giá bạn phải trả

Illustration: many references converging into one consistent character

Hai đánh đổi thẳng thắn, vì cả hai đều quan trọng khi bạn chọn mô hình cho công việc.

Độ phân giải tối đa là 720p. Seedance 2.5 xuất 480p và 720p — không có 1080p, và không có 4K, bất chấp một số bài viết lúc ra mắt nhầm nó với bản làm mới 2.0. Với nội dung ưu tiên mạng xã hội hiển thị trên điện thoại, 720p thường ổn. Với ảnh hero trên trang đích hoặc bất cứ thứ gì chiếu trên màn lớn, hãy tạo cảnh đó bằng mô hình hỗ trợ 4K như Veo 3.1.

Tính phí theo giây ở mức cao. Về bản chất, Seedance 2.5 được tính theo số giây đầu ra, và 720p có giá xấp xỉ gấp đôi 480p. Ba mươi giây là rất nhiều giây. Quy trình thực tế: phác thảo ở 480p cho đến khi prompt ổn, rồi chốt một lượt cuối 720p. Trên Vivideo, mô hình được bao gồm trong một gói đăng ký thay vì tính theo clip, giúp giảm hầu hết nỗi lo khi phác thảo.

Seedance 2.5 vs Seedance 2.0: khi nào dùng cái nào

Seedance 2.0 không lỗi thời, và chọn đúng sẽ tiết kiệm chi phí.

Chọn 2.5 khi chính clip là sản phẩm bàn giao: một spot 30 giây, một cảnh đối thoại, bất cứ thứ gì mà nhân vật hoặc sản phẩm phải giữ y hệt xuyên suốt, hoặc khi âm thanh phải khớp khung hình cụ thể.

Chọn 2.0 khi bạn cần một cắt ghép ngắn, dồn dập, chuyển động mạnh — một hook 3 giây, một chuyển cảnh, một nhịp năng lượng để đưa vào edit nhanh — hoặc khi bạn muốn 1080p và không cần độ dài. Chất lượng chuyển động của nó vẫn xuất sắc, và tạo ngắn rẻ hơn.

So sánh đáng ghi nhớ: 2.0 tối ưu cho shot, 2.5 tối ưu cho scene.

Cách viết prompt cho Seedance 2.5

Ba mươi giây liền mạch cần một kiểu prompt khác hẳn so với năm giây gây ấn tượng. Một vài mẫu mực hiệu quả:

Viết beat sheet, đừng viết mô tả dài. Với 5 giây, bạn mô tả một khoảnh khắc. Với 30 giây, bạn mô tả một vòng cung nhỏ: điều gì xảy ra trước, điều gì thay đổi, kết ở đâu. Mô hình có không gian để thực hiện một tiến trình — hãy đưa cho nó một tiến trình, nếu không nó sẽ tự chèn phần đệm.

Nêu hành vi máy quay một lần. Một cú máy liên tục ngụ ý một máy quay duy nhất. Quyết định khóa máy, đẩy chậm vào, hay handheld, và nêu một lần. Đổi ý giữa prompt về máy quay là cách nhanh nhất khiến xuất hiện các cú cắt mà bạn đang cố tránh.

Đặt lời thoại trong dấu ngoặc kép đôi. Đây là tín hiệu đã được ghi nhận để đồng bộ khẩu hình. Giữ câu thoại đủ ngắn để nói thoải mái trong thời lượng — một clip 30 giây chứa ít thoại hơn mọi người thường ước lượng.

Đưa tham chiếu thay vì tính từ. Nếu bạn có khuôn mặt, sản phẩm, hoặc địa điểm, hãy đính kèm. Mỗi tham chiếu bạn thêm vào tương đương một đoạn mô tả bạn không cần viết, và còn đáng tin cậy hơn.

Hướng dẫn rộng hơn của chúng tôi về cách viết prompt video AI bao quát các nền tảng áp dụng cho mọi mô hình.

Ví dụ minh họa

Đây là khung thường hiệu quả cho một spot sản phẩm 30 giây:

Một cú máy handheld liên tục trong căn bếp tràn nắng. Một phụ nữ ngoài 30 mở hộp lấy ra máy xay cà phê trên quầy, xoay ngắm trên tay, rồi đặt cạnh ấm đun. Cô ngẩng lên và nói, "Thật lòng? Nó êm hơn cái cũ của tôi." Cô mỉm cười và bắt đầu xay. Ánh sáng sớm ấm áp, độ sâu trường ảnh nông, máy quay lướt nhẹ sang phải xuyên suốt.

Hãy để ý: một chỉ dẫn máy quay nêu một lần, một vòng cung ba nhịp (mở hộp, đặt, sử dụng), một câu thoại ngắn phù hợp khoảnh khắc, và ánh sáng được mô tả một lần thay vì cho từng nhịp. Thêm ảnh sản phẩm thật làm tham chiếu và bạn đã loại bỏ phần duy nhất mô hình phải đoán.

So sánh với thói quen năm giây — "cú máy cinematic của máy xay cà phê, ánh sáng kịch tính, 8k" — vốn không cho mô hình 30 giây việc gì để làm trong 25 giây còn lại.

Tỷ lệ khung hình là lựa chọn hạng nhất

Seedance 2.5 bao phủ từ 21:9 đến 9:16, gồm cả 16:9, 4:3, 1:1 và 3:4. Hãy chọn có chủ đích ngay lúc tạo thay vì cắt sau: một cú máy 30 giây được bố cục cho 9:16 sẽ giữ chủ thể trong khung suốt thời lượng, trong khi cắt một cú 16:9 sang dọc sẽ trôi lệch khỏi khung đâu đó trong ba mươi giây và bạn lại phải cắt dựng.

Vị trí của nó so với Veo, Sora và Kling

Không mô hình đơn lẻ nào thắng mọi mặt, và coi bộ sưu tập như một hộp công cụ luôn hơn trung thành với một cái tên.

Seedance 2.5 mạnh về thời lượng liên tục với âm thanh đồng bộ. Veo 3.1 vẫn là lựa chọn cho độ trung thực 4K. Sora 2 mạnh về tính hợp lý vật lý và hiểu prompt. Kling xử lý chuyển động người biểu cảm và image-to-video tốt.

Thiết lập thực dụng cho một đoạn 30 giây: tạo cảnh chính với Seedance 2.5, thay bất kỳ hero shot cận cảnh nào bằng mô hình 4K, rồi cắt ghép chúng. Đó chính xác là lý do tồn tại của nền tảng đa mô hình — xem mặt bằng hiện tại trong bản tổng hợp trình tạo video AI tốt nhất 2026.

Có nên chuyển ngay tuần này?

Có, nếu bạn làm spot mạng xã hội 30 giây, cảnh thoại, testimonial, hoặc quảng cáo kiểu UGC; nếu tính nhất quán nhân vật hay sản phẩm xuyên suốt chiến dịch luôn nhức đầu; hoặc nếu một phần đáng kể tuần làm việc của bạn trôi vào vá clip và căn màu.

Chưa, nếu đầu ra chủ yếu màn hình lớn hoặc 4K; nếu bạn cần clip dưới mười giây, nơi 2.0 và mô hình khác rẻ hơn và hiệu quả tương đương; hoặc nếu pipeline đã tối ưu cho các lượt tạo ngắn và chi phí chuyển đổi vượt thời gian dựng tiết kiệm được.

Hãy thử dù sao nếu bạn đang chọn stack cho quý tới. Một mô hình tạo ra sản phẩm bàn giao trong một lần là loại công cụ khác hẳn với mô hình chỉ tạo nguyên liệu thô, và khác biệt đó dễ cảm nhận trong một buổi chiều sử dụng hơn là suy luận từ bảng thông số.

Tóm tắt ngắn

Seedance 2.5 là mô hình đầu tiên mà độ dài đầu ra khớp với độ dài nội dung mọi người thực sự xuất bản. Ba mươi giây liên tục với âm thanh mạch lạc và nhân vật khóa theo tham chiếu loại bỏ cả một hạng mục việc lặt vặt hậu kỳ, và cái giá phải trả là độ phân giải và chi phí theo giây.

Nếu công việc của bạn là ngắn, mạng xã hội, dẫn dắt bởi thoại, hoặc cần nhất quán chiến dịch, đây là bản phát hành hữu dụng nhất từ đầu năm. Nếu bạn cần bản master 4K, hãy giữ nó như một công cụ trong số nhiều công cụ.

Bạn có thể thử Seedance 2.5 miễn phí trên Vivideo — không cần tài khoản ByteDance, xuất không watermark ở gói trả phí, và hơn 30 mô hình khác sẵn sàng khi một cú máy cần điều gì khác.

Emir Göcen
Tác giả

Emir Göcen

Đồng sáng lập Vivideo, xuất thân từ học máy và thị giác máy tính, dẫn dắt cách Vivideo đánh giá và kết hợp các mô hình video trí tuệ nhân tạo hàng đầu.

Tạo video AI đầu tiên miễn phí

Lập kế hoạch, tạo, lồng tiếng, gắn thương hiệu và xuất bản — trên 30+ mô hình, trong vài phút.

Dùng thử Vivideo miễn phí