블로그트렌드

Seedance 2.5: ByteDance의 30초 모델, 실제 변화는?

Seedance 2.5는 네이티브 오디오와 최대 50개 레퍼런스로 한 번에 30초를 생성해요. 무엇이 실제로 바뀌었는지, 비용은 얼마인지, 언제 써야 하는지 정리했습니다.

지난 3년간 모든 AI 동영상 모델이 내놓은 것은 거의 같았어요. 멋진 5초 클립, 막 흥미로워지려는 순간 끝나는 영상이죠. AI 영상 제작 전체가 그 제약 위에 세워졌습니다 — 박자 단위로 스토리보드를 짜고, 조각으로 생성해, 편집에서 이어 붙이며, 1번 샷의 재킷 색이 4번 샷에서도 같기를 기도하는 일이었죠.

Seedance 2.5는 ByteDance의 최신 비디오 모델로, 픽셀 레벨이 아니라 제약 자체를 정면으로 다룹니다. 한 번의 패스로 30초 풀 영상을 생성해요 — 스티칭 없음, 신 전환 붙이기 없음, 감출 이음새도 없죠. 이 한 가지 변화가 모든 것에 파장을 일으킵니다: 프롬프트 작성법, 예산 책정, 편집 시간의 생존율까지요.

이 글은 실제로 무엇이 바뀌었는지, 어디서 진짜로 더 나아졌는지, 그리고 — 똑같이 중요한 — 지금 쓰는 도구보다 못한 두 가지를 짚습니다.

핵심 요약

- Seedance 2.5는 한 번의 패스로 30초 연속 영상을 생성하며, 클립 전체에서 캐릭터 정체성, 조명, 물리를 유지해요.

- 오디오는 사후 더빙이 아니라 영상과 함께 생성되어, 립싱크와 임팩트 타이밍이 정확한 프레임에 맞아요.

- Reference-to-video가 최대 50개의 멀티모달 입력을 받아, 일관성을 프롬프트 꼼수가 아닌 제공 입력으로 전환해요.

- 트레이드오프는 분명합니다: 출력은 720p가 상한이고, 초당 가격은 프리미엄 — 메인 컷에는 4K 모델을 쓰세요.

Seedance 2.5가 실제로 무엇인지

Seedance는 ByteDance의 비디오 생성 제품군이에요 — TikTok과 CapCut 뒤에 있는 같은 회사죠. 즉, 속도감과 프레이밍 감각이 제품에 배어 있습니다. Seedance 2.5는 2026년 6월 Volcano Engine FORCE 컨퍼런스에서 발표되어 2026년 7월 말 출시되었고, API에 앞서 ByteDance의 Dreamina와 Jimeng 앱에 먼저 도착했어요.

세 가지 모드를 지원합니다: 텍스트 프롬프트 기반 text-to-video, 정지 이미지 기반 image-to-video, 그리고 워크플로를 다시 짤 가치가 있는 reference-to-video. Vivideo에서는 ByteDance 계정 없이 Seedance 2.5를 다른 30개+ 모델과 함께 하나의 구독으로 사용할 수 있어요.

핵심 스펙은 간단합니다:

30초라는 사실이 곧 전부예요

Illustration: one unbroken take replacing a pile of stitched clips

"30초"를 단순히 양의 상승 — 세대당 영상이 6배 — 으로 읽기 쉽지만, 그건 과소평가예요. 차이는 길이가 아니라 연속성입니다.

5초 클립 여섯 개를 이어 붙이면, 당신은 드리프트를 관리하는 겁니다. 얼굴이 살짝 바뀌고, 색온도가 떠돌고, 세 번째 샷에서 손가락이 여섯 개가 되어 재생성하면 프레이밍이 바뀌고, 그러면 컷 매치가 어긋나죠. 30초 AI 광고를 만들어 본 사람이라면 진짜 비용은 생성 시간이 아니라 그 후의 화해 작업이라는 걸 압니다.

단일 30초 패스는 그 화해 과정을 제거합니다. 아이덴티티, 의상, 조명, 물리가 한 번에 결정되어 유지돼요. 특히 30초가 중요한 이유는 이것이 표준 광고 슬롯, 완결된 제품 설명 파트, 풀 세로 영상의 길이이기 때문입니다. 이 길이부터는 모델 출력이 편집용 원자재가 아니라 곧바로 납품물이 됩니다.

현재 워크플로가 짧은 클립을 체인으로 잇는 방식이라면, AI 영상 60초 넘게 만드는 법 가이드는 여전히 유효해요 — 다만 더 적은 수의, 더 긴 조각을 잇게 될 뿐이죠.

사후가 아닌, 그림과 함께 생성되는 오디오

Illustration: audio and picture generated as one strand

대부분의 "소리가 있는 AI 비디오"는 두 시스템을 억지로 겹친 겁니다: 먼저 영상을 만들고, 그 다음 오디오를 만들어 더빙·정렬하죠. 특정 프레임에 정확히 맞춰야 할 순간 — 발소리, 문쿵 소리, 한 음절 — 에서 한계가 드러납니다.

Seedance 2.5는 사운드와 비주얼을 공동으로 생성합니다. 실무적으로는 립싱크, 임팩트 타이밍, 주변 일관성이 그걸 유발하는 동작과 같은 패스에서 함께 결정된다는 뜻이에요. 유용한 요령: 프롬프트에 큰따옴표로 대사를 한 줄 넣으면, 캐릭터가 그 대사를 립싱크로 말합니다.

인터뷰·후기, 콩트, 진행자가 있는 설명 씬 등 대사 중심 포맷에서는 다단계 파이프라인이 한 번의 생성으로 접힙니다. 창작 의도에 따라 이후에 AI 보이스오버, 클론 보이스, 음악 베드를 덧씌울 수도 있어요.

아무도 이야기하지 않는 산수

표준 30초 제품 광고를 가정해 봅시다. 예전 방식이라면 5초씩 여섯 클립을 생성합니다. 현실적 적중률을 3번 중 1번 유효 테이크라고 치면 — 총 18번 생성이죠. 그리고 편집에서 색 맞추고, 모션에 맞춰 컷하고, 제품 반사가 바뀌는 두 전환을 숨기는 데 한 시간을 씁니다.

단일 패스 모델이라면 같은 광고가 한 번의 생성입니다. 시도당 적중률은 낮아지는데, 5초보다 30초에서 망가질 수 있는 요소가 더 많기 때문이죠 — 대략 4번 중 1번이라고 합시다. 그러면 네 번 생성이고, 화해 편집은 없습니다.

시도 횟수가 줄어드는 게 포인트의 전부는 아니에요; 화해 단계가 사라지는 게 핵심이죠. 스티칭 작업은 청구할 수도, 창의적이라고도 할 수 없었고, 연습해도 쉬워지지 않았습니다.## 여러 피사체 모션에서 진가를 발휘해요

또 다른 진짜 도약은 상호작용이에요. Seedance 2.5는 배경 앞에서 한 피사체만 움직이는 것이 아니라, 서로에게 영향을 주는 여러 피사체 — 스포츠, 춤, 격투, 물체 충돌 — 를 처리하도록 설계되었어요.

이런 유형의 샷은 역사적으로 가장 빨리 무너졌죠. 두 사람이 공을 주고받으면 공 크기가 들쭉날쭉해지거나 손이 서로를 관통하곤 했어요. 모델이 두 몸 중 어느 쪽도 일관되게 파악하지 못했기 때문이죠. 30초 동안 이런 실패는 누적돼요. Seedance 2.5가 바로 이런 상황, 바로 이런 길이를 정조준한다는 건 우연이 아니에요.

실무적 해석: 스토리보드에 두 개 이상이 서로 닿는 요소가 있다면, 이제 마지막 수단이 아니라 먼저 시도해볼 만한 합리적인 모델이에요.

영역 단위 편집과 180초 베타

헤드라인 뒤에 살짝 가려져 있지만 반복 작업 방식을 바꾸는 두 가지가 있어요.

영역 단위 편집은 클립 전체를 다시 생성하지 않고 프레임의 일부만 바꿀 수 있게 해요. 30초 원테이크에선 그게 결정적으로 중요해요. 예전 워크플로에서는 한 요소가 틀리면 전체 생성을 버리고 다시 운에 맡겨야 했죠. 이미 승인한 대부분을 유지한 채 특정 영역만 고칠 수 있어야 긴 원테이크를 현실적으로 반복 개선할 수 있어요.

초장편 모드는 한 번의 생성 길이를 180초까지 늘려줘요. 베타이고, 그에 맞게 다루는 게 좋아요: 다음 주 납품을 약속하기보다는, 3분 연속 테이크가 무엇을 가능하게 하는지 탐색하는 용도로 쓰세요.

참조 50개: 일관성이 입력이 된다

조용한 핵심 기능은 참조-투-비디오예요. Seedance 2.5는 이미지, 비디오 클립, 오디오 등 최대 50개의 멀티모달 참조를 받아 생성 전반에 걸쳐 유지해요.

이건 브랜드 일관성의 본질을 바꿔요. 과거에는 일관성에 맞추도록 “프롬프트로 유도”했죠. 캐릭터를 집요하게 묘사하며 모델이 수렴하길 바랐어요. 이제는 실물을 넣어요. 세 각도의 제품. 발표자의 얼굴. 장소. 목소리. 모델은 비슷하게 흉내 내는 게 아니라 실제로 맞춰요.

캠페인 작업에서는 “샷들이 서로 관련 있어 보여요”와 “샷들이 같은 촬영에서 나왔어요”의 차이에요. 시리즈 전반에서 캐릭터를 안정적으로 유지하려 프롬프트 문서를 관리해왔다면, 이제 대부분을 참조로 대체할 수 있어요.

비용 구조

Illustration: many references converging into one consistent character

일을 위해 모델을 고를 때 중요한 솔직한 트레이드오프 두 가지가 있어요.

해상도는 720p가 상한이에요. Seedance 2.5는 480p와 720p를 출력해요 — 1080p도, 4K도 아니에요. 일부 론치 기사에서 2.0 리프레시와 혼동했지만 그렇지 않아요. 휴대폰 중심 소셜용이라면 720p면 보통 충분해요. 랜딩 페이지의 히어로 샷이나 대형 스크린용이라면 Veo 3.1처럼 4K 대응 모델로 그 샷만 따로 생성하세요.

초당 과금이 프리미엄이에요. Seedance 2.5는 출력 초당 과금되고, 720p는 480p의 대략 두 배예요. 30초는 초가 많아요. 실전 워크플로: 프롬프트를 맞출 때까지 480p로 드래프트하고, 최종에 720p로 커밋하세요. Vivideo에서는 이 모델이 클립 단위 과금이 아니라 하나의 구독에 포함되어 초안 작성 불안을 대부분 없애줘요.

Seedance 2.5 vs Seedance 2.0: 언제 무엇을 쓸까

Seedance 2.0은 여전히 유효하고, 올바르게 고르면 비용을 절약해요.

클립 자체가 납품물일 때는 2.5를 잡으세요: 30초 광고, 대화 신, 캐릭터나 제품이 전 구간 동일해야 하거나 오디오가 특정 프레임에 정확히 맞아야 하는 경우요.

짧고 임팩트 강한 하이모션 컷 — 3초 훅, 전환, 빠른 편집용 에너지 폭발 — 이 필요하거나, 길이는 필요 없고 1080p가 필요할 때는 2.0을 잡으세요. 모션 품질은 여전히 훌륭하고 짧은 생성은 더 저렴해요.

내재화할 비교: 2.0은 ‘샷’을 최적화하고, 2.5는 ‘씬’을 최적화해요.

Seedance 2.5 프롬프트 작성법

30초 연속 영상은 5초 스펙타클과는 다른 프롬프트 형태를 요구해요. 잘 통하는 몇 가지 패턴은 다음과 같아요:

묘사가 아니라 비트 시트로 쓰세요. 5초에는 한 순간을 묘사하지만, 30초에는 작은 호(arc)를 그려요: 먼저 무엇이 일어나고, 무엇이 바뀌며, 어디에서 끝나는지. 모델이 진행(프로그레션)을 구현할 공간이 있으니 그 여지를 주세요. 안 그러면 모델이 공백을 임의로 채워요.

카메라 동작은 한 번만 지정하세요. 하나의 연속 테이크는 하나의 카메라를 뜻해요. 고정, 천천히 인으로 당김, 핸드헬드 중 하나를 정하고 한 번만 명시하세요. 프롬프트 중간에 카메라를 바꾸면 피하려던 컷이 가장 빠르게 생깁니다.

대사는 큰따옴표로 넣으세요. 입 모양 동기화의 공식 트리거예요. 주어진 시간에 자연스럽게 말할 수 있을 만큼만 짧게 쓰세요 — 30초 클립에 담을 수 있는 대사는 대체로 사람들이 예상하는 것보다 훨씬 적어요.

형용사 대신 레퍼런스를 제공하세요. 얼굴, 제품, 장소가 있다면 첨부하세요. 레퍼런스 하나가 설명 한 단락을 대신하고, 더 신뢰할 수 있어요.

더 넓은 맥락에서의 기본기는 저희의 AI 동영상 프롬프트 작성법 가이드에 정리되어 있어요. 어떤 모델에도 통하는 원칙들입니다.

예시로 살펴보기

30초 제품 스팟에 잘 맞는 프롬프트 형태는 다음과 같아요:

햇살 드는 주방에서 한 번의 연속 핸드헬드 샷. 30대 여성이 조리대 상자에서 커피 그라인더를 꺼내 손으로 살펴보고, 주전자 옆에 둔다. 그녀가 고개를 들어 말한다. "솔직히? 예전 것보다 조용하네요." 미소 짓고 분쇄를 시작한다. 따뜻한 아침빛, 얕은 심도, 내내 오른쪽으로 부드럽게 드리프트하는 카메라.

여기서 중요한 점: 카메라 지시를 한 번만, 세 비트의 호(개봉-배치-사용), 순간에 맞춘 짧은 따옴표 대사 한 줄, 조명은 비트마다가 아니라 한 번만 기술했어요. 실제 제품 사진을 레퍼런스로 추가하면 모델이 추측해야 할 유일한 부분도 사라집니다.

이를 5초 습관 — "커피 그라인더의 시네마틱 샷, 드라마틱 라이팅, 8k" — 과 비교해 보세요. 30초 모델에게는 남은 25초 동안 할 일이 없어져요.

화면비는 처음부터 핵심 선택이에요

Seedance 2.5는 21:9부터 9:16까지 아우르며 16:9, 4:3, 1:1, 3:4를 포함해요. 나중에 크롭하지 말고 생성 시점에 의도적으로 고르세요: 9:16에 맞춰 구성한 30초 테이크는 전 구간 내내 피사체 구도를 유지하지만, 16:9를 세로로 크롭하면 30초 어딘가에서 프레임 밖으로 흐르고, 다시 컷 편집으로 돌아가게 됩니다.

Veo, Sora, Kling과의 포지션

단일 모델이 모든 걸 이기지 못하고, 여러 모델을 툴킷처럼 쓰는 편이 한 모델에 충성하는 것보다 좋아요.

Seedance 2.5는 오디오 싱크가 맞는 연속 길이를 장점으로 가져요. Veo 3.1은 4K 충실도가 여전히 최고고, Sora 2는 물리적 개연성과 프롬프트 이해가 강합니다. Kling은 표현력 있는 인간 동작과 이미지 투 비디오에 능해요.

30초 피스의 실용적인 구성: 메인 신은 Seedance 2.5로 만들고, 클로즈업 히어로 샷은 4K 모델로 교체해 컷 편집으로 연결하세요. 멀티 모델 플랫폼의 존재 이유가 바로 이거예요 — 현재 판도를 정리한 2026년 베스트 AI 동영상 생성기도 참고하세요.

이번 주에 바로 바꿔야 할까요?

예, 만약 30초 소셜 스팟, 대화 신, 추천사, UGC 스타일 광고를 만든다면; 캠페인 전반에서 캐릭터나 제품 일관성이 늘 고민거리라면; 혹은 주당 작업 시간의 상당 부분이 클립 이어붙이기와 색 보정에 사라진다면요.

아직이라면 산출물이 주로 대화면이나 4K인 경우; 10초 미만 클립이 필요해 2.0과 다른 모델들이 더 저렴하고 충분히 좋은 경우; 또는 이미 짧은 생성에 맞춰 파이프라인을 튜닝해 두어 전환 비용이 편집 시간 절감 이익을 넘는 경우예요.

어쨌든 써보세요, 다음 분기를 위한 스택을 고르는 중이라면. 한 번에 납품본을 만들어내는 모델과 원자재를 만들어내는 모델은 다른 도구고, 이 차이는 스펙시트로 따지기보다 오후 내내 직접 써보면 더 분명해요.

한 줄 요약

Seedance 2.5는 사람들이 실제로 퍼블리시하는 길이와 출력 길이가 처음으로 일치한 모델이에요. 길이 30초의 연속 영상에 일관된 오디오와 레퍼런스로 고정된 캐릭터를 더하면, 후반 작업의 잡일 카테고리 하나가 통째로 사라져요. 그 대가로 해상도와 초당 비용을 치르는 셈이죠.

작업이 쇼트폼, 소셜, 대화 중심, 캠페인 일관성 위주라면 올해 가장 유용한 릴리스예요. 4K 마스터가 필요하다면 여러 도구 중 하나로 두세요.

Seedance 2.5는 Vivideo에서 무료로 체험할 수 있어요 — ByteDance 계정 없이, 유료 요금제에서는 워터마크 없는 내보내기, 그리고 다른 무언가가 필요한 샷을 위해 30개 이상의 모델이 함께합니다.

Emir Göcen
작성자

Emir Göcen

기계학습과 컴퓨터 비전 배경을 지닌 Vivideo 공동 창업자. Vivideo가 최상의 인공지능 영상 모델을 평가·조합하는 방식을 이끕니다.

첫 인공지능 동영상을 무료로 만들어 보세요

기획, 생성, 보이스, 브랜드 적용, 게시까지 — 30개+ 모델로 몇 분 만에.

Vivideo 무료로 시작하기