ブログトレンド

Seedance 2.5:ByteDanceの30秒モデルは何を変えたのか

Seedance 2.5はネイティブ音声と最大50件のリファレンスで、30秒を一度に生成します。実際に変わった点、費用、適した使い所を解説します。

この3年、どのAI動画モデルも基本は同じでした。美しい5秒のクリップが、面白くなる直前で終わる。AI動画の作法はその制約を前提に築かれてきました——ビートで絵コンテを切り、断片で生成し、編集でつなぎ、4カット目のジャケットの色が1カット目と同じであるよう祈る、という具合に。

Seedance 2.5は、ピクセルではなく制約そのものに切り込むByteDanceの最新動画モデルです。単一パスで「フル30秒」を生成——つなぎ合わせなし、シーンカットのスプライスなし、隠すべき継ぎ目もなし。この1点の変化が、プロンプトの書き方、予算配分、編集に残せる時間まで、すべてに波及します。

本稿では、実際に何が変わり、どこが本当に良くなり、そして同じくらい重要な——いま使っているモデルより劣る2つのポイントを扱います。

重要ポイント

- Seedance 2.5は単一パスで30秒の連続映像を生成し、キャラクターの同一性、ライティング、物理挙動を全編で保持します。

- 音声は後から当てるのではなく映像と同時に生成されるため、リップシンクやインパクトのタイミングが正確なフレームに合います。

- Reference-to-videoは最大50のマルチモーダル入力に対応し、一貫性を“プロンプトの工夫”から“供給する入力”へと移行させます。

- トレードオフは現実的:出力は最大720p、秒課金はプレミアム。主役カットには4Kモデルを使い分けてください。

Seedance 2.5とは何か

SeedanceはByteDanceの動画生成ファミリーです——TikTokやCapCutを手がける同社らしく、テンポ感やフレーミングの勘所が染み込んでいます。Seedance 2.5は2026年6月のVolcano Engine FORCEカンファレンスで発表、2026年7月末にリリースされ、まずByteDanceのDreaminaとJimengアプリに、のちにAPIに展開されました。

モードは3つ:テキストプロンプトからのtext-to-video、静止画からのimage-to-video、そしてワークフローを組み替える価値があるreference-to-video。VivideoではByteDanceアカウントなしでSeedance 2.5を利用でき、30以上のモデルを単一サブスクリプションで使えます。

主な仕様はシンプルです:

30秒という“量”ではなく“連続性”が本質

Illustration: one unbroken take replacing a pile of stitched clips

「30秒」を単なる量の増加——1回で6倍の映像——と読むのはもったいない。違いの本質は“尺”ではなく“連続性”です。

5秒クリップを6本つなぐと、あなたは“ドリフト”を管理することになります。顔つきが微妙に変わる。色温度がさまよう。3カット目で手が6本指になって再生成するとフレーミングが変わり、カットがつながらなくなる。30秒のAI広告を組んだことがある人なら、真のコストは生成時間ではなく、その後の“整合”作業だと知っています。

単一の30秒パスは、その整合を消し去ります。人物像、衣装、照明、物理は一度決まり、保持される。30秒に意味があるのはそのためです。標準的な広告枠の長さであり、製品解説の完結した1ビートであり、一本の縦動画として完結している。モデルの出力が“編集素材”ではなく“成果物そのもの”になる、最初の尺です。

もし現在のワークフローが短尺クリップの連結に依存しているなら、AI動画を60秒超に伸ばす方法は依然有効です——ただし、つなぐピースははるかに少なく、1本あたりははるかに長くなります。

映像と同時に音声を生成——後付けではない

Illustration: audio and picture generated as one strand

多くの「音付きAI動画」は、実質2つのシステムの抱き合わせです。先に映像を作り、その後に音声を生成・吹き替えして合わせる。足音、ドアの閉まる音、音節の一致など、フレーム精度が要る瞬間で破綻しがちです。

Seedance 2.5は音と絵を同時に生成します。実務的には、リップシンク、インパクトのタイミング、環境音の整合が、それらを引き起こすモーションと同じパスで決まるということ。便利な小ワザとして、プロンプト内でセリフを二重引用符で囲むと、キャラクターがそのセリフをリップシンクで話します。

証言動画、コント、プレゼンター付きの解説シーンなど“セリフ主体”のフォーマットでは、複数ステップのパイプラインが1回の生成に畳み込まれます。もちろん、クリエイティブ上の必要があれば、後からAIボイスオーバーやクローンボイス、音楽ベッドを重ねることも可能です。

語られにくい算数

標準的な30秒のプロダクトスポットを考えましょう。従来モデルでは5秒×6本を生成。現実的なヒット率を3本に1本とすると、18回の生成が必要です。さらに編集でカラーを合わせ、モーションでカットをつなぎ、製品の反射が変わる2箇所のトランジションを隠すのに1時間。

単一パスモデルなら同じスポットは1回の生成です。30秒は5秒より失敗要因が増えるため、1トライ当たりのヒット率は下がります——4回に1回としましょう。つまり4回の生成で、整合編集はなし。

試行回数の減少自体が本質ではありません。消えるのは“整合”という工程です。つなぎの作業は請求しづらく、創造的でもなく、繰り返しても上達で楽になる類いの仕事ではありませんでした。

複数被写体の動きこそが真骨頂

もう一つの本質的な進化は「相互作用」です。Seedance 2.5 は、背景の前で1つの被写体が動くのではなく、複数の被写体が互いに影響し合う状況——スポーツ、ダンス、格闘、物体同士の衝突——を扱う前提で作られました。

これは、これまで最も破綻しやすかったクラスのショットです。例えば2人がボールをパスすると、ボールの大きさが変わったり、手が互いに貫通したりしていました。モデルが体の恒常的な把握を持てていなかったからです。30秒を跨ぐとその破綻は累積します。Seedance 2.5 がまさにそれを、まさにその長さで狙っているのは偶然ではありません。

実務的な読み解きとしては、絵コンテに「2つ以上のものが触れ合う」シーンがあるなら、最後の手段ではなく、まず試すに値するモデルになったということです。

領域編集と180秒ベータ

見出しの裏に控えつつ、反復のやり方を変える2つの機能があります。

領域レベル編集は、クリップ全体を再生成せずにフレームの一部だけを変更できます。30秒のワンテイクでは極めて重要です。従来のワークフローでは、1つのミス要素のせいで生成全体を捨てて、再び運任せにするしかありませんでした。承認済みの大部分を保ったまま一部だけ直せることこそ、長尺のワンテイクを現実的に反復可能にします。

超ロングモードは、単一生成を180秒まで拡張します。これはベータであり、そのつもりで扱うべきです。3分の連続テイクで何が可能かを探る用途に使い、来週の納品を約束するためには使わないでください。

50件のリファレンス:一貫性が入力になる

Illustration: many references converging into one consistent character

静かな目玉は「リファレンス to ビデオ」です。Seedance 2.5 は最大50件のマルチモーダル・リファレンス——画像、ビデオクリップ、音声——を受け取り、生成の間じゅう保持します。

これはブランドの一貫性の捉え方を変えます。これまでは一貫性に「近づくようにプロンプトする」——人物を執拗に描写してモデルが収束するのを願う——アプローチでした。いまは「そのもの」を渡します。製品を3方向から。プレゼンターの顔。ロケーション。声。モデルは近似ではなく照合します。

キャンペーン制作では、「関連して見える」から「同じ撮影に見える」への違いになります。シリーズでキャラクターを安定させるためにプロンプト文書を維持してきたなら、その多くをリファレンスが置き換えます。

コストの現実

モデル選定で効いてくる、正直なトレードオフが2つあります。

解像度は720pが上限。 Seedance 2.5 の出力は480pと720pで、1080pでも4Kでもありません。ローンチ時の一部報道が2.0のリフレッシュと混同しましたが別物です。スマホ中心のソーシャル用途なら通常は720pで十分です。ランディングページのヒーローショットや大型スクリーン向けなら、代わりに Veo 3.1 のような4K対応モデルでそのショットを生成してください。

秒課金はプレミアム。 ネイティブでは出力1秒ごとの従量で、720pは概ね480pの約2倍です。30秒は「秒」が多い。実務的な流れは、まず480pでプロンプトを詰め、仕上げで720pにコミット。Vivideo では本モデルがクリップごとの従量ではなくサブスクリプションに含まれるため、ドラフト時の不安は大きく減ります。

Seedance 2.5 と Seedance 2.0:使い分け

Seedance 2.0 は不用品ではありません。正しく選べばコストも抑えられます。

クリップ自体が納品物のときは 2.5 を選びます。30秒スポット、会話シーン、登場人物や製品が全編で同一である必要がある場合、あるいは音声を特定のフレームに正確に合わせたい場合です。

短く、キレがあり、動きの大きいカット——3秒のフック、トランジション、速い編集に載せるエネルギーの爆発——や、1080p が必要で長さは要らない場合は 2.0 を選びます。動きの品質はいまも優秀で、短尺の生成は安価です。

覚えておくべき比較は、2.0 は「ショット」を最適化し、2.5 は「シーン」を最適化する、ということです。

Seedance 2.5のプロンプト設計方法

30秒の連続性は、5秒のスペクタクルとは異なるプロンプト設計を要求します。有効なパターンはいくつかあります。

説明文ではなく、ビートシートを書く。 5秒なら「瞬間」を描写します。30秒なら、小さなアーク(最初に何が起こり、どう変化し、どこで終わるか)を描きます。モデルには進行を実行する余白があります—それを与えないと、埋め草を勝手に作ります。

カメラ挙動は一度だけ指示する。 単一の連続テイクは単一カメラを意味します。固定、ゆっくりプッシュイン、ハンドヘルドのいずれかを決め、1回だけ明示します。プロンプトの途中でカメラ指示がぶつかると、避けたかったカットが最速で入り込みます。

セリフは二重引用符で囲む。 口パク同期のトリガーとして文書化されています。与えられた時間で自然に話せる長さに留めてください—30秒のクリップは、人が想像するよりはるかに少ないセリフしか収まりません。

形容詞の代わりにリファレンスを添付する。 顔、製品、ロケーションがあるなら、参照として付けてください。1つの参照は、書かずに済む1段落の説明に等しく、しかもより確実です。

より広い観点でのAI動画プロンプトの書き方ガイドでは、あらゆるモデルに通用する基礎を解説しています。

作例

30秒のプロダクトスポットで機能しやすい形は次のとおりです。

日差しの入るキッチンで、単一の連続ハンドヘルドショット。30代の女性がカウンター上の箱からコーヒーグラインダーを取り出し、手の中で回して眺め、ケトルの横に置く。彼女は顔を上げて「正直ね?前のより静か」と言う。微笑み、挽き始める。温かな朝の光、浅い被写界深度、全編を通して右方向への穏やかなカメラドリフト。

着目点:カメラ指示は一度だけ、三拍のアーク(開封→配置→使用)、瞬間に合った短い引用セリフ、ライティングは各ビートではなく最初にまとめて記述。実際の製品写真を参照として追加すれば、モデルが推測する唯一の要素も排除できます。

これを5秒の癖—「コーヒーグラインダーのシネマティックショット、ドラマチックな照明、8k」—と比べると、30秒モデルには残り25秒間やることがありません。

アスペクト比は最初に決めるべき選択

Seedance 2.5は21:9から9:16までをカバーし、16:9、4:3、1:1、3:4も含みます。後でクロップするのではなく、生成時に意図して選びましょう。9:16向けに構図した30秒テイクは全編で被写体が収まりますが、16:9を縦にクロップすると30秒のどこかでフレームアウトして、結局カットに戻ることになります。

Veo、Sora、Klingとの位置づけ

すべてを制する単一モデルはなく、道具箱として使い分ける方が1つの名前に忠誠を誓うより賢明です。

Seedance 2.5は「連続尺と音声同期」を得意とします。Veo 3.1は4Kの忠実度で依然ベスト。Sora 2は物理的なもっともらしさとプロンプト理解に強み。Klingは表情豊かな人の動きや画像から動画への変換が得意です。

実務的な30秒構成:メインシーンはSeedance 2.5で生成し、クローズアップのヒーローショットは4Kモデルに差し替え、編集で繋ぐ。まさにマルチモデル型プラットフォームの出番です—現在の勢力図は、私たちの2026年版ベストAI動画ジェネレーターまとめでご覧ください。

今週、乗り換えるべき?

はい:30秒のソーシャル向けスポット、対話シーン、顧客の声、UGC風広告を作る場合。キャンペーン全体でキャラクターや製品の整合性に毎回悩む場合。あるいは週のかなりの時間がクリップのつなぎ合わせや色合わせに消えている場合。

まだ:主に大画面や4K出力が中心の場合。10秒未満が主用途で、2.0や他モデルの方が安価で同等に良い場合。あるいは短尺生成に最適化されたパイプラインが既にあり、乗り換えコストが節約される編集時間を上回る場合。

どちらでも試すべき:次の四半期のスタックを選定中なら。1回の生成で納品物を作るモデルは、素材を作るモデルとは別種の道具です。その違いはスペック表で推論するより、午後の試用で実感する方が早いです。

要点

Seedance 2.5は、実際に人々が公開する尺に出力が合致した最初のモデルです。連続30秒の一貫した音声と参照で固定されたキャラクターにより、ポストプロダクションの雑務が丸ごと消えます。その代償は解像度と秒単価です。

短尺、ソーシャル、対話中心、またはキャンペーンで一貫性が重要なら、今年最も有用なリリースです。4Kマスターが必要なら、複数ツールのうちの1つとして併用してください。

Seedance 2.5はVivideoで無料で試せます—ByteDanceアカウント不要、有料プランなら透かしなしで書き出し可能、さらに他にも30以上のモデルを用途に応じて使い分けられます。

Emir Göcen
執筆者

Emir Göcen

機械学習とコンピュータビジョンの知見を持つVivideo共同創業者。最適な生成動画モデルの評価と組み合わせを牽引。

はじめての人工知能(AI)動画を無料で作成

企画から生成・ナレーション・ブランド適用・公開まで——30以上のモデルを横断して、数分で完了。

Vivideo を無料で試す