学べること
- 毎回使える5要素のプロンプト構成(被写体・動き・場所・スタイル・カメラ)
- 曖昧なプロンプトを精密に書き換える方法 — ビフォー/アフター例付き
- ネガティブキュー(「文字なし、透かしなし」など)が結果をクリーンにする理由
- 当てずっぽうを避ける「一度に1変更」の反復ループでショットを改善
モデルはプロンプトをどう読むか
テキストから動画モデルは人間のように物語を「理解」しません。学習した視覚とのパターン照合で言葉を結び付けます。画面に何をどう映すか、カメラがどう振る舞うかを具体的に書くほど、モデルの推測は減ります。具体名詞、明確な1つの動き、名前のあるカメラワークは、漠然とした形容詞の羅列より効果的です。
効果的なプロンプト構成
監督のようにショットを記述します—被写体、動き、場所、スタイル、カメラ。1〜2文の明快な文章にまとめましょう。
- 1被写体: 画面に誰/何がいるか(「バリスタ」「洗練されたスマホ」)。
- 2動き: 何が起きるか(「ラテアートを注ぐ」「台座の上でゆっくり回転」)。
- 3場所: どこか(「日差しの入るスペシャルティカフェ」「ミニマルなスタジオ、柔らかな影」)。
- 4スタイル: 見た目(「シネマティック、浅い被写界深度、暖かいグレーディング」)。
- 5カメラ: 動き(「ゆっくり寄り」「オービット」「固定のワイド」)。
ビフォー&アフター
曖昧: 「コーヒーの動画」。より良い: 「木製カウンターの白いカップにラテアートを注ぐバリスタのクローズアップ。日差しの入るスペシャルティカフェ。シネマティック。浅い被写界深度。ゆっくり寄り。文字なし。」後者は被写体、場所、照明、レンズ、動きを制御するため、モデルが補完する余地が少なく、実用的なショットを得やすくなります。
要らないものを明言する
ネガティブキューは結果を整えます。「文字なし、透かしなし、ロゴなし、余分な指なし」などを加えて典型的なAIアーティファクトを回避しましょう。ブランド安全性が必要なら「汎用パッケージ、ブランドロゴなし」を追加。短い除外リストは、形容詞を足すより品質向上に効くことが多いです。
細かく盛り込みすぎず、反復する
まず焦点を絞ったプロンプトで生成し、その後は一度に1点だけ変更します—まず照明、次にカメラワーク、その次に雰囲気。形容詞を一度に10個積むと、何が効いたのか判別不能になります。各生成を単一変数の実験として扱いましょう。
使い回せる「ハウススタイル」を作る
好みのルックが見つかったら、プロンプトのスタイリング部分をサフィックスとして保存し(例: 「シネマティック、4K、自然光のソフトな照明、浅い被写界深度」)、複数のクリップで再利用します。ショットごとに被写体と動きは変えても、ハウススタイルでシリーズ全体の視覚的一貫性を保てます—これがチャンネルを意図的に見せます。
クイックヒント
- 最重要のビジュアルを冒頭に—多くのモデルはプロンプト冒頭を強く重み付けします。
- カメラワーク(「スローパン」「オービット」「固定」)を明示して、エネルギーとテンポを制御します。
- あらゆるクリップで統一感を出すため「ハウススタイル」のサフィックスを再利用しましょう。
- 1ショット1アクション—「入ってきて座って話す」は別々のシーンに分けます。
- うまくいったプロンプトをスワイプファイルに保存し、再利用・リミックスしましょう。
よくある質問
プロンプトの長さはどれくらいが良いですか?
1~2文の明確な文章が、長い段落よりも効果的なことが多いです。長くするより具体的にしましょう。
同じプロンプトを複数のモデルで使えますか?
はい。Vivideo では1つのプロンプトを異なるモデル(Sora、Veo、Kling など)で実行して比較できます。
なぜ動画がプロンプトの一部を無視するのですか?
モデルは冒頭を優先し、後半の指示が落ちることがあります。重要要素を前方に移すか、別シーンに分けてください。
画像から動画でもプロンプトは効きますか?
はい。入力画像がある場合、プロンプトは主にモーションやカメラワークを指示し、被写体自体はあまり変えません。
ショット間で同じキャラクター性を保つには?
同じ詳細な被写体説明を使い回すか、アバター/リファレンス画像を使って見た目を安定させましょう。










