ブログガイド

優れた人工知能(AI)動画と残念な動画を分ける5つのプロンプトパターン

最高のAI動画を生む5つのプロンプトパターンを解説。弱い例と強い例を比較し、そのまま使えるコピーテンプレ付き。手探りはやめて、実用的なクリップを確実に作成。

ほとんどのAI動画が失敗する理由は単調だ。被写体がクリップの途中で変形する。頼んでもいないカメラ動作が起きる。秒2〜4の間に商品の色が変わる。技術的には「動画」でも、実務的には使い物にならない。

何万件という実際のAI動画プロンプト——出荷されたクリップを生んだものと、ゴミ箱行きになったもの——を見ていくと、あるパターンが浮かぶ。優れたプロンプトは長いわけでも詩的なわけでもない。もっと「構造化」されている。何が変わり、カメラがどう振る舞い、何を固定し、何を絶対に許容しないかをモデルに伝えている。

これは、クリエイターが何を作っているかをデータで示した4万件のAI動画プロンプトが明かすことの実務的コンパニオン。あちらが「何を」作るかなら、この記事は「どう書くか」。5つの型を、弱い例・強い例・差が生まれる理由とともに解説する。

重要なポイント

- 被写体+アクション+時間的変化で書き出す——静的な記述は、静的で生命感のないクリップを生む。

- カメラは撮影監督に指示するつもりで具体化:ショットサイズ、レンズ、そして意図的な1つの動き。

- 連続性トークン(顔、プロダクト、色、ロゴ)をロックして、全編で漂流させない。

- 生成前に、プラットフォームと尺に合わせてショットとテンポを設計する。

- ネガティブ指定と明確な出力仕様で制約し、モデルに「試すべきこと」だけでなく「避けるべきこと」を伝える。

パターン1:被写体・アクション・時間的変化で書き出す

動画はモーションだ。生きた映像を生むプロンプトと、写真にゆっくりズームするだけのプロンプトを分ける最大の違いは、「何かが起きる」と記述しているかどうか。

弱いプロンプトは「情景」を描く。強いプロンプトは「変化する情景」を描く。

弱い例: A coffee cup on a wooden table in a cafe.

強い例: A steaming coffee cup on a wooden cafe table; steam curls upward and drifts left as morning light slowly brightens across the surface over 5 seconds.

弱い版はモデルに静止画しか与えず、動きを発明させる——たいていは怠惰なプチズームか、曖昧な揺れになる。強い版は被写体(コーヒーカップ)、アクション(蒸気が立ち上り左へ流れる)、時間的変化(5秒かけて光がゆっくり明るくなる)を名指しする。モデルは冒頭と終端の状態を得て、その間を補間できる。これは動画モデルの本領だ。

解決はメカニカルだ。すべてのプロンプトで自問する。「このクリップの終わりと始まりで、1つだけ違うものは何か?」答えられないなら、動くポストカードになる。その変化を一文に焼き込め。ささやかな変化——首の向き、ドアが開く、霧が流れ込む——でも、モデルに「時間軸でやる仕事」を与えられる。

パターン2:シネマトグラファーのようにカメラを指示する

Illustration: structure beats cleverness

カメラを指定しないと、モデルが勝手に決める——そしてだいたい外す。凡庸なドリーインか、いかにも「AI」な手ブレ風ドリフトになりがち。最良のプロンプトは、カメラを創造的な意図として扱い、後付けにしない。

必要なのは3つ:ショットサイズ(ワイド/ミディアム/クローズアップ)、レンズやフレーミングの感触(35mm、広角、浅い被写界深度)、そして「1つだけ」の動き(ゆっくりプッシュイン、サイドトラッキング、完全固定)。動きは1つ。3つではない。

弱い例: A car driving down a coastal road, cinematic.

強い例: Wide tracking shot of a vintage convertible on a coastal highway, shot on a 35mm lens with shallow depth of field, camera tracks alongside the car at matching speed, golden hour.

「cinematic」は願望であって指示ではない。強い版はフレーミング(ワイドのトラッキング)、光学的キャラクター(35mm、浅い被写界深度)、そして一貫した単一の動き(並走トラック)を伝える。この一貫性こそがプロらしさに見える。矛盾するカメラ指示——「回り込みながらズームしてパン」——はモデルが破綻し、泳ぐような不安定さを生む。

カメラ語彙に不慣れなら、AI動画プロンプトの書き方ガイドが用語を分解している。近道は「何でも言った通りにしかやらないオペレーターに一行で渡す」つもりで書くこと。その精度で具体化しよう。

パターン3:連続性トークンをロックする

ここが、ホビイストと実用クリップ量産者を分ける。AI動画モデルはドリフトする。数秒の間に顔が微妙に別人へ、赤いロゴがオレンジへ、製品に余計なボタンが生える。連続性トークンは、そうした要素を固定するための、短く特徴的で繰り返し使うフレーズだ。

連続性トークンは、被写体のアイデンティティ、プロダクト、カラーパレット、ブランディングのために決め打ちし、逐語的に再利用する短い記述。

弱い例: A woman in a red jacket walks through a city, then we see her closer up.

強い例: A woman with shoulder-length curly black hair and a bright crimson leather jacket walks through a neon-lit city; same crimson jacket and same hairstyle held consistent throughout the clip.

「赤いジャケットの女性」では、モデルに再発明の余地を与える。「肩までの黒いカーリーヘア」と「鮮やかなクリムゾンのレザージャケット」を明示し、一貫保持を指示すれば、モデルに錨が生まれる。1つのプロジェクトで複数クリップを作るなら、これらのトークンを毎回コピペし、絶対に言い換えない。言い換えが、ショット3でキャラがショット1と別人に見える原因だ。

ブランド案件では必須。厳密な色名(Hex相当)、ロゴ位置、製品の決定的特徴を、すべてのプロンプトに固定せよ。プラットフォームが画像参照やテキストから動画の開始フレームに対応しているなら使うべき——ただしテキストのロックも併用する。動きの「中」を貫いてアイデンティティを運ぶのは、参照画像ではなく記述だ。

パターン4:プラットフォームと尺にショットを合わせる

Illustration: directing the camera

12秒のYouTubeヒーローに優れたプロンプトは、4秒のTikTokフックには不向きだ。違いはアスペクト比だけではない。最良のプロンプトは、公開先から逆算して設計される。

書き始める前に決める3つ:アスペクト比(フィードは9:16縦、YouTubeやLPは16:9)、尺(起こせる変化量に直結)、ペーシング(短いループは1ビート、長めは明確なアーク)。

弱い例: An energetic montage of a fitness product with lots of quick cuts and text, for social media.

強い例: 9:16 vertical, single continuous 5-second shot: a runner laces up bright orange sneakers and pushes off frame-left into a sprint, fast-paced, punchy, designed as a TikTok hook with the action landing in the first 2 seconds.

短い単発生成の中で「多数のクイックカット」を求めるのは破綻のもと——多くのモデルは1回の生成で1カット連続ショットを出すから、要求がツールと衝突する。強い版は形式を尊重する:縦、ワンショット、プラットフォームが求める最初の2秒にアクションが着地するよう設計。仕様に沿ったクリーンなワンショットを複数作って編集で繋ぐほうが、1プロンプトで編集を詰め込むより良い結果になりやすい。

尺は要求できる変化量も決める。4秒なら、明確な1アクション。12秒なら、小さなアークが可能。4秒に三幕構成を詰め込めば、すべてが滲むだけ。

パターン5:ネガティブ指定と明確な出力仕様で制約する

最後のパターンは、ほとんど誰も使わない——だからこそアドバンテージだ。モデルに「欲しいもの」を積み増すより、「いらないもの」を明示するほうが効くことが多い。そこに明確な出力仕様を添えれば、地味な決定を運任せにしなくなる。

やることは2つ:ネガティブ(拒否するアーティファクトやクリシェ——歪んだ手、文字化け、余計な手足、フリッカー、望まないスローズーム)と、出力仕様(フレームレートの質感、ライティング、ムード、アスペクト比を文末で明快に)。

弱い例: A chef plating a dish in a restaurant kitchen.

強い例: A chef precisely plating a dish in a warm restaurant kitchen; medium shot, soft key light from the left, calm and deliberate pacing, 16:9. Avoid: distorted hands, extra fingers, floating utensils, on-screen text, fast camera movement.

ネガティブは実効性が高い。手は動画モデルの恥部になりやすいので、「歪んだ手、余分な指」を名指しすれば、そこに計算資源を割く。「画面上のテキスト回避」でモデルが幻視しがちな文字ジャンクを潰す。文末の出力仕様——ショットサイズ、光の向き、テンポ、アスペクト比——で、意図当てゲームをやめ、明示に切り替える。

ネガティブは絞って関連性を高く。汎用10項目は信号を薄める。このプロンプトで起きがちな失敗に的を絞った3〜4項目が鋭い。モデルごとに弱点は違うので、使うモデルを知る価値がある——AIモデルの強みマップで、各モデルの得手不得手を分解している。

5つを1つのプロンプトに束ねる方法

Illustration: locking continuity tokens

これらは選択式ではない——最良のプロンプトは5つを積み重ねる。自然な並びはこうだ。

  1. 被写体+アクション+変化(「シェフが料理を盛り付け、仕上げのガーニッシュを置くと湯気が立ち上る」)
  2. カメラ(「ミディアム、50mm、スロープッシュイン」)
  3. 連続性トークン(「同じ白のダブルのコックジャケットのシェフで全編一貫」)
  4. プラットフォーム+尺の仕様(「16:9、8秒、穏やかなペーシング」)
  5. ネガティブ+出力(「左からの暖かいキーライト。Avoid: 歪んだ手、画面上テキスト」)

上から下へ、モデルが自信をもって実行できる一貫した指示になる。各節が、本来モデルが「勝手に」決めてしまう問いに答える——そして「勝手に」は悪いAI動画の温床だ。

毎回ゼロから書く必要もない。コピペ可能なプロンプトテンプレート集を使えば、よくあるショットの検証済みスケルトンが手に入る。被写体とトークンを差し替えるだけで、思考せずとも5パターンを回せる。

次の一手

出来が悪かったクリップのプロンプトを1つ選び、5つの型で見直そう。時間的変化は名指しされているか? 明確な1つのカメラ動作を指示しているか? 連続性トークンはロック&反復されているか? 実際のプラットフォームと尺に合わせてスペックされているか? モデルに「避けるべきこと」を伝えているか?

弱い2点を直して再生成。それだけの編集パスで、「削除」から「出荷」に化けることが多い。

準備ができたら、アプリでtext-to-videoを開き、構造化プロンプト——被写体、カメラ、トークン、仕様、ネガティブ——で書いてみよう。スケールで実際に効いている裏付けデータが欲しければ、対になる分析記事4万件のAI動画プロンプトが明かすことを読んでほしい。クラフトとエビデンスの両輪が、勘をやめて「演出」を始める最短路だ。

40,000件超のAI動画プロンプトを分析しました

AI動画については誰もが意見を持っています。評論家は行方を予測し、Twitterでは「もう十分に良いのか」を論争し、YouTubeのサムネは最新モデルのアップデートを大声で叫びます。

しかし、今この瞬間に人々がこれらのツールで実際に何を「作っている」のかは、ほとんど語られていません。

そこで、私たちが調べました。

Vivideo上で作成された120,000本超のAI生成動画からデータを収集し、そのうちの40,000件超のプロンプトをGPT-4o-miniで分類。数字を徹底的に解析しました。浮かび上がったのは、インフルエンサーでも研究者でもない、日々のクリエイターや企業が、2025年にAI動画をどう使っているかの驚くほど詳細な実像です。

わかったことをすべて共有します。

データセット:この数字をどう集めたか

まずは方法論を明確にして、何を見ているのかをはっきりさせましょう。

完全なデータセットは、Vivideoのプラットフォームで生成された120,000本超の動画を網羅しています。詳細なプロンプト分析では、915件のプロンプトを層化抽出し、GPT-4o-miniでユースケースに分類しました。モデル利用状況、アスペクト比、尺、言語、入力タイプといった全体統計は、完全データセットに基づいています。

見栄えのする結果だけを選んではいません。「すごい」出力でフィルタもしません。これは、実ユーザーが実際の仕事で使った生の、未加工のデータです(そう、誕生日にお母さんへ贈る動画も含まれます——それだって素晴らしい使い方です)。

留意点をいくつか。AIによるプロンプト分類は完璧ではありません。あいまいなプロンプトもあります。「人が話すプロダクト動画」は、商品デモにもアバター動画にも分類され得ます。最も妥当な意図に最適化し、数百件を手作業でスポットチェックしました。

では、深掘りしていきましょう。

全体像:テキストから動画 vs 画像から動画

最初の問いはシンプルでした。「人々はどうやって動画作成を始めているのか?」

最初からテキストでプロンプトを書いているのか? それとも画像をアップロードして動かしているのか?

65.7%の動画注文がテキストから動画。32.6%が画像から動画。残りの約1.7%はアバター生成などのその他の手法です。

これは少し意外でした。画像から動画の方が高いと予想していました——視覚的な出発点を与える分、「簡単」だと思えるからです。しかしデータは違う物語を語っています。ユーザーの3分の2は言葉でビジョンを記述し、AIに映像化を任せるのです。

その理由はいくつか考えられます。

とはいえ、画像から動画にも熱心なファン層があります。特にECのプロダクトアニメーション、不動産の内見動画(物件写真から開始)、アート作品を動かす用途で人気です。

人々が実際に作っているもの(ユースケース内訳)

私たちが最もワクワクしていたのがこのセクションです。915件のサンプルプロンプトをユースケースで分類すると、あるカテゴリが圧倒的でした。

ユースケース割合
AI生成の動画シーン88.2%
アバター/トーキングヘッド動画7.1%
画像アニメーション4.7%

強調しておきます。AI動画の約9割は完全生成のシーンです——カメラに向かって話す顔でも、写真にKen Burns効果をかけたものでもなく、テキスト記述から呼び出された完結した視覚的シーンです。

これこそが2025年のAI動画のリアル。人々はAIを視覚的イマジネーション・エンジンとして使っています。

それらのシーンの実像

この88.2%の中身をさらに掘り下げ、どんなシーンが生成されているのかを見ました。カテゴリは重なり得ます(プロモーションは物語にもなり得る)が、主なパターンは以下の通りです。

アバター/トーキングヘッド(7.1%)は、AIアバターの話題性の割には小さい数字です。これは、アバター生成が専門的ユースケースで、ワークフローも異なり、主に企業研修やパーソナライズ営業など、より狭い層に刺さるためです。

4.7%の画像アニメーションは、静止画をアップロードして動きを付けるユーザー層。アート作品、昔の写真、商品画像を生き生きと見せる用途で人気です。

AI動画の言語:24言語に広がる現象

本当に驚いた点があります。AI動画作成は英語が主流だと思っていたなら、データは違うと言っています。

英語は全プロンプトの47.3%に過ぎません。つまり、VivideoのAI動画プロンプトの過半数は英語以外の言語で書かれています。

これは「少し国際的」どころではありません。各大陸にわたり有意な広がりを見せる、グローバルな現象です。

言語プロンプト比率
英語47.3%
ベトナム語23.1%
アラビア語11.4%
ロシア語3.2%
トルコ語2.7%
ドイツ語2.2%
ウクライナ語1.9%
インドネシア語1.7%
スペイン語1.3%
オランダ語0.9%
ヘブライ語0.7%
ポーランド語0.7%
中国語0.6%
ポルトガル語0.6%
スウェーデン語0.5%
ギリシャ語0.4%

いくつか目を引く点があります。

ベトナム語の23.1%は圧倒的。 全プロンプトのほぼ4分の1。これはベトナムのクリエイター経済の隆盛と、コンテンツ制作におけるAI(人工知能)ツールの早期普及を反映しています。ECの商品動画から大量のソーシャルコンテンツまで、幅広く活用されています。

アラビア語の11.4%により、中東・北アフリカ(MENA)は最も活発なAI動画市場の一つです。湾岸諸国で進む急速なデジタルトランスフォーメーションと、AIインフラへの巨額投資を踏まえれば納得です。

ロングテールは実在。 上位以外でも、ロシア語、トルコ語、ドイツ語、ウクライナ語、インドネシア語などで意味のある活動が見られます。AI動画はシリコンバレーのおもちゃではなく、世界的なクリエイティブツールです。

この事実は、人工知能動画分野でプロダクトを作るすべての人に大きな示唆を与えます。英語プロンプトしかうまく扱えないAI動画ツールは、潜在ユーザーの半数超を見逃しています。

形式の好み:アスペクト比と尺

動画のフォーマットを見ると、最終的な掲載先が見えてきます。

アスペクト比

アスペクト比割合
16:9(横)52.8%
9:16(縦/バーティカル)43.7%
1:1(正方形)~0%

横か縦かの分布は驚くほど拮抗——52.8% 対 43.7%。これは重要な示唆を与えます。横長と縦長の戦いは、実質コイントスです。

横長が依然リードするのは、YouTube、ウェブ埋め込み、プレゼン、従来のマーケティング用途がけん引しているためでしょう。一方で、TikTok、Instagram Reels、YouTube Shortsが牽引する縦長も肉薄しています。

そして衝撃の事実。正方形(1:1)は実質的に死に体。 約0%で、もはや誰も正方形動画を作っていません。かつてSNSのデフォルトだったInstagramの正方形形式は、AI(人工知能)動画時代には完全に置き去りにされました。

動画の尺

割合
12秒30.1%
4秒29.2%
8秒23.3%
6秒6.6%

尺の嗜好には、興味深い二極化が見られます。

第1陣:12秒派(30.1%)。 利用可能な最長尺を望む層。ミニストーリー、商品デモ、プロモーションなど、1秒が価値を持つ用途。12秒あれば「導入→見せ場→オチ」の最小物語が可能です。

第2陣:4秒派(29.2%)。 速く、パンチの効いたクリップを求める層——SNSのフック、広告クリエイティブ、複数クリップの合成に最適。4秒は強いビジュアル1発分です。

中間の8秒(23.3%)は、4秒より少し余裕がほしいが12秒までは不要という層。最小勢力の6秒(6.6%)は興味深い結果で、「短い」か「長い」かに振り切る傾向があることを示しています。

モデル競争:Veo 3.1が独走

この分析全体の見出し級データは、これかもしれません。

Veo 3.1がVivideo上のAI動画生成の96.4%を担っています。

誤記ではありません。GoogleのVeo 3.1は、AI動画作成で圧倒的に選ばれています。

モデル利用比率
Veo 3.196.4%
Sora 22.0%
HeyGen(アバター)全注文の10.5%

※HeyGenのアバター生成は機能が異なる(デジタルアバター vs. シーン生成)ため、別カウントです。この10.5%は、ユースケース分析のアバターカテゴリと重複します。

なぜVeo 3.1がここまで支配的なのか。ユーザーフィードバックと自社検証からは次の通りです。

2.0%のSora 2にも根強いファンがいます。特にアーティスティックでスタイライズされた表現で支持されています。しかし少なくとも現時点では、市場は明確です。信頼性が高く高品質なAI(人工知能)動画を求めるとき、人々はVeo 3.1を選んでいます。

驚きの発見

良いデータ分析は、予想外の事実を連れてきます。思わず二度見したパターンを紹介します。

1. 9%のコンテンツモデレーション率

全プロンプトの約9%がフラグ判定(成人向けや不適切)されました。これは業界が想定していたより低い水準です——AI画像生成では15–20%という推計もあります。

何を意味するか。AI動画作成は、AI画像生成よりもプロフェッショナルで目的志向に寄っています。無料の画像ツールで遊ぶのとは異なり、動画生成には費用が伴うため、意図が真剣でビジネス寄りになりやすいのです。

2. バースデーカード効果

個人的な挨拶(誕生日、ホリデー、記念日)が予想以上に多く見られました。デモ動画で映えるユースケースではありませんが、実に心温まる活用です。2年前なら不可能(あるいは非常に高価)だったパーソナライズ動画メッセージを、人々は作っています。

3. 正方形動画の死

すでに触れましたが、再掲する価値があります。1:1の正方形動画は実質0%。2012–2019年にInstagramで支配的だったフォーマットは、完全に見捨てられました。デフォルトが正方形の動画ツールは、過去の課題を解いています。

4. ベトナムのクリエイター経済

全プロンプトの23.1%という数字は、単なる存在感ではありません。第2位の言語として圧倒的で、3位のアラビア語11.4%の倍以上。ベトナムのクリエイター経済は転換点にあり、AI(人工知能)動画ツールが大きな加速装置になっています。

5. 6秒動画は誰も望まない

6.6%という最低の比率で、6秒は最も不人気の尺。人々は短くパンチの4秒か、もう少し語れる12秒のどちらかを強く好みます。中間は刺さらない。この傾向はSNSでも同様で、フックかミニナラティブかの二極に収れんしています。

クリエイターへの示唆

データを見ました。では実際に何を「すべき」でしょうか。

マーケター、コンテンツクリエイター、事業者、AI動画に興味がある方へ。実行に移せるポイントは次の通りです。

1. まずはテキストから動画

まだAI動画を試していないなら、テキストから動画が主戦場です。ユーザーの3分の2はここから始めています。素材は不要、必要なのはアイデアだけ。見たいものを記述すれば、人工知能が映像を組み上げます。

2. 4秒か12秒で考える

AI動画を設計するときは、4秒のパンチか12秒の物語で考えましょう。データが支持しています。SNSのフックや広告クリエイティブには4秒。商品デモ、解説、ナラティブには12秒を。

3. 画面の向きを目的に合わせて選ぶ

何となく横にしないでください。TikTok、Reels、Shortsへ出すなら9:16の縦。YouTube、自社サイト、プレゼンなら16:9。正方形は忘れてOK——市場はすでに次へ進んでいます。

4. 非英語市場を見逃さない

AI動画ビジネスを構築するなら、ベトナム語、アラビア語、ロシア語、トルコ語圏の巨大需要を押さえましょう。ニッチではありません。数億規模の視聴者がいます。

5. プロダクトには画像から動画を

全体ではテキストから動画が優勢でも、ECや商品マーケには画像から動画が秘密兵器。商品写真をアップロードして、動き・文脈・命を与えましょう。撮影より速く、比較にならないほどスケールします。

6. Veo 3.1が堅実な選択

どのモデルを使うか迷うなら、データは明確です。96.4%のユーザーがVeo 3.1を選択。 品質、速度、プロンプト順守のバランスが最適です。まずはここから。特定の作風にはSora 2なども試しましょう。

結論: AI動画はもはや珍品ではありません。120,000本超の生成、24言語超のプロンプト、バースデーカードから不動産ツアーまで広がるユースケース。主流のクリエイティブツールです。問題は「使うかどうか」ではなく、「どうすれば他よりうまく使えるか」です。

何が作れるか、今すぐ体験しませんか? Vivideoを無料で試して、あなたのプロンプトを次回のデータセットへ。

さらに詳しく

自分だけのAI動画を作成する準備はできましたか?

今すぐVivideoを無料でお試しください - クレジットカード不要。数分でプロ品質の動画を作成できます。

Emir Göcen
執筆者

Emir Göcen

機械学習とコンピュータビジョンの知見を持つVivideo共同創業者。最適な生成動画モデルの評価と組み合わせを牽引。

はじめての人工知能(AI)動画を無料で作成

企画から生成・ナレーション・ブランド適用・公開まで——30以上のモデルを横断して、数分で完了。

Vivideo を無料で試す