B
- Bロール動画
- 本編ショットに挿入する補助映像。文脈を加えたり、説明を補強したり、編集点を隠したりします。
G
- GAN生成AI
- 敵対的生成ネットワーク。生成器と識別器が競い合う旧来の方法。高品質動画では拡散モデルに置き換わりつつあります。
H
- HDR(ハイダイナミックレンジ)動画
- 標準(SDR)より広い明るさと色域を持つ映像。ハイライトやシャドウがより現実的に、色調も豊かに。
L
- LoRA生成AI
- Low-Rank Adaptation。モデル全体を再学習せず、小さな追加ファイルで新しいスタイルやキャラクター、概念を教える軽量手法。
- LUT(ルックアップテーブル)動画
- 色を再マッピングしてワンクリックで特定のルックを適用するプリセット、または色空間を変換するためのテーブル。
R
- RLHF生成AI
- 人間のフィードバックによる強化学習。人の好みに合わせて出力を調整・整列させる学習方法。
ア
- アスペクト比動画
- フレームの横と縦の比率。16:9(ワイド)、9:16(縦長・リールやTikTok向け)、1:1(正方形)など。各プラットフォームや画面への収まりを左右します。
- アップスケーリング生成AI動画
- 動画の解像度を向上。たとえば1080pを4Kへ。単なる引き伸ばしではなく、もっともらしい細部を補います。
イ
- インペインティング/アウトペインティング生成AI動画
- フレームの一部を塗り直す(インペインティング)、または枠外へ拡張する(アウトペインティング)こと。動画では時間方向にわたり領域の除去・置換・拡張に用います。
ウ
- ウォーターマーク動画
- 所有権を示すロゴやテキストのオーバーレイ。多くの無料生成AIは付与し、有料プランで外れるのが一般的。
エ
- エージェント型動画生成AI動画
- 単発のクリップではなく、1つのブリーフから台本・シーン・音声・アバター・編集まで全制作工程を計画・実行する生成AIエージェント。
- エスタブリッシングショット動画
- シーンの場所や状況を示す冒頭の広い画。そこから寄りのカットへ繋ぎます。
オ
- オープンウェイトモデル生成AI
- 重みが公開され、誰でも実行・解析・微調整できるモデル(例:falやローカル)。API経由でしか触れないクローズドモデルと対比。
ガ
- ガイダンススケール(CFG)生成AI
- プロンプトへの忠実度とモデルの自律性のバランス。高いと指示に厳密、低いと創造的な自由度が増します。
カ
- カメラコントロール生成AI動画
- AI生成ショット内での仮想カメラ操作。パン、ズーム、オービット、ドリーなどを指示。
- カラーグレーディング動画
- ポストプロダクションで色やコントラスト、雰囲気を調整し、意図した統一感ある見た目に仕上げる創造的工程。
キ
- キーフレーム動画
- 編集では、位置・スケール・不透明度などの値を設定し、ソフトがその間を補間する基準フレーム。圧縮では、周辺フレームの再構成に使う完全参照フレーム。
- キャプション/字幕動画
- 音声の内容を画面上に表示。キャプションは音や話者も示してアクセシビリティに配慮、字幕は主に台詞の書き起こしや翻訳。
ク
- クロマキー(グリーンバック)動画
- 特定色(通常は緑)の背景を透過処理し、別の画像や動画に置き換える技術。
コ
- コーデック動画
- 動画を圧縮・伸張するアルゴリズム。例:H.264、H.265/HEVC、AV1、VP9。画質とファイルサイズのバランスを取ります。
- コンテナ(ファイル形式)動画
- 動画・音声・メタデータをまとめる器。MP4、MOV、WebM、MKVなど。内部に格納されるコーデックとは別物です。
- コンポジット動画
- 実写、グラフィック、エフェクト、テキストなど複数要素を重ねて1つのフレームに合成すること。
サ
- サンプリングステップ生成AI
- 拡散モデルがノイズから最終フレームに至るまでの反復回数。多いほど高品質になり得ますが、遅く高コストに。
シ
- シード生成AI
- 生成の出発点となる乱数。プロンプトと同じ設定で同じシードを再利用すると同じ結果を再現でき、整合性や微調整に便利。
- ショット動画
- 1つながりの連続映像。代表的にはロング、ミディアム、クローズアップ。
ス
- スタイル転写生成AI動画
- 参照のビジュアルスタイルを自分の映像や生成結果に適用する手法。
チ
- チェックポイント生成AI
- モデルの重みを保存したスナップショット。配布される「モデルファイル」として共有されることが多い。
デ
- ディープフェイク生成AI動画
- 顔や声をリアルに差し替え・捏造する合成メディア。強力だが、同意・真正性・法的リスクの懸念が伴います。
- ディープラーニング生成AI
- 多層のニューラルネットワークを用いる機械学習。画像・動画・音声・言語モデルを支えています。
- データセット生成AI
- 学習に使うサンプルの集合(動画・画像・テキストなど)。質と多様性がモデルの能力を左右します。
- デジタルヒューマン/デジタルツイン生成AI動画
- 実在の人物を高精細に再現した生成AIのレプリカ。一度学習すれば、オンカメラのプレゼンターとして再利用可能。
テ
- テキストから動画(T2V)生成AI動画
- 文章の説明から直接クリップを生成。カメラも俳優もストック映像も不要。
ト
- トーキングヘッド生成AI動画
- カメラに向かって話す人物を中心に据えた動画。生成AIアバターやプレゼンターの典型用途。
- トークン生成AI
- モデルが処理する最小単位。テキストなら語の一部、動画ならパッチやフレームなど。
- トランジション動画
- あるショットから次のショットへの切り替え方。カット、ディゾルブ、フェード、ワイプなど。
- トランスフォーマー生成AI
- 入力間の関係性を重み付けする「アテンション」に基づくアーキテクチャ。大規模言語モデルや最新の動画モデルの基盤。
ニ
- ニューラルネットワーク生成AI
- 脳をヒントにした層状の結合構造でデータからパターンを学ぶモデル。現代の生成AIの土台。
ネ
- ネガティブプロンプト生成AI
- 出力に含めたくない要素の記述。不要な物体・スタイル・アーティファクトを避ける方向に誘導します。
パ
- パラメータ(重み)生成AI
- 学習でモデルが獲得する内部数値。モデルの「知識」を保持。多いほど高性能になる場合があります。
ハ
- ハルシネーション生成AI
- モデルが自信満々に誤情報や虚構を出す現象。判読不能な文字、指の本数の異常、不可能な動きなど。
ビ
- ビットレート動画
- 動画1秒あたりに使うデータ量。kbpsやMbpsで測定。高いほど情報量を保持できるが、ファイルは大きくなります。
フ
- ファースト&ラストフレーム生成AI動画
- 開始フレームや終了フレームを与え、その間をモデルにアニメーションさせることで、カットの入りと締めを正確にコントロール。
- ファインチューニング生成AI
- 汎用の基盤モデルを特定のデータで追加学習し、特定のスタイル・ブランド・人物に特化させること。
- フレームレート(FPS)動画
- 1秒あたりに再生される静止画の枚数。24fpsはシネマ風、30fpsはウェブの標準、60fpsは動きやスポーツで超なめらか。
- フレーム補間生成AI動画
- 中間フレームを生成してフレームレートを上げたり、動きをなめらかにする手法。例:24fpsをシルキーな60fpsへ。
プ
- プロンプト生成AI
- モデルに与える指示。通常はテキスト、時に画像を添えて、作りたい動画を具体的に記述します。
- プロンプト設計生成AI
- モデルが意図通りの結果を安定して出すよう、被写体・スタイル・カメラ・雰囲気まで言葉を工夫する技術。
ボ
- ボイスクローン生成AI動画
- 短いサンプルから特定人物の声を再現し、その声で新しいテキストを話せるようにすること。
- ボケ動画
- 背景のやわらかなアウトフォーカス表現。光が丸く滲むような描写が典型。
マ
- マルチモーダル生成AI
- 複数のデータ形式を同時に理解・生成できるモデル。例:テキスト、画像、動画、音声の組み合わせ。
モ
- モーションコントロール/モーションブラシ生成AI動画
- 生成クリップ内で、どこをどう動かすかを指示できるツール。モデル任せにせず動きを演出します。
- モデル生成AI
- 入力(例:テキストプロンプト)を出力(例:動画)に変換する学習済みの生成AIシステム。モデルごとに得意分野、速度、価格が異なります。
リ
- リップシンク生成AI動画
- 話し声に合わせてキャラクターやアバターの口の動きを一致させ、本当に話しているように見せること。
- リファレンス画像生成AI動画
- 生成する動画の被写体・キャラクター・スタイルを誘導するためにモデルへ渡す画像。
レ
- レターボックス動画
- 別のアスペクト比に合わせるため、上下(または左右)に黒帯を付け、画をトリミングせず収める手法。
- レンダー/レンダリング動画
- プロジェクトを最終的な動画ファイルに書き出す処理。生成AIでは、モデルがフレームを作り最終クリップにまとめることも指します。
ロ
- ローワーサード動画
- 画面下部に置くテキスト。登壇者の氏名・肩書やキャプションに用います。
ワ
- ワールドモデル生成AI動画
- シーン・物体・物理の振る舞いを内部でシミュレーションし、より長く首尾一貫した動画生成を助ける生成AI。
音
- 音声合成(TTS)生成AI動画
- 文章を合成音声で自然な読み上げに変換。生成AIのボイスオーバーエンジン。
画
- 画像から動画(I2V)生成AI動画
- 静止画を動画として動かす手法。望むモーションをプロンプトで指示することが多い。
解
- 解像度動画
- 各フレームの画素数。横×縦で表記(例:1920×1080)。画素が多いほど細部が鮮明。一般的な層は720p(HD)、1080p(Full HD)、4K、8K。
絵
- 絵コンテ(ストーリーボード)動画
- 制作・生成前に各カットの流れをスケッチやフレームで計画する設計図。
拡
- 拡散モデル生成AI
- 生成AIの主流手法。ランダムノイズから始め、段階的にノイズを取り除いて、プロンプトに合致する一貫した結果を出します。
学
- 学習(トレーニング)生成AI
- 大量のデータを見せ、内部パラメータを徐々に調整して良い結果を出せるように教えること。
基
- 基盤モデル生成AI
- 幅広いデータで学習した大規模・汎用のモデル。多様な下流タスクに適応できます。
時
- 時間的一貫性生成AI動画
- フレーム間でキャラクター・オブジェクト・スタイルを安定させ、チラつきや歪み、不要な変形を防ぐこと。
推
- 推論(インファレンス)生成AI
- 学習済みモデルを実行して出力を得ること。例:プロンプトから動画を生成。課金は通常この生成単位で発生します。
生
- 生成AIアバター生成AI動画
- 画面上のプレゼンターを生成またはクローン化し、指定の声や言語でスクリプトを話す存在。
- 生成AIダビング生成AI動画
- 別言語の話し声に置き換え/追加すること。理想的には話者の声質や口の動きにも整合。
潜
- 潜在空間生成AI
- モデルが実際に計算を行う圧縮表現の領域。ここでまず生成が起こり、その後ピクセルへ復号されます。
動
- 動画から動画(V2V)生成AI動画
- 既存のクリップの動きやタイミングを保ちながら、新しいスタイルや見た目に変換。
- 動画延長生成AI動画
- 元の長さを超えて自然に続くフレームを生成し、クリップを伸ばすこと。
被
- 被写界深度動画
- ピントが合う範囲の深さ。浅いと背景がボケ、被写体が際立ちます。
埋
- 埋め込み(エンベディング)生成AI
- テキスト・画像・音声の意味を数値ベクトルで表したもの。異なる入力同士を比較・結合できるようにします。
AI動画の言語を定義する
AIで動画を作るには、従来の動画用語(アスペクト比、解像度、コーデック)と生成AI用語(ディフュージョン、プロンプト、CFGスケール、画像から動画)という2つの語彙が交わります。本用語集は出会うすべての用語を定義し、専門用語で手が止まる状況を解消します。
まずは基本(アスペクト比、解像度、フレームレート)から始め、出力を左右するAI特有の用語へ進みます:テキストから動画、画像から動画、ディフュージョン、リップシンク、アバターなど。すべての定義は研究者向けではなく、クリエイターのために書かれています。
用語を検索するか、カテゴリで閲覧してください。数式不要のやさしい説明と、実際に動画制作でその概念が効く場面へのリンクを用意しています。
AI動画の用語をやさしく解説
AI動画は、動画制作と生成AIという2つの分野の交差点にあり、それぞれに専門用語があります(アスペクト比、解像度、フレームレート、コーデック、ビットレート/拡散、プロンプト、CFGスケール、テキストから動画、画像から動画、潜在空間など)。この用語集では、出会うすべての用語を平易な英語相当のわかりやすさで定義し、用語が完成動画への障壁にならないようにします。
出力を直接左右する用語もあります。テキストから動画と画像から動画の違いを知るとプロジェクトの始め方が変わり、アスペクト比や解像度を理解すると投稿先が広がります。拡散やノイズ除去を掴むと、モデルの振る舞いが腑に落ちます。ここでの定義は、論文を読む研究者ではなく、動画を作るクリエイター向けに書かれています。
リファレンスとしてお使いください。分からない用語に出会った瞬間に検索するか、カテゴリ(動画の基本、AIの概念、AI動画特有の項目)で閲覧できます。各項目は実務でその概念が効く場面にリンクしており、30以上のモデルで実際の挙動をスタジオで直接確認できます。
AI動画用語集 — FAQ
このAI動画用語集とは?
動画の基本(アスペクト比やコーデック)から、AIの概念(拡散、プロンプト、テキストから動画)まで、AI動画に関する用語を平易な言葉で説明する辞書です。検索やカテゴリ閲覧で専門用語の壁を取り払えます。
テキストから動画と画像から動画の違いは?
テキストから動画は文章のプロンプトからクリップを生成し、画像から動画は静止画を動きに変えます。どちらも本用語集で定義しており、Vivideoは30以上のモデルで両方に対応しています。
AI動画における拡散(Diffusion)とは?
拡散は多くの動画モデルが映像を生成する仕組みで、ノイズから始めてプロンプトに沿って徐々に鮮明な画像へ洗練させます。背景事情も含めた平易な解説は用語集に掲載しています。
AI動画を作るのに技術用語を理解する必要はありますか?
いいえ。理論を知らなくても素晴らしい動画は作れます。ただし、いくつかの重要語(アスペクト比、テキストから動画と画像から動画、プロンプト)を知ると、より速く良い結果に近づけます。本用語集はそのためのものです。
CFGスケール/プロンプト遵守とは?
CFGスケールは、モデルがプロンプトに厳密に従うか、どの程度即興するかを制御します。高くすると言葉に忠実になり、低いほど創造的になります。ここではクリエイター目線で他の用語とともに分かりやすく定義しています。
これらの概念はどこで使えますか?
各定義は実際のワークフローで重要になる箇所にリンクしており、Vivideo上で直接試せます。1つのスタジオで30以上のモデル、無料で開始できます。
ai 動画 用語集ai 動画 用語text to video の意味image to video の意味diffusion ai とはai 動画 辞書ai 動画 用語集・用語cfg scale の意味