動画生成AIのプロンプト設計とは
動画生成AIのプロンプト設計は、単に「かっこいい映像」と入力する作業ではありません。映像には、静止画にはない時間軸、動き、カメラの連続性、ショット間の整合性が存在します。そのため、プロンプトは「何を描くか」だけでなく、「どう動くか」「どう見せるか」「どの順番で見せるか」をAIに伝える設計図になります。
本章では、動画生成AIにおけるプロンプト設計の基本を、静止画との違いから整理します。
静止画プロンプトとの違い
静止画の場合、一枚のフレーム内に情報を集中させれば成立します。被写体、背景、光、構図、色調を指定すれば、鑑賞に耐える一枚が生まれます。一方、動画の場合は、その一枚が数秒間変化し続けます。したがって、プロンプトには「開始状態」「変化」「終了状態」を意識した記述が必要です。
たとえば「赤い傘をさした女性が雨の交差点に立っている」というプロンプトは静止画には十分でも、動画では曖昧です。雨は強くなるのか、女性は歩き出すのか、カメラは寄るのか、引くのか。こうした時間方向の情報を欠くと、AIは勝手に補完し、意図しない動きやカット割りを生みます。
プロンプトが担う4つの役割
動画プロンプトには、大きく分けて四つの役割があります。
- 内容指定:被写体、場所、小道具、服装、感情を決める。
- スタイル指定:実写風、アニメ調、3D、レトロ、シネマティックなどのルックを決める。
- 時間設計:動きの速さ、カメラ移動、ショットの長さ、テンポを決める。
- 制約設計:やってほしくないこと、避けたい構図、崩れてほしくない要素を明示する。
この四つを分けて考えるだけでも、プロンプトの精度は大きく変わります。特に制約設計は見落とされがちですが、手の崩れ、余計なテキスト、不要な人物の増殖、過度な露出などを防ぐために重要です。
生成前に決める要件とモデル選定
プロンプトを書き始める前に、映像の要件を固めます。ここを飛ばすと、生成を繰り返すたびに目的がぶれ、使うモデルや設定も定まりません。
目的と配信先を決める
最初に決めるべきは、その映像をどこで使うかです。広告、SNS、プレゼン、YouTube、店舗サイネージ、アプリ内デモでは、必要な解像度、縦横比、尺、テンポが異なります。SNSの縦動画なら最初の一秒で視線を止める構図が必要ですし、企業プレゼンなら説明の正確さと落ち着いたトーンが優先されます。
配信先が決まれば、自ずと制約が決まります。たとえば縦動画では人物の顔を中央より上に置き、テロップ用の余白を下に残す。横動画では左右の情報量を増やし、カメラ移動で奥行きを見せる。こうした設計はプロンプトの構図指定に直結します。
尺・カット数・アスペクト比
動画生成AIは、長尺の映像を一度に作るのが得意とは限りません。数秒から十数秒のショットを複数生成し、編集でつなぐ方が安定します。したがって、全体の尺から逆算してカット数を決めます。十五秒の動画なら三から五カット、六十秒なら十から二十カットが目安です。
アスペクト比も事前に固定します。16対9、9対16、1対1、4対5など、配信面に合わせて統一しないと、後工程でトリミングが発生し、構図の意図が失われます。
ルックとトーン
映像のルックは、プロンプトのスタイル記述を左右します。シネマティック、ドキュメンタリー、商品CM、アニメ、クレイアニメ、サイバーパンク、自然派など、トーンを言葉にしておきます。さらに、色温度、コントラスト、粒子感、被写界深度、レンズ感も指定できると、ショット間の統一感が増します。
モデル選定の観点
モデル選びでは、次の観点を比較します。
- 実写人物の自然さ
- カメラワークの安定性
- テキストやロゴの再現性
- スタイルの幅
- 縦動画への対応
- 参照画像の使いやすさ
- 生成速度と反復しやすさ
- ライセンスと利用条件
モデルごとに得意分野が異なるため、すべてを一つのモデルで賄おうとしないことが重要です。人物ショットはA、風景はB、商品カットはCというように、ショット単位で使い分けると品質が安定します。
プロンプトを構成する7つのレイヤー
動画プロンプトは、思いつきで長文を書くよりも、レイヤーに分けて組み立てる方が再現性が高まります。ここでは七つの基本レイヤーを紹介します。
1 被写体
誰が、何が主役なのかを明確にします。人物なら年齢感、髪型、服装、表情、持ち物。商品なら素材、色、形状、ロゴの有無。動物や乗り物なら種類と状態を指定します。曖昧な表現は避け、必要なら参照画像を併用します。
2 アクション
動画の核心です。歩く、振り返る、笑う、手を伸ばす、風に揺れる、湯気が立つ、光が差し込むなど、時間変化のある動詞を入れます。動作は一つか二つに絞ると破綻しにくくなります。
3 環境
場所、天候、時間帯、周囲の物、背景の密度を指定します。室内か屋外か、都市か自然か、混雑しているか静かか。環境はライティングとカメラワークに影響するため、できるだけ具体的に書きます。
4 カメラワーク
固定、パン、ティルト、ドリー、ズーム、手持ち、ドローン、トラッキングなどから選びます。カメラの動きは映像の意味を変えます。同じ人物でも、ゆっくり寄るのか、急に引くのかで感情が変わります。
5 ライティング
自然光、逆光、ゴールデンアワー、窓明かり、ネオン、スタジオ照明などを指定します。光源の方向と強さ、影の柔らかさ、反射の有無まで書くと、AIの解釈が安定します。
6 スタイル
実写、アニメ、3D、水彩、線画、レトロフューチャー、ミニマルなど、全体の表現方法を決めます。スタイルはショット間で固定し、途中で混ぜないことが一貫性の条件です。
7 時間とテンポ
スローモーション、通常速度、タイムラプス、停止から動き出し、ループ、余韻を残す終わり方などを指定します。時間の記述は、動画生成AIにとって最も難しい領域の一つなので、短いショットで検証しながら詰めます。
これらを一文に詰め込むと読みにくくなるため、被写体とアクション、環境、カメラ、照明、スタイル、時間の順に段落を分けると管理しやすくなります。
ショットリストからプロンプトへ:実践ワークフロー
ここからは、実際の制作手順を七つのステップで解説します。
ステップ1 コンセプトを一行で書く
最初に、映像の目的を一行で言語化します。たとえば「朝のキッチンで新しいコーヒー豆の香りを伝える十五秒の商品動画」のように、誰に何を伝えるかを明確にします。
ステップ2 簡単な脚本を作る
ナレーションやテロップを入れる場合も、まずは映像で何を見せるかを決めます。起承転結ではなく、フック、展開、印象的な締めの三幕で考えると短尺でも構成しやすくなります。
ステップ3 ショットリストに分解する
各カットについて、被写体、アクション、環境、カメラ、照明、尺を表にします。この段階で曖昧な点を潰しておくと、プロンプト作成が速くなります。
ステップ4 プロンプトを七層で書く
ショットリストの一行を、七つのレイヤーに展開します。最初は短めに書き、生成結果を見ながら情報を足していく方が、長文を一度に作るより修正が容易です。
ステップ5 少量ずつ生成する
いきなり全カットを作らず、最初は各ショットを二から四パターン生成します。構図、動き、光の当たり方、人物の安定性を確認し、採用方向を決めます。
ステップ6 編集前提で評価する
単体で美しいショットでも、つなげたときにテンポが悪いことがあります。カットの始まりと終わり、視線の流れ、色の連続性を確認します。必要なら終了フレームを次の開始に合わせて調整します。
ステップ7 プロンプトを更新する
採用したプロンプトには変更理由を記録します。どの言葉を足したら動きが安定したのか、どの表現を削ったら破綻が減ったのかを残すと、次のプロジェクトで再利用できます。
一貫性を保つテクニック
動画生成で最も大きな課題は、ショット間の一貫性です。人物の顔、服装、髪型、小物、背景、色調がカットごとに変わると、視聴者はすぐに違和感を覚えます。ここでは実践的な固定方法を紹介します。
キャラクター固定
人物の特徴をプロンプトの冒頭で毎回同じ順序で書きます。年齢、性別、髪色、髪型、服装、体格、表情の基本トーンを固定し、カットごとに変えるのは動作とカメラだけにします。参照画像を使える場合は、正面、横顔、全身の三枚を用意すると安定します。
参照画像とキーフレーム
参照画像は、色や質感だけでなく、構図の基準としても使えます。キーフレームを指定できるモデルでは、ショットの開始フレームと終了フレームを固定し、その間をAIに補完させます。これにより、動きの始点と終点が明確になり、カットのつながりが良くなります。
スタイル固定
スタイル記述は、プロジェクトごとに固定したテンプレートを作ります。照明、レンズ、色調、粒子、コントラストを毎回同じ言葉で書くことで、見た目の統一感が生まれます。逆に、カットごとにスタイル語を増減させると、全体が散らかります。
色と照明の連続性
同じシーン内では、光源の方向と色温度を揃えます。朝の室内なら窓の位置と光の角度を固定し、夜の街ならネオンの色を限定します。ショット間で背景色が大きく変わると、別の場所に見えてしまいます。
カメラと視線の連続性
前のカットで人物が画面右を向いていたら、次のカットでも視線の方向を引き継ぐと自然です。カメラの高さも、目線の高さ、胸の高さ、地面すれすれのどれかに統一します。急な高さ変更は意図的な演出でない限り避けます。
時間制御・カメラワーク・リアリズム
動画生成AIの品質は、時間方向の指示で大きく変わります。ここでは、動きとリアリズムを高める考え方を整理します。
動きの記述
動きは「速い」「遅い」だけでなく、始まり、加速、減速、停止まで書きます。たとえば「ゆっくり歩き始め、画面中央で立ち止まる」のように、変化の段階を指定します。
速度とイージング
一定速度の動きは機械的に見えることがあります。人間の動作には、始めの加速と終わりの減速があります。プロンプトに「自然な加速と減速」「慣性を感じる動き」と加えると、不自然さが減ることがあります。
物理法則
髪や布の揺れ、水しぶき、煙、湯気、ボールの跳ね方などは、物理法則に沿うほどリアルに見えます。重力、抵抗、衝突、反射を意識した言葉を入れます。ただし物理表現を詰め込みすぎると、AIが別の動きを混ぜることがあるため、一ショット一現象を基本にします。
カメラ移動のリアリズム
ドリーとズームを同時に指定すると、映像が不自然になる場合があります。プロの映像でも、カメラの動きは一つか二つに絞ることが多いです。パンならパン、ドリーならドリーを中心にし、必要なら小さな揺れや手持ち感を加えます。
ショットの終わり方を設計する
動画は始まりより終わりが難しいと言われます。カットの終了時に、人物が動きを止める、視線を外す、光が変わる、画面が暗くなるなど、次のカットへつなぐ余韻を設計します。終了フレームが安定すると、編集時のトランジションが楽になります。
複雑なシーンの階層化と反復改善
複雑なシーンでは、一つのプロンプトにすべてを詰め込むと破綻します。階層化と反復が鍵です。
プロンプトの階層化
基本層、アクション層、環境層、カメラ層、スタイル層、制約層に分けて記述します。制約層には「余計な人物を入れない」「画面内に文字を出さない」「手を大きく動かさない」などを書きます。
バッチ処理の考え方
同じプロンプトで複数パターンを生成し、差分を比較します。乱数やシードを固定できる場合は、一つの要素だけを変えて検証します。変数を一つに絞ると、何が結果に影響したのかが分かります。
バリエーション管理
採用、保留、却下の三段階で分類し、ファイル名にショット番号、バージョン、変更点を入れます。たとえばshot03_v02_slowpanのようにします。
プロンプトのバージョン管理
プロンプトはコードと同じように管理します。変更前と変更後を並べ、生成結果の違いをメモします。成功したプロンプトはテンプレート化し、別のプロジェクトでも使えるようにします。
よくある失敗と改善チェックリスト
動画生成AIでよく起きる失敗と、その改善策を整理します。
- 顔がカットごとに変わる:参照画像を使い、人物記述を固定する。
- 手や指が崩れる:手を画面の中心に置き、複雑な指の動きを避ける。
- カメラが勝手に動く:固定カメラを明記し、動きの指示を一つに絞る。
- 背景が不要に変わる:環境記述を短く具体的にし、色と光を固定する。
- 動きが速すぎる:スローモーション、自然な減速、余韻を加える。
- 画面に文字が入る:文字なし、ロゴなし、テロップなしを制約に入れる。
- 人物が増える:被写体の人数を明記し、群衆を避ける。
- 色がショットごとに違う:色温度とスタイルテンプレートを固定する。
- 構図が毎回変わる:アスペクト比、被写体位置、カメラ高さを指定する。
- つなげるとテンポが悪い:終了フレームと次カットの開始を合わせる。
チェックリストは、生成前、生成中、編集前の三段階で使い分けると効果的です。生成前に目的と制約を確認し、生成中は変数を一つだけ変え、編集前には連続性を確認します。
目的別プロンプト例とFAQ
ここでは、目的別のプロンプト例と、よくある質問をまとめます。
商品紹介
朝のキッチン、木製カウンター、窓から柔らかい自然光。商品を中央に置き、湯気がゆっくり立ち上る。カメラは固定からゆっくり寄る。実写風、浅い被写界深度、落ち着いた色調。テキストなし、ロゴなし。
風景
夕暮れの海岸、波が静かに打ち寄せる。カメラは低位置から水平にゆっくりパン。空の色はオレンジから紫へ変化。シネマティック、広角、フィルム粒子。人物なし、建物なし。
人物インタビュー風
室内、窓際、被写体は画面左に座る。カメラは目線の高さで固定。自然光、柔らかい影。表情は穏やか、視線はカメラの少し横。実写ドキュメンタリースタイル。背景は軽くぼかす。
SNS縦動画
9対16の縦構図。被写体は画面中央やや上。背景は明るくコントラスト強め。カメラは固定、短いカット。動きは小さく、テロップ用に下部を空ける。テキストなし、ロゴなし。
FAQ
Q1 プロンプトは長ければ長いほど良いですか。
A1 いいえ。長さよりも構造が重要です。被写体、アクション、環境、カメラ、照明、スタイル、時間の順に整理し、不要な修飾語を削ります。
Q2 同じ人物を複数カットで出したいです。
A2 参照画像を用意し、人物記述を固定します。服装、髪型、年齢感、体格を毎回同じ順序で書くのが基本です。
Q3 カメラワークが意図通りになりません。
A3 カメラの動きを一つに絞り、固定、パン、ドリーなどから選びます。複数の動きを同時に指定すると不安定になります。
Q4 動きが不自然に見えるときは。
A4 速度、加速、減速、停止を追加します。スローモーションや自然な慣性を指定し、物理現象を一つに絞ります。
Q5 生成結果のばらつきを減らすには。
A5 スタイルテンプレートを固定し、変数を一つずつ変えて検証します。シードや参照画像を使える場合は活用します。
Q6 編集でつなぐときのコツは。
A6 前カットの終了フレームと次カットの開始フレームを合わせます。視線、カメラ高さ、色温度、動きの方向をそろえると自然につながります。
まとめ:ワークフローを定着させる
動画生成AIのプロンプト設計は、魔法の呪文を探す作業ではありません。目的を決め、要件を整理し、七つのレイヤーでプロンプトを組み立て、ショット単位で検証し、一貫性を管理する。この地道な流れが、最終的な映像品質を決めます。
最初から完璧なプロンプトを目指す必要はありません。短いショットで試し、差分を記録し、成功した表現をテンプレート化します。モデルや機能は変わっても、被写体、動き、環境、カメラ、照明、スタイル、時間という考え方は普遍です。
大切なのは、一度作って終わりにせず、プロンプトを資産として残すことです。プロジェクトごとにテンプレートを更新し、チームで共有できる形にすれば、動画制作のスピードと安定性は確実に向上します。動画生成AIは強力な道具ですが、それを導くのは明確な設計と反復改善です。焦らず、ショットを重ねながら、自分たちの映像らしさを育てていきましょう。


