Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

動画生成AIプロンプト設計ガイド:一貫性と演出を両立する実践ワークフロー

Sep 27, 2026

動画生成AIのプロンプト設計とは

動画生成AIのプロンプト設計は、単に「かっこいい映像」と入力する作業ではありません。映像には、静止画にはない時間軸、動き、カメラの連続性、ショット間の整合性が存在します。そのため、プロンプトは「何を描くか」だけでなく、「どう動くか」「どう見せるか」「どの順番で見せるか」をAIに伝える設計図になります。

本章では、動画生成AIにおけるプロンプト設計の基本を、静止画との違いから整理します。

静止画プロンプトとの違い

静止画の場合、一枚のフレーム内に情報を集中させれば成立します。被写体、背景、光、構図、色調を指定すれば、鑑賞に耐える一枚が生まれます。一方、動画の場合は、その一枚が数秒間変化し続けます。したがって、プロンプトには「開始状態」「変化」「終了状態」を意識した記述が必要です。

たとえば「赤い傘をさした女性が雨の交差点に立っている」というプロンプトは静止画には十分でも、動画では曖昧です。雨は強くなるのか、女性は歩き出すのか、カメラは寄るのか、引くのか。こうした時間方向の情報を欠くと、AIは勝手に補完し、意図しない動きやカット割りを生みます。

プロンプトが担う4つの役割

動画プロンプトには、大きく分けて四つの役割があります。

  • 内容指定:被写体、場所、小道具、服装、感情を決める。
  • スタイル指定:実写風、アニメ調、3D、レトロ、シネマティックなどのルックを決める。
  • 時間設計:動きの速さ、カメラ移動、ショットの長さ、テンポを決める。
  • 制約設計:やってほしくないこと、避けたい構図、崩れてほしくない要素を明示する。

この四つを分けて考えるだけでも、プロンプトの精度は大きく変わります。特に制約設計は見落とされがちですが、手の崩れ、余計なテキスト、不要な人物の増殖、過度な露出などを防ぐために重要です。

生成前に決める要件とモデル選定

プロンプトを書き始める前に、映像の要件を固めます。ここを飛ばすと、生成を繰り返すたびに目的がぶれ、使うモデルや設定も定まりません。

目的と配信先を決める

最初に決めるべきは、その映像をどこで使うかです。広告、SNS、プレゼン、YouTube、店舗サイネージ、アプリ内デモでは、必要な解像度、縦横比、尺、テンポが異なります。SNSの縦動画なら最初の一秒で視線を止める構図が必要ですし、企業プレゼンなら説明の正確さと落ち着いたトーンが優先されます。

配信先が決まれば、自ずと制約が決まります。たとえば縦動画では人物の顔を中央より上に置き、テロップ用の余白を下に残す。横動画では左右の情報量を増やし、カメラ移動で奥行きを見せる。こうした設計はプロンプトの構図指定に直結します。

尺・カット数・アスペクト比

動画生成AIは、長尺の映像を一度に作るのが得意とは限りません。数秒から十数秒のショットを複数生成し、編集でつなぐ方が安定します。したがって、全体の尺から逆算してカット数を決めます。十五秒の動画なら三から五カット、六十秒なら十から二十カットが目安です。

アスペクト比も事前に固定します。16対9、9対16、1対1、4対5など、配信面に合わせて統一しないと、後工程でトリミングが発生し、構図の意図が失われます。

ルックとトーン

映像のルックは、プロンプトのスタイル記述を左右します。シネマティック、ドキュメンタリー、商品CM、アニメ、クレイアニメ、サイバーパンク、自然派など、トーンを言葉にしておきます。さらに、色温度、コントラスト、粒子感、被写界深度、レンズ感も指定できると、ショット間の統一感が増します。

モデル選定の観点

モデル選びでは、次の観点を比較します。

  • 実写人物の自然さ
  • カメラワークの安定性
  • テキストやロゴの再現性
  • スタイルの幅
  • 縦動画への対応
  • 参照画像の使いやすさ
  • 生成速度と反復しやすさ
  • ライセンスと利用条件

モデルごとに得意分野が異なるため、すべてを一つのモデルで賄おうとしないことが重要です。人物ショットはA、風景はB、商品カットはCというように、ショット単位で使い分けると品質が安定します。

プロンプトを構成する7つのレイヤー

動画プロンプトは、思いつきで長文を書くよりも、レイヤーに分けて組み立てる方が再現性が高まります。ここでは七つの基本レイヤーを紹介します。

1 被写体

誰が、何が主役なのかを明確にします。人物なら年齢感、髪型、服装、表情、持ち物。商品なら素材、色、形状、ロゴの有無。動物や乗り物なら種類と状態を指定します。曖昧な表現は避け、必要なら参照画像を併用します。

2 アクション

動画の核心です。歩く、振り返る、笑う、手を伸ばす、風に揺れる、湯気が立つ、光が差し込むなど、時間変化のある動詞を入れます。動作は一つか二つに絞ると破綻しにくくなります。

3 環境

場所、天候、時間帯、周囲の物、背景の密度を指定します。室内か屋外か、都市か自然か、混雑しているか静かか。環境はライティングとカメラワークに影響するため、できるだけ具体的に書きます。

4 カメラワーク

固定、パン、ティルト、ドリー、ズーム、手持ち、ドローン、トラッキングなどから選びます。カメラの動きは映像の意味を変えます。同じ人物でも、ゆっくり寄るのか、急に引くのかで感情が変わります。

5 ライティング

自然光、逆光、ゴールデンアワー、窓明かり、ネオン、スタジオ照明などを指定します。光源の方向と強さ、影の柔らかさ、反射の有無まで書くと、AIの解釈が安定します。

6 スタイル

実写、アニメ、3D、水彩、線画、レトロフューチャー、ミニマルなど、全体の表現方法を決めます。スタイルはショット間で固定し、途中で混ぜないことが一貫性の条件です。

7 時間とテンポ

スローモーション、通常速度、タイムラプス、停止から動き出し、ループ、余韻を残す終わり方などを指定します。時間の記述は、動画生成AIにとって最も難しい領域の一つなので、短いショットで検証しながら詰めます。

これらを一文に詰め込むと読みにくくなるため、被写体とアクション、環境、カメラ、照明、スタイル、時間の順に段落を分けると管理しやすくなります。

ショットリストからプロンプトへ:実践ワークフロー

ここからは、実際の制作手順を七つのステップで解説します。

ステップ1 コンセプトを一行で書く

最初に、映像の目的を一行で言語化します。たとえば「朝のキッチンで新しいコーヒー豆の香りを伝える十五秒の商品動画」のように、誰に何を伝えるかを明確にします。

ステップ2 簡単な脚本を作る

ナレーションやテロップを入れる場合も、まずは映像で何を見せるかを決めます。起承転結ではなく、フック、展開、印象的な締めの三幕で考えると短尺でも構成しやすくなります。

ステップ3 ショットリストに分解する

各カットについて、被写体、アクション、環境、カメラ、照明、尺を表にします。この段階で曖昧な点を潰しておくと、プロンプト作成が速くなります。

ステップ4 プロンプトを七層で書く

ショットリストの一行を、七つのレイヤーに展開します。最初は短めに書き、生成結果を見ながら情報を足していく方が、長文を一度に作るより修正が容易です。

ステップ5 少量ずつ生成する

いきなり全カットを作らず、最初は各ショットを二から四パターン生成します。構図、動き、光の当たり方、人物の安定性を確認し、採用方向を決めます。

ステップ6 編集前提で評価する

単体で美しいショットでも、つなげたときにテンポが悪いことがあります。カットの始まりと終わり、視線の流れ、色の連続性を確認します。必要なら終了フレームを次の開始に合わせて調整します。

ステップ7 プロンプトを更新する

採用したプロンプトには変更理由を記録します。どの言葉を足したら動きが安定したのか、どの表現を削ったら破綻が減ったのかを残すと、次のプロジェクトで再利用できます。

一貫性を保つテクニック

動画生成で最も大きな課題は、ショット間の一貫性です。人物の顔、服装、髪型、小物、背景、色調がカットごとに変わると、視聴者はすぐに違和感を覚えます。ここでは実践的な固定方法を紹介します。

キャラクター固定

人物の特徴をプロンプトの冒頭で毎回同じ順序で書きます。年齢、性別、髪色、髪型、服装、体格、表情の基本トーンを固定し、カットごとに変えるのは動作とカメラだけにします。参照画像を使える場合は、正面、横顔、全身の三枚を用意すると安定します。

参照画像とキーフレーム

参照画像は、色や質感だけでなく、構図の基準としても使えます。キーフレームを指定できるモデルでは、ショットの開始フレームと終了フレームを固定し、その間をAIに補完させます。これにより、動きの始点と終点が明確になり、カットのつながりが良くなります。

スタイル固定

スタイル記述は、プロジェクトごとに固定したテンプレートを作ります。照明、レンズ、色調、粒子、コントラストを毎回同じ言葉で書くことで、見た目の統一感が生まれます。逆に、カットごとにスタイル語を増減させると、全体が散らかります。

色と照明の連続性

同じシーン内では、光源の方向と色温度を揃えます。朝の室内なら窓の位置と光の角度を固定し、夜の街ならネオンの色を限定します。ショット間で背景色が大きく変わると、別の場所に見えてしまいます。

カメラと視線の連続性

前のカットで人物が画面右を向いていたら、次のカットでも視線の方向を引き継ぐと自然です。カメラの高さも、目線の高さ、胸の高さ、地面すれすれのどれかに統一します。急な高さ変更は意図的な演出でない限り避けます。

時間制御・カメラワーク・リアリズム

動画生成AIの品質は、時間方向の指示で大きく変わります。ここでは、動きとリアリズムを高める考え方を整理します。

動きの記述

動きは「速い」「遅い」だけでなく、始まり、加速、減速、停止まで書きます。たとえば「ゆっくり歩き始め、画面中央で立ち止まる」のように、変化の段階を指定します。

速度とイージング

一定速度の動きは機械的に見えることがあります。人間の動作には、始めの加速と終わりの減速があります。プロンプトに「自然な加速と減速」「慣性を感じる動き」と加えると、不自然さが減ることがあります。

物理法則

髪や布の揺れ、水しぶき、煙、湯気、ボールの跳ね方などは、物理法則に沿うほどリアルに見えます。重力、抵抗、衝突、反射を意識した言葉を入れます。ただし物理表現を詰め込みすぎると、AIが別の動きを混ぜることがあるため、一ショット一現象を基本にします。

カメラ移動のリアリズム

ドリーとズームを同時に指定すると、映像が不自然になる場合があります。プロの映像でも、カメラの動きは一つか二つに絞ることが多いです。パンならパン、ドリーならドリーを中心にし、必要なら小さな揺れや手持ち感を加えます。

ショットの終わり方を設計する

動画は始まりより終わりが難しいと言われます。カットの終了時に、人物が動きを止める、視線を外す、光が変わる、画面が暗くなるなど、次のカットへつなぐ余韻を設計します。終了フレームが安定すると、編集時のトランジションが楽になります。

複雑なシーンの階層化と反復改善

複雑なシーンでは、一つのプロンプトにすべてを詰め込むと破綻します。階層化と反復が鍵です。

プロンプトの階層化

基本層、アクション層、環境層、カメラ層、スタイル層、制約層に分けて記述します。制約層には「余計な人物を入れない」「画面内に文字を出さない」「手を大きく動かさない」などを書きます。

バッチ処理の考え方

同じプロンプトで複数パターンを生成し、差分を比較します。乱数やシードを固定できる場合は、一つの要素だけを変えて検証します。変数を一つに絞ると、何が結果に影響したのかが分かります。

バリエーション管理

採用、保留、却下の三段階で分類し、ファイル名にショット番号、バージョン、変更点を入れます。たとえばshot03_v02_slowpanのようにします。

プロンプトのバージョン管理

プロンプトはコードと同じように管理します。変更前と変更後を並べ、生成結果の違いをメモします。成功したプロンプトはテンプレート化し、別のプロジェクトでも使えるようにします。

よくある失敗と改善チェックリスト

動画生成AIでよく起きる失敗と、その改善策を整理します。

  • 顔がカットごとに変わる:参照画像を使い、人物記述を固定する。
  • 手や指が崩れる:手を画面の中心に置き、複雑な指の動きを避ける。
  • カメラが勝手に動く:固定カメラを明記し、動きの指示を一つに絞る。
  • 背景が不要に変わる:環境記述を短く具体的にし、色と光を固定する。
  • 動きが速すぎる:スローモーション、自然な減速、余韻を加える。
  • 画面に文字が入る:文字なし、ロゴなし、テロップなしを制約に入れる。
  • 人物が増える:被写体の人数を明記し、群衆を避ける。
  • 色がショットごとに違う:色温度とスタイルテンプレートを固定する。
  • 構図が毎回変わる:アスペクト比、被写体位置、カメラ高さを指定する。
  • つなげるとテンポが悪い:終了フレームと次カットの開始を合わせる。

チェックリストは、生成前、生成中、編集前の三段階で使い分けると効果的です。生成前に目的と制約を確認し、生成中は変数を一つだけ変え、編集前には連続性を確認します。

目的別プロンプト例とFAQ

ここでは、目的別のプロンプト例と、よくある質問をまとめます。

商品紹介

朝のキッチン、木製カウンター、窓から柔らかい自然光。商品を中央に置き、湯気がゆっくり立ち上る。カメラは固定からゆっくり寄る。実写風、浅い被写界深度、落ち着いた色調。テキストなし、ロゴなし。

風景

夕暮れの海岸、波が静かに打ち寄せる。カメラは低位置から水平にゆっくりパン。空の色はオレンジから紫へ変化。シネマティック、広角、フィルム粒子。人物なし、建物なし。

人物インタビュー風

室内、窓際、被写体は画面左に座る。カメラは目線の高さで固定。自然光、柔らかい影。表情は穏やか、視線はカメラの少し横。実写ドキュメンタリースタイル。背景は軽くぼかす。

SNS縦動画

9対16の縦構図。被写体は画面中央やや上。背景は明るくコントラスト強め。カメラは固定、短いカット。動きは小さく、テロップ用に下部を空ける。テキストなし、ロゴなし。

FAQ

Q1 プロンプトは長ければ長いほど良いですか。
A1 いいえ。長さよりも構造が重要です。被写体、アクション、環境、カメラ、照明、スタイル、時間の順に整理し、不要な修飾語を削ります。

Q2 同じ人物を複数カットで出したいです。
A2 参照画像を用意し、人物記述を固定します。服装、髪型、年齢感、体格を毎回同じ順序で書くのが基本です。

Q3 カメラワークが意図通りになりません。
A3 カメラの動きを一つに絞り、固定、パン、ドリーなどから選びます。複数の動きを同時に指定すると不安定になります。

Q4 動きが不自然に見えるときは。
A4 速度、加速、減速、停止を追加します。スローモーションや自然な慣性を指定し、物理現象を一つに絞ります。

Q5 生成結果のばらつきを減らすには。
A5 スタイルテンプレートを固定し、変数を一つずつ変えて検証します。シードや参照画像を使える場合は活用します。

Q6 編集でつなぐときのコツは。
A6 前カットの終了フレームと次カットの開始フレームを合わせます。視線、カメラ高さ、色温度、動きの方向をそろえると自然につながります。

まとめ:ワークフローを定着させる

動画生成AIのプロンプト設計は、魔法の呪文を探す作業ではありません。目的を決め、要件を整理し、七つのレイヤーでプロンプトを組み立て、ショット単位で検証し、一貫性を管理する。この地道な流れが、最終的な映像品質を決めます。

最初から完璧なプロンプトを目指す必要はありません。短いショットで試し、差分を記録し、成功した表現をテンプレート化します。モデルや機能は変わっても、被写体、動き、環境、カメラ、照明、スタイル、時間という考え方は普遍です。

大切なのは、一度作って終わりにせず、プロンプトを資産として残すことです。プロジェクトごとにテンプレートを更新し、チームで共有できる形にすれば、動画制作のスピードと安定性は確実に向上します。動画生成AIは強力な道具ですが、それを導くのは明確な設計と反復改善です。焦らず、ショットを重ねながら、自分たちの映像らしさを育てていきましょう。

Alexander

Alexander