なぜ動画生成AIでプロンプト設計が最重要になるのか
テキストから映像を生成する技術は、この数年で一気に実用の段階へ入りました。数秒から十数秒のショットを、文章ひとつで作り出せるようになっています。ところが実際に触ってみると、「それらしい映像」は簡単に作れても、「意図した映像」を作るのは驚くほど難しいと気づきます。同じモデル、同じ機能を使っているのに、出力の品質に大きな差が出る。この差を生んでいるのが、プロンプトの設計力です。
動画生成のプロンプトは、静止画のそれよりも扱う変数が格段に多い。時間の経過、カメラの動き、被写体の動き、カット間の連続性、そして音のニュアンスまで、考慮すべき軸が増えていきます。そのため「かわいい猫」のような一言プロンプトでは、毎回違う結果が出て当然です。逆に言えば、軸を分解して指示を組み立てれば、出力は驚くほど安定します。
もうひとつ重要なのは、モデルの性能が均一化してきたという点です。以前は高性能なモデルを利用できること自体が優位性でしたが、今は複数のサービスが似たような品質の映像を出せるようになりました。差がつくのは、モデルそのものではなく、モデルに何をどう伝えるかという設計の部分です。独自のビジュアルアイデンティティや物語のトーンを保つには、プロンプトを「なんとなく書く」のではなく「設計する」姿勢が欠かせません。
この記事では、動画生成AIを使った制作を前提に、プロンプトをどう構造化し、どう検証し、どう改善していくかを、実際のワークフローに沿って整理します。特定のサービス名に依存しない考え方を中心にしつつ、具体的なテンプレートや失敗時の修正手順まで踏み込みます。読み終えたときには、自分の制作フローにそのまま組み込める「型」が手に入っているはずです。
プロンプトの基本構造:7つの構成要素
動画プロンプトの設計は、単語を並べる作業ではありません。パラメータと文脈と制約条件を、意図的に組み上げる作業です。経験上、次の7つの要素に分解すると、抜け漏れが減り、修正も的確になります。
1. 被写体とアクション
誰が、何をしているのか。ここが最も曖昧になりやすい部分です。被写体は「白いトレンチコートを着た30代の女性」のように、年齢・服装・特徴まで書きます。アクションは1ショットにつき1つに絞るのが原則です。「歩きながら振り返り、同時に傘を開く」と3つ重ねると、多くのモデルは途中で動きを放棄したり、不自然に融合させたりします。
動詞は具体的に選びます。「動く」ではなく「一歩踏み出す」「ゆっくり振り返る」「手を伸ばす」。速度も「ゆっくり」「素早く」と添えると再現性が上がります。
2. 環境と時間帯
場所、天候、時間帯、空気感の4点をセットで書きます。「屋内」ではなく「午後の窓明かりが差し込む木造の書斎」、「屋外」ではなく「雨上がりの路地、濡れた石畳」といった具合です。時間帯は色温度に直結するため、映像の印象を大きく左右します。
3. カメラワークとレンズ
動画生成AIがもっとも苦手とするのが、意図したカメラワークです。逆に、指定すれば一気に映像らしくなる要素でもあります。
- 固定(ロックオフ):安定した商品カットやポートレート向き
- スローパン/ティルト:空間の広がりを見せる
- ドリーイン/アウト:感情の接近・離脱を演出する
- ハンドヘルド:ドキュメンタリー的な臨場感
- ドローン上昇:スケール感の提示
レンズも明示します。24mmの広角は空間を強調し、85mmの望遠は背景を圧縮して人物を際立たせます。被写界深度を「浅く」と添えれば、背景のボケが安定します。
4. ライティング
「ゴールデンアワーの逆光」「リムライトで輪郭を縁取る」「ソフトボックスによる均一な光」「ネオンサインの反射」など、光源の種類と方向を書きます。ライティング指定は、キャラクターの一貫性を保つうえでも強力な固定軸になります。同じ照明条件を全カットで使い続けるだけで、別々に生成したショットが同じ作品に見えてきます。
5. スタイルと質感
実写寄りか、アニメか、クレイアニメか、はたまたVHS風のローファイか。色調(ティール・アンド・オレンジ、モノクロ、淡いパステル)、粒子感、フィルムグレインの有無などを指定します。「35mmフィルムで撮影したような質感」といった比喩は、多くのモデルで有効に働きます。
6. 技術パラメータ
アスペクト比(16:9、9:16、1:1)、フレームレート、クリップの長さ、解像度、モーションブラーの強さ。これらはプロンプト本文ではなく設定項目として指定する場合も多いですが、意識しておくべき変数です。縦型のSNS向けなら9:16、シネマティックな演出なら24fpsが基準になります。
7. 制約条件
「1ショット1アクション」「被写体は画面中央から動かさない」「カメラは水平を保つ」など、破綻を防ぐためのルールを明文化します。制約は表現を狭めるように見えて、実際には歩留まりを大きく改善します。
目的別プロンプトパターンの設計
同じ「かっこいい映像」でも、目的によって最適な設計はまったく変わります。ここでは代表的な4つの用途ごとに、重視すべき軸を整理します。
短尺広告・プロモーション
尺は5〜15秒。伝える情報は1つに絞ります。冒頭0.5秒で目を引く動きを入れ、中盤で商品を明示し、最後に余韻を残す構成が定番です。プロンプトでは商品の形状を正確に描写し、背景はシンプルに、カメラは固定かスロードリーを選びます。動きを増やしすぎると商品の輪郭が崩れるため、モーション量は控えめに設定します。
ナラティブ短編・ストーリームービー
感情の変化を扱うため、カット割りを先に設計します。各カットのプロンプトには「前のカットから何が変わったか」を必ず書き添えます。照明、衣装、時間帯を全カットで統一することが、物語の連続性を担保します。1カット3〜5秒を基本にし、感情のピークでは尺を長めに取ると効果的です。
教育・解説コンテンツ
情報の明瞭さが最優先です。カメラは固定、背景は無地か軽いグラデーション、動きは最小限にします。図解やテロップを後工程で載せる前提なら、画面の左右どちらかに余白を作る指示を入れておくと編集が楽になります。人物を登場させる場合も、表情の変化は控えめにして注意をそらさないようにします。
SNS縦型ショート
9:16の縦画面では、上下の安全領域を意識します。被写体は画面中央やや上、テキスト用の余白を下部に確保。テンポを上げるため、カットチェンジは1〜2秒単位で設計します。最初の1秒で「何の映像か」が伝わらないと離脱されるため、冒頭カットには最も強いビジュアルを置きます。
ネガティブ指示と除外設計の実践
ネガティブプロンプトは「禁止リスト」ではなく「破綻の予防線」です。動画生成で頻発する問題は、おおむね次の5つに集約されます。
- 手指や四肢の破綻、人数の増減
- 顔の歪み、目線の不自然な移動
- 被写体の形態が別物に変わるモーフィング
- 背景や衣装の色がカット内で変化する
- 不自然な加速・減速、ちらつき
これらに対しては、「〜しない」と書くだけでなく、「代わりにどうするか」をセットで指定するのがコツです。たとえば「手を激しく動かさない」だけでは、モデルは手をどう扱えばいいか分かりません。「手はポケットに入れたまま」「両手でカップを静かに持つ」と肯定形で示すと、破綻率が目に見えて下がります。
また、除外指定を増やしすぎると映像全体が固くなり、動きのない退屈なカットになります。ネガティブ項目は多くても5〜7個程度に抑え、本当に困っている問題だけを書くのが実践的です。
キャラクターと世界観の一貫性を守るワークフロー
複数カットに同じ人物を登場させるのは、動画生成AIでもっとも難しい課題のひとつです。ここでは再現性を高めるための手順を紹介します。
ステップ1:キャラクターシートを作る
まず、正面・斜め45度・横顔の3方向の静止画を用意します。可能なら表情違い(無表情、微笑み、驚き)も加えます。これを参照画像として各カットの生成に使うことで、顔立ちのぶれが大幅に減ります。参照画像は背景がシンプルで、照明が均一なものを選びましょう。
ステップ2:記述の固定リストを作る
髪型、髪色、瞳の色、肌のトーン、服装、小道具、体格をテキストで明文化し、毎回コピーして使います。形容詞を毎回言い換えると、それだけで別人になります。「短い黒髪」を「黒いショートヘア」と書き換える癖は捨ててください。
固定リストの例:
- 髪:肩までの黒髪、前髪は眉上でまっすぐ
- 服装:生成り色のニット、細いシルバーのネックレス
- 体格:平均的、やや細身
- 照明:柔らかい窓明かり、正面やや左から
ステップ3:シード値と生成条件を記録する
多くのモデルはシード値を固定することで、構図や質感の揺れを抑えられます。カットごとにシードを変える場合でも、「どのシードがどのカットか」を必ず記録します。後から撮り直しが発生したとき、記録がなければ同じ絵は二度と出せません。
ステップ4:変更は1つずつ
衣装を変えたいときは、髪型や背景を同時に変えないこと。複数の変数を一度に動かすと、何が原因で崩れたのか分からなくなります。
カット間の時空間整合性を高めるテクニック
映像はショットの集合体です。1枚ずつが美しくても、つながっていなければ作品にはなりません。
進行方向を統一する。 人物が左から右へ歩いているなら、次のカットでも同じ方向に進ませます。方向が反転すると、観客は空間を誤認します。
180度ルールを意識する。 2人の会話シーンでは、カメラを2人の間を結ぶ線の片側に固定します。これを破ると、どちらを向いて話しているのか分からなくなります。生成AIでも、カメラ位置を言葉で指定すれば同じ効果が得られます。
前カットの最終フレームを次カットの起点にする。 画像から動画を生成できる機能を使い、前のショットの最後のコマを参照画像として次を生成します。これで動きの連続性が格段に向上します。
モーション量を揃える。 速い動きのカットの直後に静止に近いカットを置くと、テンポが不自然になります。カットごとの動きの強さをメモし、緩急を意図的に設計します。
トランジションを前提に余白を作る。 編集でつなぐ場合、各カットの前後に0.3〜0.5秒の余裕があると、つなぎが自然になります。
モデルとツールの選び方:判断基準
動画生成のツールは多数あり、それぞれ得意分野が異なります。選ぶときは、次の観点で比較すると整理しやすくなります。
- 入力形式:テキストのみか、画像・動画も入力できるか
- 得意な表現:実写風、アニメ、抽象表現、人物の動き
- クリップの長さ:数秒か、十数秒か
- 解像度とアスペクト比の対応
- 一貫性の担保手段:参照画像、シード固定、キャラクター登録機能
- 編集機能の有無:カメラ指示、モーション指定、インペイント
- 出力条件:ウォーターマーク、商用利用の可否、API提供
たとえば人物の演技的な動きが欲しいなら画像入力に対応したモデル、風景のスケール感を出したいならテキスト入力の得意なモデル、といった具合に目的から逆算します。
ツールは単体で完結させず、組み合わせるのが現実的です。生成は複数のモデルで試し、編集はDaVinci ResolveやPremiere Pro、合成はAfter Effects、背景除去は専用ツール、といった分担が一般的です。1つのツールで全部やろうとすると、どこかで妥協が生まれます。
反復改善ループとよくある失敗の修正手順
生成は一発で決まりません。次の4段階を回すことで、品質が安定します。
第1段階:ラフ出し。 構図と動きの方向性だけを確認します。細部の質感は無視して構いません。1つのプロンプトから4〜8案を出し、方向性が合っているものを選びます。
第2段階:変数固定。 選んだ案のプロンプトをベースに、シードや構図を固定します。ここで固定しないと、以降の改善がすべて運任せになります。
第3段階:1変数ずつ調整。 照明、服装、カメラワークのうち、1つだけを変えて再生成します。改善したか悪化したかを判断できる状態を保ちます。
第4段階:歩留まり確認。 最終候補を3〜5回生成し、安定して同じ品質が出るかを確認します。1回だけ成功するプロンプトは本番では使えません。
よくある失敗と対処
動きが激しすぎる。 モーション量の指定を下げ、「ゆっくり」「わずかに」といった副詞を追加します。それでも収まらない場合は、アクションを1つ減らします。
被写体が静止したまま。 逆に動きが出ない場合は、動詞を身体全体の動きに変えます(「歩き出す」「振り返る」)。カメラワークを加えるのも有効です。
顔が崩れる。 参照画像の品質を疑います。解像度が低い、背景が複雑、照明が極端な参照画像は害になります。また、人物が画面に対して小さすぎる構図も崩れの原因です。
色がカット内で変わる。 照明条件の記述を固定し、「色調を一定に保つ」と明示します。編集でカラーグレーディングを揃えるのも現実的な解決策です。
文字やロゴが崩れる。 生成AIにテキストを描かせるのは基本的に不利です。映像からは文字を排除し、テロップは編集工程で載せるのが定石です。
カメラが不自然に加速する。 カメラワークの速度を「一定の速さで」と指定します。技術的な限界がある場合は、短い尺に分割して編集でつなぐほうが結果が良くなります。
同じプロンプトなのに毎回違う。 シード未指定、またはヒントとなる要素が少なすぎるのが原因です。制約条件を増やし、参照画像を添えることで安定します。
実践テンプレート集
以下は、そのまま調整して使える基本形です。角括弧の部分を自分の題材に置き換えてください。
商品カット
白い背景の上に置かれた[商品]を、固定カメラで捉える。柔らかいソフトボックスの光が左上から当たり、表面に自然なハイライトが走る。カメラはわずかにドリーインし、商品は静止したまま。浅い被写界深度、35mm相当、色調はニュートラルでクリーン。1ショット1アクション、被写体は画面中央から動かさない。
人物の登場カット
[参照画像]の人物が、夕暮れの屋上で手すりに寄りかかり、ゆっくり顔を上げて遠くを見る。カメラはハンドヘルドでわずかに揺れ、被写体の胸から上のミディアムショットを保つ。ゴールデンアワーの逆光、リムライトで髪の輪郭が光る。肩までの黒髪、生成り色のニット。動きは控えめで、表情の変化は最小限。
風景カット
霧のかかった針葉樹の森を、ドローンがゆっくり前進しながら見下ろす。朝の低い光が木々の隙間から差し込み、光の筋ができる。色調は青緑寄りで落ち着いたトーン。カメラの速度は一定、急な加速はしない。粒子感はわずかに残す。
抽象・トランジション用
黒い背景に、ゆっくり広がる金色のインクが水の中で混ざり合う様子を、マクロレンズで捉える。カメラは固定、動きは自然な対流のみ。高コントラスト、深い黒、鮮明なハイライト。ループしても違和感のない均一な動き。
よくある質問と締めくくり
プロンプトは長ければ長いほど良いですか
一概には言えません。重要なのは長さではなく、変数の網羅性と一貫性です。同じ情報を重複して書いても効果は薄く、逆に矛盾した記述が混ざると出力が崩れます。まず7つの構成要素を1回ずつ埋め、それでも不足する部分にだけ補足を足すのが基本です。
日本語でプロンプトを書いても大丈夫ですか
対応状況はモデルによって異なります。日本語で問題なく解釈される場合もありますが、細かいニュアンスが落ちることがあります。確実性を求めるなら、日本語で設計してから英語に整える二段階の進め方が有効です。
何回くらい生成すれば使えるカットになりますか
用途にもよりますが、1カットにつき5〜10回の生成を想定しておくと現実的です。歩留まりが悪いと感じたら、回数を増やすより先にプロンプトの構造を見直してください。制約条件が不足しているケースがほとんどです。
音声やBGMはどう扱えばいいですか
生成した映像に音が付かない場合、音は編集工程で載せるのが一般的です。動きのタイミングとビートを合わせると、映像の印象が大きく変わります。カットの長さをあらかじめ音楽の拍数に合わせて設計しておくと、編集が格段に楽になります。
生成した映像はそのまま使えますか
そのままでも使えますが、編集を加えたほうが品質は上がります。色調整、不要なフレームの削除、手ぶれ補正、テロップの追加。特に冒頭と末尾の数フレームは破綻しやすいため、トリミングするのが安全です。
スキルを伸ばすには何から始めればいいですか
1つの短いシーンを決め、同じ題材を5パターンの異なるプロンプトで生成し、比較することです。違いを言語化できたとき、プロンプト設計は感覚から技術に変わります。
まとめ
動画生成AIの出力は、運ではなく設計の結果です。被写体・環境・カメラ・照明・スタイル・技術条件・制約という7つの軸を意識して書き、参照画像とシードで一貫性を固定し、1変数ずつ改善していく。この流れを習慣にすれば、同じモデルを使っていても結果は大きく変わります。
まずは15秒の1シーンから始めてください。小さな成功を積み重ねるほうが、長い尺を一度に狙うより、はるかに早く上達します。


