AI動画生成でプロンプト設計が結果を左右する理由
AI動画生成モデルは、テキストで与えられた条件に近い映像を確率的に探索して出力します。プロンプトは注文票というより「探索範囲を絞る地図」です。範囲が広すぎれば、モデルは学習データの平均——よくある構図、よくある照明、よくある動き——に収束します。逆に、被写体・光・レンズ・動き・時間の流れを具体的に指定すれば、探索空間が狭まり、意図に近いカットが返ってきます。
静止画と違い、動画では「時間方向の整合性」という条件が加わります。1フレーム目で黒いコートを着ていた人物が、10フレーム目で灰色のジャケットになっていれば、それは破綻です。顔の輪郭、髪型、小物、背景の建物の位置、光源の向き——これらをフレーム間で固定する情報もプロンプトに含める必要があります。ここを怠ると、いわゆるモーフィングやフリッカーが発生します。
さらに、生成には時間と計算資源がかかります。1回の生成で意図に近づけるプロンプトを書けるかどうかが、作業効率を大きく左右します。「なんとなく雰囲気で書いて、出たものに合わせて直す」進め方は、修正のたびに別の崩れが生まれて終わらないループに陥りがちです。最初に構造を設計し、変数をひとつずつ動かす方が、結果的に速くゴールに着きます。
本記事では、プロンプトの構成要素、モデルごとの調整、ネガティブ指定、一貫性の作り方、カメラと動きの制御、シーン設計、反復改善の手順、用途別ワークフローとチェックリストまでを順に扱います。読み終えたとき、自分の企画に対して「どの情報を、どの順番で、どの粒度で書くか」を判断できる状態を目指します。
動画プロンプトの基本構造:6つの構成要素
良いプロンプトは文章の美しさではなく、情報の欠落の少なさで評価されます。次の6要素を埋めていくと、抜け漏れが減ります。
被写体と識別情報
被写体は「何か」だけでなく「誰か・どんな状態か」まで書きます。年齢層、体型、髪型と髪色、服装の素材と色、持ち物、初期の表情。シリーズものを作るなら、この記述ブロックをコピーして使い回すのが基本です。「30代前半の男性、短髪の黒髪、紺のウールコート、右手に革の手帳」のように、具体的な名詞を積み上げます。「美しい」「かっこいい」といった抽象語は識別情報になりません。モデルは抽象語を、学習データの平均的な人物像で埋めてしまうからです。
アクションと感情
動画では「何をするか」を1カットにつき1つだけ書きます。「歩きながら電話して、途中で振り返る」は3つの動作であり、多くのモデルは途中でどれかを省略したり、不自然に混ぜ合わせたりします。動作は動詞で具体的に。感情は表情筋のレベルまで落とすと効きます(眉を上げる、口元をわずかに緩める、目を細める)。「悲しそうに」よりも「まぶたを伏せ、口を結ぶ」の方が再現性が高くなります。
カメラワークとレンズ
カメラの指定は映像の意味を変える強い要素です。寄り(クローズアップ)、引き(ワイド)、移動(ドリーイン/ドリーアウト、トラッキング、パン、チルト)、手持ちの揺れ、固定三脚。レンズは焦点距離で書くと画角と歪みが伝わります。35mm相当の標準、85mm相当のポートレート、24mm相当の広角など。被写体の動きとカメラの動きを同時に指定するときは、どちらが主でどちらが従かを明示します。
ライティングとカラーパレット
光源の種類(自然光、窓明かり、ネオン、実用灯)、方向(逆光、斜光、正面)、質(硬い/柔らかい)、色温度(暖色/寒色)、コントラスト。色は「彩度を抑えた青緑とアンバー」のように2色までに絞ると破綻しにくくなります。時間帯(早朝、夕方のゴールデンアワー、深夜)は光と色を同時に決められる便利な変数です。
スタイルと質感
写実、アニメ、3DCG、クレイアニメ、フィルム風、ドキュメンタリータッチなど。質感は「フィルムグレイン」「浅い被写界深度」「わずかな手ぶれ」「ハレーション」のように、映像の物理的な手触りとして書きます。ここを曖昧にすると、モデルは用途に合わない平均的な見た目に寄せてきます。広告用の映像と個人向けの短編では、求められる質感がまったく違うはずです。
時間・尺・テンポ
1カットの長さ、動きの速さ、テンポ。3秒のカットで行進を最後まで見せるのか、途中で切るのか。スローモーションの倍率、逆再生、加速。時間の指定は、動画生成でもっとも軽視されがちで、もっとも効果が大きい項目です。
[被写体] 30代前半の男性、短髪の黒髪、紺のウールコート、革の手帳
[アクション] 雨の歩道をゆっくり歩き、足元の水たまりを避ける
[カメラ] 腰高のトラッキング、35mm相当、被写体の左斜め後方から
[光] 夜、街灯の暖色と看板の寒色が混在、濡れた路面に反射
[スタイル] 写実寄りのシネマティック、浅い被写界深度、軽いフィルムグレイン
[時間] 4秒、等速、テンポはゆっくり
この型を土台にして、足す・引くを繰り返すのが実践的な進め方です。最初から完璧を狙わず、6要素が埋まった状態を「基準プロンプト」として保存しておくと、修正の効果を比較しやすくなります。
モデルごとの特性を理解して指示を調整する
同じプロンプトでもモデルによって反応は違います。理由は、学習データ、テキストの解釈方法、時間方向の扱い方、そして入力に画像を受け付けるかどうかが異なるからです。モデルを乗り換えるときは、プロンプトをそのまま持ち込まず、次の観点で翻訳し直します。
短い指示を好むモデル
キーワードを並べるスタイルが合います。長い説明文は後半が無視されやすいため、1カット1動作、修飾語は3つまでといった制限を意識します。カメラ用語も短く(slow dolly in, handheld)切ります。
長い映画的な記述を好むモデル
状況説明、感情の流れ、光の変化を文章で書くと伸びます。ただし矛盾した記述には敏感で、「昼なのに月が明るい」のような記述は破綻を招きます。文章で書く場合も、要素同士が衝突していないか確認しましょう。
参照画像を入力できるモデル
一貫性はテキストより画像の方が強い制約になります。キャラクターも構図も画像で固定し、プロンプトは動きとカメラに集中させるのが効率的です。参照画像は正面だけでなく、斜め・横・背面も用意すると安定します。
物理挙動や長尺に強いモデル
複雑な動きを任せられますが、抽象的な指示は嫌います。素材、重さ、速度、接触、摩擦を書くようにします。「布が風に膨らむ」「靴底が水を跳ねる」といった具体語が効きます。
乗り換えの判断基準
モデルの切り替えは最後の手段です。まずプロンプトの変数を疑ってください。同じプロンプトで3回試して崩れ方が毎回同じなら、それはプロンプトの問題です。崩れ方が毎回違うなら、モデルの限界か、ランダム性の高さが原因です。
ネガティブプロンプトと制御マーカーの実践活用
ネガティブプロンプトは「出てほしくないもの」を列挙する機能ですが、万能の消しゴムではありません。効くのは、繰り返し発生する具体的な崩れです。逆に「低品質」「不自然」のような抽象語はほとんど効きません。モデルは「低品質ではない映像」の具体像を持っていないからです。
効きやすいネガティブ指定の例
- 手指の本数の異常、余分な腕、融合した人物
- 画面内の文字・ロゴ・字幕の混入
- フレーム間のちらつき、輪郭の溶け
- 顔の変形、目の非対称
- 背景の建物や小物が勝手に増減する
- 予期しない急激なズームや回転
制御マーカーの種類
- カメラ指示語(dolly in、pan left、static shot、handheld)
- 時間マーカー(最初の1秒で振り向く、最後の0.5秒で静止する)
- 順序マーカー(まず〜、次に〜、最後に〜)
- 強調構文(キーワードの重みを調整できるモデル)
- シード値の固定と参照フレームの使い回し
やりすぎのサイン
ネガティブを増やしすぎると、肯定部分の情報が薄まり、全体的に無難で平坦な映像になります。10項目を超えたら、優先度の高い3〜5項目に絞り直してください。また、ネガティブで消そうとしているものが構図上必ず入る場合(手を振るシーンで手を消すなど)は、指定ではなく構図の変更で解決します。
キャラクターとスタイルの一貫性を保つワークフロー
一貫性は才能ではなく、手順で作るものです。カットごとに雰囲気で書き直すと、必ず別人格・別作品になります。
キャラクター設計を先に固める
キャラクターカードを作ります。名前、年齢、体型、髪、肌、服装、小物、話し方。これをテキストブロックとして保存し、全カットで同じ文言をコピーします。言い換えは厳禁です。「紺のコート」と「濃い青のジャケット」は、モデルによっては別のものとして扱われます。
参照画像とシードを使う
画像入力が使えるモデルでは、正面・斜め・横の基準画像を用意します。シードを固定できるなら固定し、できない場合でも記述ブロックの語順まで揃えます。語順が変わると解釈が変わるモデルがあるためです。
ライティングと背景を固定する
光源の方向と色温度、背景の主要素(窓の位置、机の上の物、壁の色)をカットをまたいで固定します。場所が変わるシーンでは、「変わってよい要素」と「変わらない要素」をあらかじめ決めておきます。服装と髪型は固定、背景だけ変える、といった具合です。
スタイルブロックを分離する
映像全体のスタイル(色、粒子、レンズ、グレーディング)は独立したブロックとして管理し、全カットに貼ります。1作品につき1つのスタイルブロックが原則です。カットごとにスタイルを変えると、編集でつないだときに別々の映像に見えます。
破綻したときの戻し方
- シードを固定して、変える要素を1つに絞る
- 参照画像を差し替える
- 記述ブロックを短くする(長すぎる記述は後半が無視される)
- カットを分割して短い尺で作り直す
- それでも直らなければ、そのカットの演出自体を変更する
カメラワーク・モーション・タイミングの精密制御
動画の説得力は「動きの設計」で決まります。原則はシンプルです。1カットにつき主動きは1つ。カメラの動きと被写体の動きは、どちらかを主、もう片方を従として書き分けます。
動きの語彙を増やす
- 移動: 歩く、走る、滑る、跳ぶ、忍び寄る
- 手: 差し出す、握る、払う、置く、めくる
- 視線: 見上げる、目をそらす、見つめる、伏せる
- 全身: 振り向く、しゃがむ、立ち上がる、寄りかかる
動詞を選ぶときは、速度と重さも一緒に書きます(ゆっくり、勢いよく、重々しく)。「歩く」だけでは、早足なのか散歩なのかが決まりません。
カメラの動きは段階で書く
- 完全固定
- ゆっくりしたドリーイン
- 被写体を追うトラッキング
- 横パン、縦チルト
- 手持ち・肩担ぎの揺れ
- クレーン上昇、ドローン風の下降
1カットに2つ以上入れると、モデルはどちらかを捨てたり、不自然に混ぜたりします。複数の動きが必要な場合は、カットを分けるのが安全です。
時間の制御
スローモーションは倍率で書きます。逆再生、停止、加速も同様です。冒頭で静止し後半で動き出す緩急は、時間マーカーで指定すると再現性が上がります。
尺の見積もり
動きの複雑さに対して尺が短いと、動作が圧縮されて不自然になります。逆に長すぎると、モデルは途中で動きを止めて静止画的な状態に落ち着きます。歩行なら3〜5秒、振り向きなら1〜2秒、表情の変化なら2〜3秒が目安です。迷ったら短く作り、編集で伸ばす方が破綻が少なくなります。
シーン構成と物語設計:複数カットをつなぐ
単発の美しいカットは作れても、並べると意味が通らない。これは非常によくある壁です。原因の多くは、カット単位でプロンプトを書いているのに、シーン単位の設計がないことです。
ショットリストを先に作る
カット番号、役割(導入・展開・転換・結末)、尺、被写体、カメラ、セリフやナレーションを表にします。プロンプトを書き始める前にこの表を埋めると、手戻りが激減します。生成は1カットずつしか進みませんが、判断はシーン全体で行う必要があるからです。
画面の方向を維持する
人物が右へ歩き出すカットの次は、右への動きを続けます。左右が入れ替わると視聴者は混乱します。被写体の画面内位置(左三分の一、中央、右)も引き継ぎます。プロンプトに「画面左を向く」「右手を上げる」と書いておくと、つなぎが合わせやすくなります。
視線と構図のつなぎ
前のカットの視線の先を次のカットにする(アイラインマッチ)。手の動きや物の位置を合わせる(マッチカット)。これらは編集のテクニックですが、生成の段階で構図を揃えておけば成立しやすくなります。
テンポの設計
導入は長め、展開でテンポを上げ、結末で一度落とす。尺の配分を秒単位で決めてから生成に入ると、後工程の編集が楽になります。15秒の映像なら、フック2秒、展開8秒、結末5秒のような配分です。
つなぎ目の処理
トランジション(カット、ディゾルブ、ホイップパン)まで生成側で指定するか、編集側で処理するかを決めます。生成側でやると不確定要素が増えるため、編集で処理する方が安定します。
生成→評価→修正の反復ループとよくある失敗
生成は一度で終わりません。ただし、やみくもに回すのではなく、変数を管理しながら回します。
変数は一度にひとつだけ動かす
プロンプトの変更点をメモし、A/Bで比較します。シードを固定すれば、変更の影響を確認できます。「3回試して改善しなければ記述を削る」というルールを決めておくと、沼にはまりません。
評価の観点を固定する
次の5項目で5段階評価します。被写体の同一性、動きの自然さ、カメラの意図、光と色、不要物の混入。感覚ではなく項目で見ると、改善点が言語化できます。
よくある失敗と回避策
- 顔が別人になる → 参照画像を使う、記述ブロックを固定する、カットを短くする
- 指が増える → 手を画面に入れない構図にする、手前に物を置く、ネガティブ指定を追加する
- 動きが途中で止まる → 尺を短くする、動作を単純化する、速度を明示する
- 背景が溶ける → 背景要素を減らす、浅い被写界深度でぼかす
- 色が急に変わる → 色温度とパレットを2色に固定する
- カメラが勝手に動く → 「固定カメラ」を明示し、動きは1つだけにする
ログを残す
プロンプト、シード、モデル、尺、評価を1行で記録します。再現も横展開もできるようになり、チームで共有する場合の引き継ぎも楽になります。
用途別ワークフロー・チェックリスト・FAQ
15秒のSNS広告
3カット構成が基本です。フック2秒、商品またはサービスの見せ場8秒、行動喚起とロゴ5秒。冒頭は動きの強いカットを置き、テロップ用の余白を残した構図にします。人物の顔より手元や動きを見せる方が、小さな画面でも伝わります。
商品紹介(EC向け)
背景を固定し、商品の回転や質感の寄りを組み合わせます。照明は柔らかく、色は実物に近づけます(彩度を上げすぎると返品につながります)。手の登場は最小限にし、石鹸やガラスなど反射する素材は光源の映り込みを指定します。
ショートドラマ
キャラクターカードとショットリストを先に作り、会話は別撮りの音声として設計します。表情カットを多めに用意すると、編集で感情の流れを作りやすくなります。
公開前チェックリスト
- 被写体の識別情報は具体的か
- 1カットの動作は1つか
- カメラ指示は1つか
- 光源の方向と色温度は書いたか
- スタイルブロックは全カットで統一したか
- 尺は動作に対して適切か
- ネガティブ指定は5項目以内か
- シードを記録したか
- 画面の方向は前後でつながっているか
FAQ
Q. プロンプトは長いほど良いのですか。
いいえ。大切なのは情報の密度です。長文でも抽象語ばかりなら精度は上がりません。逆に長すぎると後半が無視されるモデルもあります。まず6要素を埋め、そこから削る方向で調整するのがおすすめです。
Q. 日本語と英語のどちらで書くべきですか。
モデルによって得意な言語が異なります。多くのモデルは英語の学習量が多いため、英語の方が細かいニュアンスが通りやすい傾向があります。ただし日本語で十分な精度が出るモデルもあるので、自分の主要モデルで同じ内容を両言語で試し、比較して決めるのが確実です。日本語で書く場合も、カメラ用語は英語表記の方が通ることがあります。
Q. 生成結果が毎回バラバラで安定しません。
シードの固定、記述ブロックの完全コピー、参照画像の使用、尺の短縮を順に試してください。ランダム性を完全に消すことはできませんが、変数を減らせばばらつきは小さくなります。
Q. 人物の顔だけが崩れます。
顔は情報量が最も多く、最も崩れやすい部分です。アップを避けてミドルショットで撮る、顔を横に向ける、手前の物で一部を隠すといった構図側の工夫が有効です。参照画像があるモデルなら必ず使いましょう。
Q. 音はどうすればよいですか。
音声同時生成に対応するモデルもありますが、セリフの正確さや音楽の構成は編集側で載せる方が制御しやすいのが現状です。まず映像を無音で完成させ、後から音を設計する流れが安全です。
Q. どのくらいの試行回数を見込むべきですか。
慣れないうちは1カットにつき5〜10回程度を見込んでおくと精神的に楽です。2〜3回で理想に近づくのは、記述ブロックとショットリストが整っているときです。
まとめ:プロンプトは設計図である
AI動画生成の品質は、モデルの性能だけで決まるわけではありません。同じモデルでも、プロンプトの構造次第で結果は大きく変わります。被写体、アクション、カメラ、光、スタイル、時間という6要素を埋め、モデルの特性に合わせて粒度を調整し、ネガティブ指定で繰り返しの崩れを抑え、記述ブロックと参照画像で一貫性を確保する。そして変数をひとつずつ動かしながら反復する。この流れを習慣にすれば、偶然の当たりに頼る回数は確実に減っていきます。
今日からできる最初の一歩は、いま使っているプロンプトを6要素に分解して書き直し、1カットだけ生成して見比べることです。派手なテクニックを覚えるより、情報の欠落をなくす作業の方が、映像の完成度に直結します。プロンプトは呪文ではなく設計図です。設計図が整えば、生成は自分の意図に応えてくれるようになります。



