AI動画生成におけるプロンプト設計の基本原則
同じモデル、同じテーマ、同じ秒数で作ったとしても、出力される映像の質は入力テキストの書き方で驚くほど変わります。プロンプト設計とは、単に「かっこいい映像」と書くことではなく、カメラ、被写体、光、時間、感情といった映像の構成要素を、モデルが解釈できる言葉に翻訳する作業です。ここでは、映像生成に共通する考え方を整理します。
なぜ同じモデルでも結果が変わるのか
生成モデルは、与えられたテキストを条件として扱い、それに近い映像を確率的に生成します。つまり指示が曖昧であれば、モデルは学習データの中で「平均的」な映像を返します。逆に、被写体の素材、動作の方向、光源の位置、レンズの焦点距離まで指定すると、確率分布の幅が狭まり、狙った映像に収束しやすくなります。
ここで重要なのは、プロンプトは「命令」ではなく「条件設定」だという点です。人間のスタッフに絵コンテを渡すときのように、判断の余地を減らし、意図を具体的に伝えるほど、結果は安定します。
モデルの特性を把握する
モデルごとに得意分野は異なります。フォトリアルな質感とスタイルの安定性を得意とする系統、長回しの物語的なつながりを得意とする系統、アニメ調の作画やリズム重視のカット割りを得意とする系統など、設計思想はさまざまです。まずは「どのモデルが何を得意とするか」を短いテスト生成で把握し、その上でプロンプトの語彙を寄せていくのが近道です。
モデルを乗り換えるたびに同じ長文プロンプトを貼るのではなく、モデルごとに語順や強調すべき要素を変える。この一手間が、最終的な完成度を大きく左右します。
明確性・具体性・制約の三原則
プロンプトの品質を支える柱は三つあります。第一に明確性。主語と動作をはっきりさせ、「誰が何をしているか」を一文で言い切ります。第二に具体性。色、素材、天候、時間帯、時代背景など、映像を規定する情報を足します。第三に制約。カメラの固定、尺、動きの速さ、避けたい要素などを明示し、モデルの解釈の暴走を防ぎます。この三原則を意識するだけで、やり直しの回数は確実に減ります。
構造化プロンプトの組み立て方
思いついた単語を並べるだけでは、出力は安定しません。映像プロンプトは、要素を決まった順番で並べる「型」を持つと再現性が高まります。
六つの構成要素
映像プロンプトを分解すると、次の六つに整理できます。
- 被写体:誰・何か。年齢感、服装、素材感、表情まで書く
- 動作:何をしているか。動きの方向、速度、タイミングを含める
- 場所と状況:空間の広さ、天候、時間帯、周囲の物音や環境
- 光:光源の種類、方向、色温度、コントラスト
- カメラ:アングル、移動、レンズの印象、被写界深度
- スタイル:質感、色調、フィルムかデジタルか、参照したい雰囲気
この六要素を一行ずつ、あるいは一文の中で順番に並べます。要素が欠けると、モデルは足りない情報を「平均値」で埋めてしまい、意図しない画になります。
テンプレートの実例
基本形は「主被写体+動作+場所+時間帯と光+カメラワーク+スタイル」です。たとえば次のように書きます。
「雨上がりの路地を静かに歩く赤いコートの女性。足元の水たまりに映るネオン。夕暮れから夜への移行。背後からゆっくり回り込む手持ちカメラ。浅い被写界深度。フィルムグレインと落ち着いた色調」
この形にすると、どこを変えれば結果が変わるのかが明確になります。動きを変えたいなら動作の行だけ、雰囲気を変えたいならスタイルの行だけを編集すれば済みます。
悪い例と改善例の比較
悪い例は「かっこいい未来都市の映像」。形容詞が抽象的で、被写体も時間帯もカメラも決まっていません。モデルは毎回違う「未来都市」を返し、再現ができません。
改善例は「夜明け前の無人交差点を真上から見下ろす固定カメラ。濡れたアスファルトに反射する青い標識と赤い信号。ゆっくり流れる低い霧。広角レンズ。彩度を抑えた寒色系の色調」。被写体、場所、光、カメラ、スタイルがすべて指定され、出力のぶれが小さくなります。
抽象語は禁止ではありませんが、必ず具体語とセットで使うのが原則です。
カメラワーク・ライティング・構図を言語化する
映像の印象を決めるのは被写体だけではありません。カメラの動き、光の当て方、画面の組み立てが、視聴者の感情を大きく動かします。
カメラ用語の実践的な使い方
映像生成モデルは、撮影用語の理解度が高い傾向があります。積極的に使いたい語彙を挙げます。
- アングル:ローアングル、ハイアングル、アイレベル、俯瞰、あおり
- 移動:パン、ティルト、ドリーイン、ドリーアウト、トラッキング、クレーンアップ、旋回
- 手ぶれ感:手持ち、ジンバル、ステディカム、固定三脚
- レンズ感:広角、望遠、マクロ、魚眼、浅い/深い被写界深度
- 速度:スローモーション、早回し、通常速度、ランプ(速度変化)
たとえば「ゆっくりドリーイン」と「素早いズームイン」では、同じ被写体でも緊張感がまったく変わります。カメラ指示は一つに絞り、複数の動きを同時に指定しないほうが破綻しにくくなります。
照明の指示
光は感情の記号です。方向と質を指定します。
- 方向:順光、逆光、斜光、サイドライト、トップライト、リムライト
- 質:硬い光、柔らかい光、拡散光、スポット、自然光、実用光源
- 色温度:暖色、寒色、夕方の黄金色、夜の青、蛍光灯の緑がかった白
- コントラスト:ハイキー、ローキー、明暗差の強いシルエット
「逆光で輪郭が光る」「窓からの柔らかい自然光で片側だけ照らす」といった書き方が効果的です。照明を指定しないと、画面全体が均一で平板な印象になりがちです。
構図の指示
構図は、被写体を画面のどこに置くかを決めます。三分割法、中央配置、対角線構図、フレーム内フレーム、前景と背景の重なりなど、写真用語がそのまま使えます。余白の量や視線の方向も言語化すると、意図した絵に近づきます。
キャラクターと環境の一貫性を保つ方法
複数カットの動画では、一貫性の維持が最も難しい課題です。顔、服装、髪型、小道具、背景がカットごとに変わってしまうと、視聴者は瞬時に違和感を覚えます。
キャラクター固定の基本手順
まず、主人公の外見を短い固定フレーズとして定義します。「30代前半の男性、短い黒髪、右眉に小さな傷、濃紺のトレンチコート、白いシャツ」のように、識別に必要な要素だけを凝縮します。この固定フレーズは、すべてのカットで一字一句同じ順番で使い回します。言い換えは避けてください。
次に、参照画像や参照動画を併用します。テキストだけで外見を固定するより、画像条件を組み合わせたほうが圧倒的に安定します。参照素材は正面、斜め、横の三方向を用意すると、カメラが回り込むカットでも破綻しにくくなります。
環境と小道具の継続
背景も同じ考え方です。部屋の間取り、窓の位置、家具の配置、時間帯による光の変化を、シーンごとの固定メモとして管理します。小道具は特に注意が必要で、カップの色、本の表紙、看板の文字など、目立つ要素は毎回同じ言葉で指定します。
一貫性が崩れたと感じたら、まず「前のカットのプロンプトから何を削ったか」を確認します。多くの場合、形容詞を一つ減らしただけで別人になってしまいます。
モーションとシーケンスの制御
短いカットを複数つないで物語にする場合、動きの設計が全体の印象を決めます。
動きの量を揃える
カットごとに動きの量がばらつくと、編集でつないだときにリズムが崩れます。速い動きのカット、静かなカット、中程度の動きを交互に配置し、テンポを設計します。プロンプトには「ゆっくり」「一定の速度で」「急に止まらずに」といった速度指示を加えると、安定します。
つなぎ目の設計
前のカットの終わりの状態と、次のカットの始まりの状態を言葉でつなぐのがコツです。「歩き去る背中」で終わったら、次は「同じ方向へ歩き続ける背中」から始める。視線、移動方向、光の向きを引き継ぐと、別々に生成したカットでも連続性が生まれます。
また、カメラの位置関係を固定しておくと、カットバックが自然になります。「被写体の右前方」「背後やや上」など、基準となる視点を決めておきましょう。
感情とトーンの設計
同じ出来事でも、演出的なトーンによって受け取られ方は変わります。プロンプトで感情を指定するときは、感情語を直接書くより、身体の動きや環境で表現したほうが自然に伝わります。
感情を身体表現に置き換える
「悲しんでいる」と書くより、「肩を落とし、歩幅が小さく、足元を見たまま歩く」と書くほうが、モデルは具体的な動きを生成できます。「怒り」なら「顎を引き、拳を握り、早足で歩く」。「安堵」なら「深く息を吐き、肩の力が抜け、わずかに口元が緩む」。感情語と身体表現を併記すると、なお効果的です。
環境でトーンを補強する
色調、天候、音の想像、周囲の人の密度もトーンに影響します。寒色で雨、人はまばら、という設定は孤独感を強めます。暖色で人通りが多い昼下がりは、開放感や日常感を生みます。全体の色設計を先に決めてから、カットごとのプロンプトに反映させると、作品全体に統一感が出ます。
実践ワークフロー:試作から仕上げまで
ここまでの要素を、実際の制作手順に落とし込みます。
手順1:企画と絵コンテの簡略化
最初に、尺、カット数、伝えたい感情を決めます。四コマ程度の簡単な絵コンテを書き、各カットの被写体、動作、カメラを一行ずつメモします。この段階では映像の細部を詰めすぎず、構造だけを固めます。
手順2:低コストのテスト生成
各カットについて、短い尺と低い解像度でテストします。目的は美しさではなく、構図と動きが意図どおりかを確認することです。ここで長尺を回すのは作業の無駄になります。
手順3:変数の切り分け
うまくいかないときは、一度に一つの要素だけを変えます。カメラを変える、光を変える、スタイルを変える。複数を同時に変えると、何が効いたのか分からなくなります。変更前後のプロンプトを必ず保存してください。
手順4:プロンプトライブラリの整備
うまくいったプロンプトは、用途別に分類して保存します。人物の固定フレーズ、照明のパターン、カメラワークの定型、色調のプリセット。次回の制作でそのまま再利用でき、作業時間が大幅に短縮されます。
手順5:本番生成と選別
本番では複数案を生成し、比較して選びます。評価の観点は、構図、動きの自然さ、一貫性、破綻の有無の四つです。破綻が軽微なら編集で隠せますが、構造的な問題は作り直したほうが結果的に速いことが多いです。
手順6:編集と仕上げ
生成したカットを編集でつなぎ、必要に応じて色調整、手ぶれの補正、音の追加を行います。つなぎ目では前後の動きの方向を確認し、必要なら尺を詰めてテンポを整えます。
よくある失敗とトラブルシューティング
被写体が毎回変わる
原因は、外見の記述がカットごとに揺れていることです。固定フレーズを作り、順番も含めて完全に統一してください。参照画像の併用も有効です。
動きが不自然で崩れる
動きの量が多すぎる可能性があります。一つのカットに一つの主要な動きだけを残し、副次的な動きは削ります。また、速い動きより遅い動きのほうが破綻しにくい傾向があります。
画面がごちゃごちゃする
要素を詰め込みすぎています。前景、中景、背景のうち、情報を置くのは二層までに絞ります。人物を一人にし、小道具を減らすだけで大きく改善します。
色が意図と違う
色温度と色調の指示が曖昧です。「寒色系」「彩度低め」「夕方の金色」など、具体的な色の方向性を明示してください。
途中でカメラが勝手に動く
カメラ指示を一つに絞り、他の動きを書かないようにします。「固定カメラ」と明記するのも有効です。
モデル別の最適化アプローチ
同じプロンプトでも、モデルの系統によって反応が異なります。
フォトリアル系
質感と光の再現を重視する系統では、素材、照明、レンズの記述が効きます。逆に抽象的なスタイル語は弱く出ることがあるため、具体語を増やします。
物語・長尺系
前後の文脈を理解しやすい系統では、シーンの状況説明や動作の理由を文章で補足すると効果的です。因果関係を含む長めの記述が有効です。
アニメ・様式化系
作画のテイストやラインの太さ、フレームレート感、カットの切り替えのリズムを指定すると、意図に近づきます。様式語と具体語を組み合わせるのがコツです。
汎用系
汎用モデルは語順の影響を受けやすいため、六要素の順番を固定して使うと安定します。
FAQ
Q1. プロンプトは長ければ長いほど良いのですか
いいえ。長さよりも、必要な要素が漏れなく含まれていることが重要です。同じ意味の形容詞を重ねても効果は薄く、かえって焦点がぼやけます。六要素を満たした上で、各要素を一つか二つの具体語に絞るのが理想です。
Q2. カメラワークの用語は英語と日本語のどちらで書くべきですか
どちらでも機能しますが、モデルによって得意な表現は異なります。まず母語で書き、結果が弱い場合に撮影用語へ置き換えて比較するのが確実です。用語を一つずつ変えて検証すると、そのモデルの癖が見えてきます。
Q3. 生成した映像が意図と違うとき、最初に何を確認すべきですか
主語と動作が明確か、時間帯と光が指定されているか、カメラ指示が一つに絞られているかの三点を確認します。多くの問題はこの三つのどれかに起因します。
Q4. キャラクターの一貫性はテキストだけで保てますか
短いカットが数本なら可能ですが、カット数が増えるほど難しくなります。参照画像の併用、固定フレーズの厳守、外見要素の削減の三つを組み合わせるのが現実的です。
Q5. 学習の優先順位はどう考えるべきですか
まず構図と光の言語化を固め、次に一貫性の管理、最後にモデル別の最適化へ進むのが効率的です。土台となる語彙が身につくと、新しいモデルが出ても応用が利きます。
Q6. 失敗したプロンプトは捨てるべきですか
捨てずに記録してください。何が効かなかったかという情報は、次に同じ失敗を避けるための資産になります。変更点と結果を一行ずつ残す習慣が、上達の速度を最も大きく変えます。



