AI動画生成でプロンプトが結果を左右する理由
テキストから動画を生成するモデルは、入力された文章を手がかりに、学習済みの映像分布から「もっともらしいフレーム列」をサンプリングします。つまりプロンプトは、単なる注文メモではなく、モデルが探索する範囲を絞り込む地図です。範囲が広すぎれば、モデルは平均的な映像を返します。平均的な映像は破綻が少ない代わりに、印象に残る要素がありません。逆に条件を細かく与えすぎると、モデルは条件を満たそうとして不自然な妥協を始め、構図が崩れたり動きがぎこちなくなったりします。
重要なのは、プロンプトは「長ければ良い」わけでも「短ければ映える」わけでもないという点です。効くのは、映像として意味を持つ情報を、モデルが解釈しやすい順序と粒度で並べることです。本記事では、被写体・動作・環境・様式という基本構造から、ネガティブ指定、カメラワーク、シーン間の一貫性、抽象概念の言語化、モデル選定、失敗時の修正手順までを一つのワークフローとして整理します。
なぜ「雰囲気だけ」の指示が失敗するのか
「美しい夕暮れの街」「かっこいい車の走行シーン」といった指示は、人間同士の会話では通じます。しかし生成モデルにとっては、無数の解釈が可能な曖昧な入力です。どの街か、どの時間帯か、どのレンズか、カメラは固定か移動か、被写体は何をしているのか。これらが未指定のままだと、モデルは学習データの中で「よくある形」に寄せてきます。結果として、どこかで見たような映像が出てきます。
プロンプト設計の第一歩は、自分が頭の中に描いている映像を、検証可能な要素に分解することです。検証可能とは、生成結果を見て「合っている/違う」を即断できる粒度という意味です。「雰囲気が違う」は修正できませんが、「カメラが左にパンしている」「色温度が青すぎる」は修正できます。
プロンプトは演出指示書である
映画製作では、脚本、絵コンテ、撮影指示、照明設計が別々の役割を担います。AI動画生成では、それらを一つのテキストに圧縮する必要があります。したがって書き手には、脚本家と撮影監督の両方の視点が求められます。何が起きるか(脚本)と、どう撮るか(撮影)を分けて考えるだけで、プロンプトの精度は大きく変わります。
基本構造:被写体・動作・環境・様式の4層モデル
プロンプトを安定させる最も実用的な方法は、情報を4つの層に分けて並べることです。
- 被写体:誰が、何が主役か。年齢、服装、質感、表情の初期状態。
- 動作:被写体が何をするか。動作の速度、方向、継続時間。
- 環境:どこで起きるか。場所、時間帯、天候、周囲の要素。
- 様式:どう撮るか。画角、レンズ、照明、色調、映像の質感。
この順序には意味があります。モデルは一般に、文頭に近い要素を強く反映しやすい傾向があります。主役と行動を先に置き、撮影技法を後ろに置くことで、構図が破綻しにくくなります。
曖昧な指示を検証可能な指示に変える
悪い例:「夕暮れの公園を歩く女性」
改善例:「40代の女性が、落ち葉の積もった公園の小道をゆっくり歩く。夕暮れの逆光、35mmレンズ相当、腰から上のミディアムショット、カメラは被写体の前方で後退しながら追従、浅い被写界深度、落ち着いた暖色のグレーディング」
改善例では、被写体の属性、動作の速度、環境の具体、撮影技法、色設計がすべて検証可能な形で入っています。生成結果が意図と違ったとき、どの記述を調整すべきかが明確になります。
語順と情報の重み
同じ内容でも語順を変えると結果が変わります。最初の数語は全体のトーンを決める「アンカー」として働きます。人物の顔を安定させたいなら、人物記述を先頭に置きます。風景の広がりを優先したいなら、環境記述を先頭に置きます。逆に、重要な要素を文末に押し込むと、他の要素に埋もれて反映されないことがあります。
また、抽象語より具体語のほうが効きます。「美しい」より「柔らかい拡散光」、「速い」より「秒速で画面を横切る」、「暗い」より「光源は窓からのみ」。形容詞を、観測できる物理条件に置き換えるのがコツです。
長さの目安
一つのショットに対して、英語で40〜80語程度、日本語で60〜150字程度が扱いやすい目安です。これを超えると、モデルが全条件を同時に満たせなくなり、どれかの条件が犠牲になります。長い物語を伝えたい場合は、プロンプトを長くするのではなく、ショットを分割します。
ネガティブ指定の設計
ネガティブ指定は、生成したくない要素を明示する手法です。ただし万能ではありません。ネガティブ指定が効きやすいのは、モデルが「やりがちな失敗」を名指しできる場合です。たとえば人物の一貫性を重視する場面では、次のような指定が有効です。
- 異なる顔立ち、顔の入れ替わり
- 指の本数の誤り、関節の不自然な曲がり
- 過剰な彩度、白飛び、ざらついたノイズ
- 不要なロゴ、文字、透かし
- カメラの不要な揺れ、ランダムなズーム
一方で、ネガティブ指定を増やしすぎると、モデルが「除外すべき対象」に注意を割き、本来の被写体描写が弱くなることがあります。目安として、ネガティブ指定は3〜7項目に留め、実際に発生した失敗だけを追加していく運用が安全です。
モデルによって効き方が違う
ネガティブ指定の解釈はモデルごとに異なります。写実系のモデルは物理的な破綻の除外に強く、アニメ調のモデルは線の乱れや潰れの除外に向いています。また、ネガティブ欄を持たないインターフェースでは、肯定文の中に「〜のない」と書く必要があります。この場合、「文字のない看板」のように、対象と不在をセットで書くと伝わりやすくなります。
除外より置換を優先する
発想を変えると、ネガティブ指定の多くは置換で解決できます。「暗くない」と書く代わりに「柔らかい昼光」、「静止していない」と書く代わりに「一定速度で右へ移動」と指定します。モデルは肯定形の指示のほうを安定して処理できるため、まず肯定形で書き直し、それでも残る失敗だけをネガティブに回すのが効率的です。
カメラワークと映像文法を指示する
映像らしさを決めるのは、被写体よりもカメラの扱いであることが少なくありません。AI動画生成では、カメラの動きを指定しないと、モデルが勝手に揺れやズームを加えることがあります。逆に、動きを明示すれば、意図した緊張感や没入感を作れます。
ショットサイズとアングル
- エクストリームワイド:場所と規模を見せる。人物は小さい。
- ワイド:人物と環境の関係を示す。
- ミディアム:会話や動作の標準。腰から上。
- クローズアップ:感情と細部。顔、手、小物。
- エクストリームクローズアップ:目、口、質感。
アングルは、ローアングル(力強さ、威圧)、ハイアングル(脆さ、俯瞰)、アイレベル(中立、共感)を使い分けます。日本語で指示する場合も、「ローアングル」「アイレベル」といったカタカナ語のほうが解釈が安定することがあります。
カメラの動き
- 固定(static):落ち着き、観察、緊張の持続。
- パン/ティルト:視線の誘導、情報の提示。
- ドリーイン/アウト:感情の接近と離脱。
- トラッキング:被写体への同行。
- クレーン/ドローン:スケール感の提示。
- ハンドヘルド:臨場感、ドキュメンタリー調。
動きは一つに絞るのが原則です。「ゆっくり前進しながら同時に回転し、被写体は後退」といった複合指示は、破綻の主要因になります。ショットごとに主となる動きを一つ決め、補助的な動きは小さく留めます。
レンズと照明
レンズの焦点距離は画面の性格を決めます。24mm前後は広がりと歪み、35〜50mmは自然な見え方、85mm以上は圧縮効果と背景の分離に効きます。照明は、光源の種類(昼光、タングステン、ネオン、実用灯)、方向(逆光、サイド光、正面光)、質(硬い、柔らかい)を指定します。これらは抽象的な「雰囲気」よりもはるかに安定して反映されます。
フレームレートと質感
24fpsは映画的、30fpsは配信向け、60fpsは滑らかでスポーツや手ぶれの少ない動作に向きます。フィルムグレイン、軽いハレーション、わずかな色収差といった質感の指定は、映像に奥行きを与えます。ただし質感の指定を重ねすぎると、ディテールが潰れるため、二つ程度に留めます。
シーン間の一貫性を保つワークフロー
複数ショットをつなぐと、もっとも頻発する問題が「同じ人物に見えない」「同じ場所に見えない」という一貫性の崩れです。これはプロンプトの工夫だけでなく、制作工程の設計で解決します。
キャラクター定義ブロックを固定する
人物の記述は、全ショットで同じ文字列を使います。これをキャラクター定義ブロックと呼びます。たとえば次の形です。
「30代前半の男性、短く刈った黒髪、薄い無精ひげ、濃紺のコットンシャツ、左手首に革の時計」
この塊は一言も変えません。変えるのは動作と環境の部分だけです。生成モデルは同一の記述に対して類似した結果を返しやすくなるため、結果の分散が抑えられます。
参照画像とキーフレーム
テキストだけで一貫性を保つのが難しい場合、参照画像を併用します。画像を入力として受け取るモデルでは、人物の顔、衣装、部屋のレイアウトを1枚のキーフレームとして固定し、各ショットでその画像を参照させます。特に、顔の角度が大きく変わるショット、別の場所に移動するショットでは効果が大きいです。
| 管理項目 | 固定するもの | 変更するもの |
|---|---|---|
| 人物 | 顔立ち、髪型、服装、小物 | 表情、姿勢、手の位置 |
| 場所 | 建築様式、家具、色温度 | 時間帯、天候、混雑度 |
| 撮影 | レンズの性格、グレーディング | ショットサイズ、カメラの動き |
| 光 | 光源の種類と方向 | 強度、色のわずかな差 |
ショットリストとプロンプトの対応表
制作を安定させるには、ショットリストとプロンプトを1対1で対応させた表を作ります。列は「ショット番号/役割/被写体/動作/環境/カメラ/照明/尺」とします。この表があると、撮影順ではなく編集順で生成でき、素材の抜け漏れを防げます。また、リテイクの際にどの条件を変えたのかを記録でき、同じ失敗を繰り返しません。
シード値と再現性
多くのモデルはシード値を指定できます。シードを固定すると、同じプロンプトから同じ結果が得られやすくなります。検証の基本手順は、シードを固定してプロンプトだけを変えることです。これにより、変化の原因がプロンプトにあるのか、サンプリングの偶然にあるのかを切り分けられます。
感情・雰囲気・抽象概念の言語化
「切ない」「高揚感」「不穏」といった抽象語は、そのままでは反映されません。これらは、物理条件、行動、構図の組み合わせに翻訳する必要があります。
感情を物理条件に変換する
- 切なさ:夕方の低い色温度、広めの画角、被写体を画面の端に置く、視線を下げる、ゆっくりした動作。
- 高揚感:明るいハイキー、短いショットの連続、被写体の上向きの動き、広角の近接。
- 不穏:緑がかった色調、強いコントラスト、わずかな傾き、硬い光源、背後に空間を残す構図。
- 静けさ:固定カメラ、均一な拡散光、遠景の小さな被写体、動作の停止。
感情を数値で表す方法も有効です。色温度はケルビン、明るさは露出、動きは秒単位の速度。数値はモデルにとって解釈の余地が少なく、狙いがぶれにくくなります。
比喩は補助として使う
「映画のような」「絵画のような」といった比喩は便利ですが、曖昧さも伴います。比喩を使う場合は、必ず具体的な条件を併記します。「絵画のような柔らかい光」だけでは弱く、「絵画のような柔らかい光、窓からの拡散した昼光、低いコントラスト」と重ねると安定します。
演技の指示
人物の演技は、感情語ではなく動作として書きます。「悲しそうに」ではなく「視線を床に落とし、口を結び、肩をわずかに下げる」。動作の前後関係を書くと、さらに自然になります。「一度こちらを見てから、視線を逸らす」といった二段階の指示は、単純な感情語よりも強い表現になります。
言語の限界を認める
どんなに詳細な文章でも、伝達できる情報量には上限があります。特に、複雑な手の動き、細かい文字、多数の人物の相互作用は、テキスト指示だけでは限界があります。この場合は、参照画像、部分的な修正、ポストプロダクションでの合成を組み合わせます。プロンプトだけで全てを解決しようとすると、指示が過密になり品質が落ちます。
モデル選定と反復検証の進め方
生成モデルには明確な得意・不得意があります。同じプロンプトでも、モデルを変えると結果は別物になります。したがって最初に決めるべきは「どのモデルで作るか」ではなく「どのショットをどのモデルに任せるか」です。
モデルの性格を見極める
- 写実性重視:実写のような質感、肌、光の再現に強い。人物や商品に向く。
- 動きの自然さ重視:歩行、走行、流体などの連続動作に強い。
- スタイル表現重視:イラスト、アニメ、絵画調の質感に強い。
- 指示遵守重視:複雑な条件を落とさず反映する。構成が複雑なショットに向く。
- 短尺特化:数秒のループやSNS向けの短い素材に強い。
一つの動画を単一モデルで作る必要はありません。人物のクローズアップは写実系、風景の移動は動きに強いモデル、といった分担が現実的です。ただし、分担すると色調や質感が揃わなくなるため、最後にグレーディングで統一します。
テストバッテリーを作る
検証を効率化するには、固定のテストセットを用意します。たとえば次の5種類です。
- 人物のクローズアップ(顔の安定性を見る)
- 人物の全身歩行(手足と動きを見る)
- 風景のパン(広い画面の破綻を見る)
- 小物と手の動作(細部の再現を見る)
- 色と光の変化(グレーディングの追従を見る)
同じテストセットを各モデルで回し、比較表を作ります。評価軸は、指示遵守、安定性、質感、動きの自然さ、生成時間の5つ程度に絞ります。感覚的な評価は記録に残らず、再現できません。
反復の順序を固定する
修正は次の順序で行うと、無駄な試行が減ります。
- 構図(ショットサイズ、アングル、被写体の位置)
- 動作(何をするか、速度、方向)
- 光と色(光源、色温度、コントラスト)
- 質感(レンズ、粒子、グレーディング)
- 細部(小物、背景の要素、テキスト)
構図が決まる前に質感を詰めても、土台が変わればやり直しになります。上位の層から順に確定させます。
生成時間と反復回数のバランス
高精細な設定は生成時間を伸ばし、試行回数を減らします。限られた時間で品質を上げるには、低い設定で構図と動作を固め、確定したショットだけを高設定で再生成する二段構えが有効です。ラフは速く、本番は丁寧に。この分離が、結果的に最短で目的に到達します。
よくある失敗と修正手順
顔が別人になる
原因は、人物記述の揺れ、参照画像の不足、カメラ距離の変化です。対策は、キャラクター定義ブロックの固定、参照画像の併用、クローズアップでは顔を正面か斜め45度に限定することです。極端な横顔や後ろ姿は、顔情報が不足するため一貫性が崩れます。
手足が崩れる
手や指は現在の生成でも難しい領域です。対策は、手を画面外に出す、手を隠す、手の動作を単純化する、手を小道具で置き換える。手を主役にしない限り、無理に正面から写さないのが賢明です。
カメラが勝手に動く、揺れる
対策は、動きの指定を一つに絞り、固定したい場合は「固定カメラ」と明示します。ハンドヘルドを指定していないのに揺れる場合は、動作記述が多すぎてモデルが不安定になっている可能性があります。記述を削って再試行します。
色が意図せず転ぶ
ショットごとに色温度が変わると、つなぎで違和感が出ます。対策は、光の条件を全ショットで共通化し、編集時に統一のグレーディングをかけることです。生成段階で完璧な色を狙うより、後工程で揃えるほうが効率的です。
動きが速すぎる、遅すぎる
速度は、距離と時間で書くと伝わりやすくなります。「ゆっくり歩く」より「3秒で画面を横切る速度で歩く」。尺を指定できる場合は、ショットの長さと動作量を一致させます。
文字やロゴが崩れる
映像生成モデルは文字の描画が苦手です。看板や商品ラベルの文字が必要な場合は、生成後の編集で合成するのが現実的です。生成段階では「文字のない面」として扱い、後から配置します。
指示が無視される
条件が多すぎるか、互いに矛盾している可能性があります。対策は、必須条件を3つに絞り、残りを削って再試行します。プロンプトの削除は後退ではなく、原因の切り分けです。
実践テンプレートとショット設計の例
以下は、そのまま調整して使えるテンプレートの骨格です。日本語で考え、英語で入力すると解釈が安定するモデルも多いため、両方を併記します。
商品紹介ショット
「白い陶器のカップを、木製のテーブルの上に置く。窓からの柔らかい昼光、サイド光、85mm相当、浅い被写界深度、固定カメラ、手は画面の下端からのみ入る、背景はぼかした植物」
ポイントは、手を主役にしないこと、光源を一つに絞ること、背景を意図的に単純化することです。
人物の感情ショット
「30代前半の男性、短く刈った黒髪、濃紺のシャツ。窓辺に立ち、外を見てから視線を床に落とす。夕方の低い色温度、逆光、50mm相当、ミディアムクローズアップ、固定カメラ、穏やかな表情から沈んだ表情への変化」
感情語ではなく、視線と表情の変化として書くのが要点です。
風景の導入ショット
「霧のかかった谷、朝。稜線に沿ってゆっくり左へパンする。広角24mm相当、低いコントラスト、青みがかった灰色、遠景に小さな灯り、動く要素は霧のみ」
導入ショットでは、動きを一つに絞り、情報を増やしすぎないことが安定につながります。
SNS縦動画のショット
「縦長構図、被写体は画面中央やや上。短い動作を3秒で完結。明るいハイキー、軽い粒子、テンポの速いカット割りを前提とした単純な背景」
縦動画では、横長の情報を詰め込むと被写体が小さくなります。要素を減らし、動きを短くまとめます。
教育・解説動画のショット
「白い背景、机の上にノートとペン。手がノートに線を引く。均一な拡散光、上から見た俯瞰、固定カメラ、動きは手のみ、色は中立」
解説動画では、視聴者の注意を情報に向けるため、演出を抑えた中立な映像が適します。
FAQ
プロンプトは日本語と英語のどちらで書くべきですか
扱うモデルによります。英語の学習データが多いモデルでは英語のほうが解釈が安定する傾向があります。一方、日本語でも十分に機能するモデルは増えています。判断基準は、同じ内容を両言語で書いて同じテストセットを回し、指示遵守と安定性を比較することです。迷ったら、日本語で内容を設計し、英語に翻訳して入力する運用が扱いやすいです。
プロンプトはどのくらいの長さが適切ですか
一つのショットに対して、英語で40〜80語、日本語で60〜150字が目安です。これを超える場合は、条件を削るかショットを分割します。長い説明を一つのプロンプトに詰め込むより、ショットを増やして編集でつなぐほうが、結果的に意図に近づきます。
毎回結果が変わってしまうのを防ぐ方法はありますか
シード値の固定、キャラクター定義ブロックの固定、参照画像の併用、そして一度に変更する変数を一つに限定することが基本です。変更点が複数あると、どの条件が結果に効いたのか分からなくなります。検証は常に一変数ずつ行います。
ネガティブ指定は多いほうが良いですか
多くすれば良くなるわけではありません。3〜7項目を目安に、実際に発生した失敗だけを追加します。ネガティブ指定が増えるとモデルの注意が分散し、本来の描写が弱くなることがあります。まず肯定形で書き直し、それでも残る問題だけを除外指定に回すのが基本です。
同じ人物を複数ショットで使うには
人物記述を一言も変えずに固定し、参照画像を用意し、顔の角度を極端に変えないようにします。さらに、ショットごとに照明条件を共通化し、編集時にグレーディングで統一します。三つの対策を同時に行うことで、実用上問題のない一貫性が得られます。
生成した動画が数秒しかない場合の対処は
数秒のショットをつなぐ前提で設計します。長回しを狙うのではなく、役割の異なる短いショットを並べ、つなぎでテンポを作ります。動作は「開始と終了が明確な一つの動き」に絞ると、つなぎ目が自然になります。必要に応じて、生成後にフレーム補間や速度調整で尺を整えます。
どのモデルを選べばよいか分かりません
用途から逆算します。人物の質感を重視するなら写実系、動作の自然さを重視するなら連続動作に強いモデル、スタイル表現を重視するならイラスト調に強いモデルです。複数モデルの比較は、固定したテストセットを回して評価表に記録するのが最も確実です。
プロンプトを書くのが苦手でも上達しますか
上達します。コツは、書き続けることではなく、記録することです。生成したプロンプト、変更点、結果の評価を一覧にしておくと、どの表現が効いたのかが蓄積されます。数十ショット分の記録があれば、自分の用途に合った語彙が自然に固まります。
まとめ:今日から実践できる7つの習慣
- プロンプトを被写体・動作・環境・様式の4層で書く。
- 形容詞を観測可能な物理条件に置き換える。
- ネガティブ指定は最小限にし、まず肯定形で書き直す。
- カメラの動きはショットごとに一つへ絞る。
- 人物記述のブロックを固定し、参照画像を併用する。
- 検証は一変数ずつ、テストセットを固定して行う。
- ラフは速く、本番は丁寧に。確定したショットだけを高設定で再生成する。
AI動画生成の品質は、モデルの性能だけで決まるわけではありません。同じモデルでも、入力の設計次第で結果は大きく変わります。逆に言えば、プロンプト設計は誰でも鍛えられる技術です。まずは一つのショットを、今日の習慣に沿って書き直してみてください。その差分が、次に作る動画の基準になります。


