AI動画の品質を決めるのはモデルより指示設計
AI動画生成は、テキストから短いクリップを作るだけでなく、物語を持つシーケンスを作る工程へと進化しました。しかし、同じ生成モデルを使っても、結果の完成度には大きな差が出ます。その差を生む最大の要因がプロンプト設計です。プロンプトは単なる注文書ではなく、カメラマン、照明技師、美術監督、編集者への指示を一つにまとめた演出設計図です。どの被写体を、どの構図で、どの時間だけ見せ、どのように動かし、どんな空気感で終えるのか。これらを言葉で設計する力が、AI動画の品質を左右します。
静止画生成との決定的な違い
静止画では、一枚の構図と質感が最終成果です。一方、動画では時間軸が加わります。被写体が動き、カメラが動き、光が変わり、前後のカットとつながります。そのため、プロンプトには「何を描くか」だけでなく、「どのように動くか」「どの順番で変化するか」「どこで切り替わるか」を含める必要があります。静止画で成功したプロンプトをそのまま動画に使うと、動きの指定が不足し、被写体が不自然に静止したり、カメラが意図しない方向へ流れたりします。
時間軸・カメラ・被写体の三要素
AI動画のプロンプトを分解すると、時間軸、カメラ、被写体の三つが核になります。時間軸は動作の開始と終了、速度、変化のタイミングを決めます。カメラはショットサイズ、アングル、移動、レンズ感を指定します。被写体は人物、動物、物体、環境、小物、衣装、表情を指定します。この三つを混ぜずに書くことが、安定した生成の第一歩です。たとえば「女性が振り返る」とだけ書くより、「中景、腰から上、カメラは固定、女性は画面右を向いて立ち、三秒かけて左肩越しに振り返り、最後に微笑む」と書く方が、狙いに近づきます。
プロンプトを組み立てる基本フレームワーク
プロンプト設計で最初に決めるべきは、映像の目的です。広告なのか、物語の一部なのか、解説動画のカットなのか、SNS向けの短いループなのか。目的が違えば、必要な情報も変わります。広告では商品の見え方とブランドの空気感が重要になり、物語では感情の変化とカットのつながりが重要になります。目的を一文で言語化してから、以下の順番で要素を並べると整理しやすくなります。
役割・被写体・動作・環境・カメラ・光・スタイル・除外
基本フレームワークは、役割、被写体、動作、環境、カメラ、光、スタイル、除外の八項目です。役割は「cinematic shot」や「documentary style」のように映像の位置づけを伝えます。被写体は誰が何であるかを具体的にします。動作は時間の流れを含めて書きます。環境は場所、天候、時間帯、背景の要素を指定します。カメラはショットサイズ、アングル、動き、レンズを指定します。光は光源、方向、硬さ、色温度を指定します。スタイルは質感、色調、フィルム感、ジャンルを指定します。除外は不要な要素を明記します。全部を毎回書く必要はありませんが、迷ったらこの順番に戻ると整理できます。
実際のプロンプト例
たとえば、雨の商店街を歩く人物を描く場合を考えます。弱いプロンプトは「雨の商店街を歩く人」です。これではカメラも時間も感情も不明です。改善例は「cinematic medium shot, a person in a beige coat walking slowly through a narrow shopping street at night, rain falling, neon signs reflecting on wet pavement, camera tracks backward at walking speed, shallow depth of field, cool blue and warm orange color contrast, soft rim light, realistic film grain, no text, no extra people, no distorted hands」のようになります。日本語で生成する場合は、「映画的な中景、ベージュのコートを着た人物が夜の商店街をゆっくり歩く、雨、濡れた路面に映るネオン、カメラは歩行速度で後退、浅い被写界深度、青と橙の補色、柔らかな輪郭光、写実的なフィルム粒子、文字なし、余計な人物なし、手の崩れなし」と書きます。重要なのは、情報を増やすことではなく、曖昧さを減らすことです。
カメラワークとショット設計を言葉にする
AI動画では、カメラの指定が映像の意味を大きく変えます。同じ人物の動作でも、引きのショットか寄りのショットかで感情の伝わり方が変わります。また、カメラが固定か移動かで、観客の視線誘導も変わります。プロンプトにカメラ情報を入れるときは、専門用語だけでなく、観客がどう感じるかを補足すると安定します。
ショットサイズの指定
ショットサイズは、被写体を画面にどれくらいの大きさで見せるかを決めます。全景は場所と人物の関係を示し、中景は動作と会話に適し、寄りは感情を強調します。たとえば「extreme wide shot of a lighthouse on a cliff」と書けば、灯台と崖、海の広がりが主題になります。「close-up of a hand gripping a rusted railing」と書けば、緊張や不安が主題になります。AIに任せる場合でも、ショットサイズを一つ指定するだけで構図の暴走が減ります。
アングルと移動
アングルには、水平、見上げる、見下ろす、斜めなどがあります。見上げるアングルは被写体を強く大きく見せ、見下ろすアングルは弱さや孤立感を生みます。移動には、パン、ティルト、ドリー、トラック、クレーン、ハンドヘルドなどがあります。プロンプトでは「slow dolly in」「gentle pan left」「handheld follow shot」のように速度も添えます。速すぎる移動は被写体の崩れを招きやすいため、まずは遅い移動から試すのが安全です。
レンズと被写界深度
レンズ感は映像の空気を決めます。広角は空間の広がりと遠近感を強調し、望遠は背景を圧縮して被写体を際立たせます。浅い被写界深度は背景をぼかして視線を集中させ、深い被写界深度は情報量を増やします。プロンプトに「35mm lens look」「85mm portrait lens look」「shallow depth of field」などを加えると、スマートフォン動画のような平板さを避けやすくなります。
時間軸の一貫性を保つ方法
動画生成で最も難しいのは、時間軸にわたって被写体と空間を保つことです。フレームごとに被写体が再生成されるため、顔の形、髪型、衣装の模様、小物の位置が少しずつ変わることがあります。これを放置すると、視聴者は違和感を覚えます。対策は、変化してほしくない要素を明確に固定し、変化してほしい要素だけを動かすことです。
キーフレーム参照を使う
参照画像やキーフレームを使えるモデルでは、最初と最後のフレームを指定すると一貫性が上がります。開始フレームで人物の立ち位置と表情を決め、終了フレームで動作の到達点を示します。中間の動きはモデルに補完させます。この方法は、ドアを開ける、振り返る、手を伸ばすなど、動作の始点と終点が明確な場面で特に有効です。
キャラクター記述を固定する
参照画像を使わない場合でも、キャラクター記述を毎回同じ文言で固定します。髪の長さ、色、瞳の色、服装、年齢感、体型、特徴的な小物を、同じ順番で書きます。形容詞を毎回変えると、モデルは別の人物として解釈しやすくなります。たとえば「short black hair, round glasses, olive green jacket」を一貫して使い、シーンごとに変えるのは背景と動作だけにします。
シーン間の変化を管理する
シーンが変わるときは、変化させる要素と維持する要素を分けます。場所は変えても、人物の服装と特徴は維持します。時間帯を変える場合は、光の方向と色温度も一緒に変えます。衣装を変える場合は、なぜ変わるのかを映像内で説明できるようにします。一貫性とは、すべてを同じにすることではなく、変化に理由があることです。
キャラクター一貫性のための参照戦略
複数ショットで同じ人物を登場させる場合、参照戦略が重要になります。参照画像は多いほど良いわけではなく、目的に合った参照を選ぶことが大切です。顔、全身、衣装、小物、背景を分けて用意し、どのショットで何を参照するかを決めます。
複数参照の使い分け
顔の参照は表情と同一性を保つために使います。全身の参照はシルエット、体型、服装のバランスを保つために使います。小物の参照は物語の手がかりを維持するために使います。背景の参照は世界観の連続性を保つために使います。すべてを一度に強く適用すると、動きが硬くなったり、構図が参照画像に引っ張られたりすることがあります。まずは顔と服装の二つに絞り、必要に応じて増やします。
衣装・小物・表情の固定
衣装は色だけでなく、素材、柄、ボタン、ポケット、汚れの位置まで指定すると安定します。小物は「右手に持つ」など、左右と持ち方まで書きます。表情は「neutral expression」から始め、「slight smile」「worried look」のように段階的に変えます。最初から複雑な感情を指定すると、顔の崩れが増えやすくなります。
一貫性が崩れたときの修正
一貫性が崩れたら、プロンプトを長くする前に、参照を減らす、動作を遅くする、ショットを短くする、カメラ移動を固定する、解像度やアスペクト比を揃える、といった基本に戻ります。特に顔の崩れは、速い動きと斜めのアングルで起こりやすいため、まずは正面に近い構図でテストします。問題がなければ、徐々に複雑さを足します。
モデルごとの特性を理解してプロンプトを調整する
動画生成モデルは、それぞれ得意分野が異なります。運動の物理に強いモデル、質感やテクスチャに強いモデル、物語の流れを理解しやすいモデル、アニメやイラスト表現に強いモデルなどです。同じプロンプトでも、モデルによって解釈が変わります。したがって、プロンプトはモデルに合わせて翻訳する意識が必要です。
運動重視モデル
運動重視のモデルは、走る、跳ぶ、水しぶきが上がる、物が落ちるといった物理的な動きを得意とします。一方で、顔の細部や衣装の模様が変化しやすいことがあります。プロンプトでは動作を明確にし、カメラは固定かゆっくりした移動にし、顔のクローズアップは短くします。
質感重視モデル
質感重視のモデルは、肌、布、金属、木、雨、煙などのディテールに強い傾向があります。動きは控えめでも、映像の説得力が高いです。この場合は、光と素材の記述を増やし、動きは小さくします。静的なショットや商品カット、風景カットに向いています。
物語理解モデル
物語理解に長けたモデルは、複数の被写体の関係や前後の文脈をくみ取りやすいです。ただし、解釈の幅が広い分、意図しない要素を追加することがあります。プロンプトでは、誰が、どこにいて、何をしていて、何をしてはいけないかを明確にします。除外指示も有効です。
モデル切り替えの判断基準
モデルを切り替える基準は、目的、被写体、動きの複雑さ、必要な一貫性、仕上げのスタイルです。人物の感情を重視するなら質感と顔の安定性、アクションを重視するなら運動性能、世界観の広がりを重視するなら風景とライティング、短いループなら反復性を見ます。一つのモデルで全部を解決しようとせず、ショットごとに最適なモデルを選ぶ方が結果が良くなります。
音声・効果音・リズムをプロンプトに統合する
動画は映像だけで完結しません。音声、効果音、音楽、間の取り方が、映像の意味を大きく変えます。生成モデルが音声に対応している場合は、セリフ、環境音、音楽の雰囲気をプロンプトに含めます。対応していない場合も、編集段階で音を設計する前提で、映像のテンポを指定します。
セリフとナレーション
セリフを入れる場合は、話者の位置、口の動き、感情、速度を指定します。「calm voice, slow pace, slight pause before the last word」のように書くと、映像と音の同期が取りやすくなります。ナレーションの場合は、映像のどのタイミングで説明が入るかを決め、カットの長さを合わせます。
環境音とBGM
環境音は場所の説得力を高めます。雨音、足音、遠くの車、風、鳥の声、観客のざわめきなど、映像内で自然に聞こえる音を指定します。BGMはジャンル、テンポ、楽器、感情を指定します。ただし、映像の動きと音楽のビートがずれると、生成結果が安っぽく見えます。まずは映像のリズムを決め、それに合う音を後から足す方が安全です。
カットのテンポ
テンポはカットの長さで決まります。緊張感を出すなら短いカットを重ね、余韻を出すなら長いカットを使います。プロンプトでは「quick cuts」「slow lingering shot」のように指定できますが、生成モデルは編集機能ではないため、最終的には編集ソフトで調整します。生成段階では、各ショットの始まりと終わりを明確にし、つなぎやすい素材を作ることが重要です。
シーケンス生成とショット接続の実践
一つのショットが良くても、つなげると不自然になることがあります。シーケンス生成では、前のショットの終わりと次のショットの始まりを設計します。視線、動作、光、色、音をつなげると、観客は自然に次のカットへ導かれます。
前後カットのつなぎ方
前のショットで人物が右を向いたら、次のショットでは右側に何があるかを見せます。前のショットでドアが開いたら、次のショットではドアの先の空間を見せます。このように、前のカットが次のカットの疑問を生み、次のカットがそれに答える構造を作ります。AI生成では、同じ人物と空間を保つために、参照と記述を揃えます。
トランジションの指定
トランジションは、カット、フェード、ディゾルブ、ワイプなどがあります。AI動画では、カットつなぎが最も安定します。フェードやディゾルブは編集で足す方が制御しやすいです。どうしても生成内でトランジションを指定する場合は、「match cut on the moving hand」のように、形や動作を一致させる手がかりを書きます。
マルチショットの一貫性
マルチショットでは、カメラの高さ、レンズ感、色温度、光の方向を揃えます。これらがショットごとに変わると、同じ場所に見えません。プロンプトの冒頭に共通のスタイル記述を置き、ショット固有の情報を後ろに足すと、全体のトーンが揃います。
失敗しやすいポイントと改善チェックリスト
AI動画の失敗は、大きく分けると動きの不自然さ、被写体の変化、構図の崩れ、不要物の出現、音と映像の不一致です。失敗したときにやみくもに言葉を足すと、さらに混乱します。まずは原因を切り分け、一つずつ検証します。
動きが不自然
動きが不自然なときは、動作を減らす、速度を落とす、カメラ移動を固定する、ショットを短くする、開始と終了のポーズを指定する、といった対策を取ります。特に手足の動きは崩れやすいため、手を隠す構図や、上半身だけのショットにすると安定します。
顔が変わる
顔が変わる場合は、参照画像を使う、顔の記述を固定する、正面に近いアングルにする、速い動きを避ける、ショットを短くする、解像度を上げる、といった順番で試します。複数の人物が交差する場面は特に崩れやすいため、一人ずつ撮るようにショットを分けます。
構図が崩れる
構図が崩れる場合は、ショットサイズ、アングル、被写体の位置、余白の方向を明記します。「centered composition」「rule of thirds, subject on the left」「negative space on the right」などが有効です。また、背景の要素を減らすと、モデルが主題に集中しやすくなります。
除外指示の使い方
除外指示は、不要な要素を防ぐために使います。文字、ロゴ、透かし、余計な人物、余分な手足、ぼやけた顔、過度な彩度、不自然な影などを指定します。ただし、除外指示を増やしすぎると、モデルが萎縮して動きが止まることがあります。重要な除外は三つから五つ程度に絞ります。
実践ワークフロー:短編映像を一本作る
ここまでの要素を、短編映像を一本作る流れにまとめます。企画、絵コンテ、プロンプト設計、生成、選別、編集、仕上げの順に進めます。最初から完璧を目指さず、テスト生成で方向を確認してから本番に進むのが効率的です。
企画と絵コンテ
まず、誰に何を伝える映像かを決めます。次に、必要なショットを三から五つに絞ります。各ショットについて、場所、人物、動作、感情、カメラ、光をメモします。絵コンテは簡単な線で構いません。文章で書くより、構図と動きの方向を視覚化する方が、プロンプトの矛盾に気づきやすくなります。
プロンプト設計
共通スタイルを冒頭に書き、各ショットの固有情報を続けます。一貫性が必要な人物は、同じ記述と参照画像を使います。動作は開始と終了を明確にし、カメラは一つの動きに絞ります。除外指示は最小限にします。プロンプトは短い版と詳しい版の二つを用意し、短い版で構図を確認してから詳しい版で質感を上げます。
生成と選別
同じプロンプトで複数回生成し、構図、動き、顔、光、不要物を比較します。全部が完璧なテイクは稀なので、最も重要な要素が成功しているテイクを選びます。選別の基準は、主役の魅力、動作の自然さ、カットのつなぎやすさです。細部は編集で補えることがあります。
編集と仕上げ
選んだクリップを並べ、不要な部分を切り、必要なら速度を調整します。色調を揃え、音を足し、テロップが必要な場合は読みやすさを確認します。最後に通して見て、意味が伝わるか、リズムが合っているか、不自然な変化がないかを確認します。
よくある質問
プロンプトは長いほど良いですか
長ければ良いわけではありません。重要なのは、曖昧さを減らし、優先順位を明確にすることです。情報が多すぎると、モデルがどの要素を優先すべきか判断できなくなります。まずは必須要素だけを書き、結果を見ながら足します。
英語と日本語どちらで書くべきですか
モデルによって得意な言語は異なります。英語の方が安定する場合もありますが、日本語で細かなニュアンスを指定できる場合もあります。両方を試し、同じ内容で結果を比較するのが確実です。日本語で書く場合は、カメラ用語を英語のまま混ぜると意図が伝わりやすくなることがあります。
同じプロンプトで毎回同じ結果になりますか
完全に同じ結果になるとは限りません。生成にはランダム性があり、モデルの更新でも結果が変わります。同じ結果を再現したい場合は、乱数シードが使えるなら固定し、参照画像、解像度、アスペクト比、プロンプトを保存します。制作では、同じプロンプトを記録しておくことが資産になります。
参照画像は何枚必要ですか
目的によります。顔の一貫性だけなら一枚でも十分なことがあります。全身の服装と小物まで固定するなら二から四枚が目安です。ただし、参照を増やすと動きが制限されることがあるため、ショットごとに必要な参照だけを使います。
動画の長さはどう指定しますか
生成モデルが対応している長さに合わせ、ショットを短く分けるのが基本です。長い一本を生成するより、短いカットをつなぐ方が制御しやすく、修正も容易です。一つのショットは三から五秒程度から始め、必要に応じて延長します。
商用利用で気をつけることはありますか
利用するモデルや素材の規約を確認し、参照画像の権利、生成物の利用条件、人物の肖像や商標の扱いを確認します。特に実在の人物やブランドに似た表現は、意図せず問題になることがあります。制作前に条件を整理し、必要なら専門家に相談します。
まとめ:プロンプト設計は演出の言語化である
AI動画のプロンプト設計は、魔法の呪文を探す作業ではありません。映像の意図を、モデルが理解できる言葉に分解し、優先順位をつけて伝える作業です。被写体、動作、環境、カメラ、光、スタイル、除外を整理し、時間軸と一貫性を意識することで、生成結果は大きく安定します。最初は短いプロンプトで試し、成功要因を記録し、少しずつ複雑さを足していく。この反復が、思い通りのAI動画に近づく最も確実な方法です。




