AI動画生成は、一部の研究者だけの実験ではありません。広告、短編映画、音楽ビデオ、製品デモ、教育コンテンツ、SNS向けクリップまで、あらゆる映像制作の現場で活用されています。しかし、同じモデルを使っても、出力される映像の質には大きな差が出ます。その差を生む最大の要因がプロンプト設計です。プロンプトは単なる呪文ではなく、カメラ、照明、演技、美術、編集を言葉で指定する演出指示書です。本稿では、望むシーンを安定して再現するための考え方と実践手順を、基礎から応用まで段階的に解説します。
AI動画生成でプロンプトが果たす役割
AI動画生成の仕組みを理解すると、プロンプトの重要性が明確になります。テキストから動画を生成するモデルは、入力された言葉を手がかりに、フレーム間の動き、被写体の形状、光の当たり方、背景の奥行きを確率的に予測します。つまり、モデルは指示をそのまま実行するのではなく、学習した映像表現のパターンの中から、もっとも確からしい解釈を選びます。この性質は自由度の高さにつながる一方で、曖昧な指示は曖昧な結果を生みます。
たとえば「女性が歩く」というプロンプトでは、年齢、服装、歩く速度、カメラの高さ、時間帯、天候、レンズの焦点距離がすべてモデルの推測に委ねられます。一方で「黒いトレンチコートを着た四十代の女性が、雨上がりの夜の路地を、カメラに向かってゆっくり歩く。カメラは腰の高さで後退しながら追従する。ネオンの反射が濡れた路面に映る」と指定すれば、出力のばらつきは大幅に減ります。プロンプトエンジニアリングとは、この推測の余地を意図的にコントロールする技術です。
映像制作では、絵コンテ、ショットリスト、撮影指示、編集指示が分業されます。AI動画生成でも同じように、プロンプトを演出設計として扱う必要があります。一つの長い文章にすべてを詰め込むのではなく、主題、アクション、環境、カメラ、スタイル、制約を構造化して伝えることが、再現性の高いワークフローの第一歩です。
プロンプトを構成する基本ブロック
効果的なプロンプトは、キーワードの羅列ではなく、役割の異なる要素を階層的に組み合わせたものです。すべてのモデルが同じ文法を必要とするわけではありませんが、次の基本ブロックを意識すると、指示の抜け漏れを防げます。
主題とアクション
最初に決めるべきは、誰が、何を、どのように行うかです。主題は具体的に記述します。年齢、性別、髪型、服装、表情、持ち物、身体的な特徴を必要に応じて加えます。アクションは動詞を中心にし、開始状態、途中の動き、終了状態を分けて考えます。たとえば「振り返る」だけでは不十分です。「肩越しにゆっくり振り返り、目を細めて微笑む」のように、動作の質と結果を指定します。
環境と照明
環境は場所、時間帯、天候、時代、美術的なディテールを伝えます。照明は映像の印象を大きく左右します。キーライト、フィルライト、リムライト、逆光、拡散光、実用光源、色温度を言葉にします。ソフトな光は肌をなめらかに見せ、ハードな光は影とコントラストを強調します。夜のシーンでは、ネオン、街灯、車のヘッドライト、月明かりなど、光源の種類と方向を明示すると安定します。
カメラとレンズ
カメラの高さ、アングル、移動、レンズの焦点距離、被写界深度、フレーミングを指定します。カメラ指示は被写体の動作と分けて書くと、モデルが混同しにくくなります。たとえば「被写体は左から右へ歩く。カメラは固定で、被写体を右三分の一に配置する」のように、演者とカメラを別の文で扱います。
スタイルと品質
映像のルックは、映画的な質感、ドキュメンタリー風、アニメ調、クレイアニメ風、レトロVHS風などから選びます。色調、コントラスト、粒子感、レンズフレア、被写界深度、モーションブラーもスタイル要素です。品質指定は「高精細」「シネマティック」「自然な肌の質感」など、モデルが解釈しやすい言葉で補います。ただし、品質語を増やしすぎると他の指示が薄まるため、優先順位を意識します。
プロンプトの例を一つ示します。
シネマティックなリアル調。夕暮れの屋上。赤いジャケットを着た若い男性が手すりにもたれ、遠くの街を見つめる。風で髪が少し揺れる。カメラは彼の背後からゆっくり右へ回り込み、横顔へ移る。85mmレンズ、浅い被写界深度、暖色の逆光、空には薄い雲。
この例では、スタイル、時間帯、場所、人物、動作、カメラ、レンズ、照明、背景がそれぞれ独立した情報として並んでいます。文章が長くても、役割が明確であればモデルは解釈しやすくなります。
ネガティブプロンプトと生成パラメータの調整
ネガティブプロンプトは、避けたい要素を指定する手段です。不要なテキスト、ロゴ、透かし、余分な指、歪んだ顔、過度なぼかし、不自然な関節などを抑えたいときに役立ちます。ただし、ネガティブ指定を増やしすぎると、モデルが萎縮して動きが乏しくなったり、背景が単調になったりします。まずはポジティブ指示を具体的にし、それでも残る問題だけをネガティブで補うのが基本です。
生成パラメータもプロンプトと同じくらい重要です。アスペクト比は構図と用途に合わせます。横長は風景や群像、縦長は人物やSNS、正方形は商品や抽象表現に向きます。フレームレートは動きの滑らかさに影響します。モーション強度は動きの大きさを調整しますが、上げすぎると形状が崩れやすくなります。シード値を固定すると、同じプロンプトでも再現性が高まります。ガイダンスの強さは、プロンプトへの忠実さと自然さのバランスを決めます。
パラメータ調整は、一度に一つだけ変えるのが原則です。プロンプト、シード、モーション強度、ガイダンスを同時に変えると、どの変更が結果に効いたのか分からなくなります。比較用の短いクリップを複数生成し、変更点を記録します。映像制作では、この記録が再利用可能な資産になります。
カメラワークと構図で空間を設計する
AI動画生成でよくある失敗は、被写体の動きは指定できても、カメラの動きが曖昧になることです。カメラワークは視聴者の感情と情報提示を左右します。基本語彙を整理しておきましょう。
固定カメラは安定感と客観性を生みます。パンは水平方向の回転、チルトは垂直方向の回転です。ドリーはカメラ自体が前後に移動し、ズームはレンズの焦点距離を変えます。トラックは被写体と平行に移動し、クレーンは上下に大きく動きます。ハンドヘルドは臨場感と不安定さを出し、オービットは被写体の周囲を回ります。
構図では、ロングショット、ミディアムショット、クローズアップ、オーバーショルダー、ローアングル、ハイアングル、ダッチアングルを使い分けます。ロングショットは場所と状況を説明し、クローズアップは感情を強調します。オーバーショルダーは会話や視線の関係を示します。ローアングルは被写体を強く見せ、ハイアングルは弱さや俯瞰的な視点を生みます。
レンズの焦点距離も構図の一部です。広角レンズは奥行きと歪みを強調し、標準レンズは自然な見え方になります。望遠レンズは背景を圧縮し、被写体を際立たせます。浅い被写界深度は視線を被写体に集め、深い被写界深度は背景の情報も見せます。
カメラ指示を書くときは、始点と終点を明確にします。「ゆっくり前進する」だけではなく、「腰の高さから胸の高さへ、三秒かけて前進する」のように速度と範囲を加えると、意図に近づきます。ただし、複数のカメラ動作を同時に指定しすぎると、モデルが処理しきれずに破綻することがあります。一つのショットにつき、主要なカメラ動作は一つか二つに絞るのが安全です。
キャラクターの一貫性を保つ実践テクニック
複数カットで同じ人物を登場させるとき、一貫性は大きな課題になります。顔、髪、衣装、体型、年齢がカットごとに変わると、視聴者は物語に集中できません。一貫性を高める方法はいくつかあります。
第一に、参照画像を利用する方法です。画像から動画を生成する機能や、複数画像を融合する機能を使えば、視覚的な基準をモデルに与えられます。正面、斜め、横、背面など複数の角度を用意すると、立体感が安定します。第二に、特徴を言語で固定する方法です。髪色、目の色、肌のトーン、ほくろ、傷、アクセサリー、衣装の素材と色を毎回同じ言葉で記述します。第三に、シード値やキャラクター埋め込みを固定する方法です。モデルやワークフローによって呼び方は異なりますが、同一性を保つための設定を記録しておきます。
衣装は特に変化しやすい要素です。同じ赤いコートでも、光の当たり方やカメラの色温度で別の色に見えます。プロンプトでは「朱色のウールコート、黒いボタン、膝丈」のように素材とディテールまで指定します。また、カットごとに表情やポーズは変えても、身体的特徴と衣装の記述は変えないようにします。
一貫性チェックリストとしては、顔の比率、髪型、瞳の色、肌の質感、衣装の色と形、アクセサリー、年齢感、体型を確認します。生成後に複数カットを並べ、違和感のある要素だけを修正します。すべてを一度に直そうとすると、かえって別の不一致が生まれます。
複雑なアクションを分割するプロンプト戦略
AI動画生成が苦手とするのは、長く複雑なアクションです。走る、跳ぶ、振り向く、物を投げる、ドアを開ける、別の人物とすれ違うといった動作を一つのプロンプトに詰め込むと、途中で身体が歪んだり、動作が省略されたりします。
解決策は、アクションをビートに分割することです。一つのショットにつき一つの主要な動作を割り当て、開始、中間、終了を明確にします。たとえば「主人公が屋上を走り、手すりを飛び越え、着地して振り返る」というシーンは、三つのショットに分けます。ショット一は走り出し、ショット二は跳躍、ショット三は着地と振り返りです。それぞれにカメラ指示と環境情報を加えます。
分割したショットは、編集でつなぐ前提で設計します。アクションの方向、画面内の位置、視線の向き、光の方向を前後のショットで合わせます。これをスクリーン・ディレクションと呼びます。左から右へ走っていた人物が、次のカットで突然右から左へ走ると、視聴者は混乱します。移動方向、背景の位置関係、小道具の配置をメモしておきましょう。
複数ショットを生成するときは、各ショットのプロンプトに共通のスタイル記述を入れます。色調、レンズ、フィルム粒子、照明の方向を揃えることで、別々に生成したクリップでも連続性が生まれます。つなぎ目が目立つ場合は、トランジションを工夫するか、短い中間ショットを追加します。
AIエージェント型ディレクターとの協働ワークフロー
近年は、プロンプト生成、ショットリスト作成、絵コンテ整理、自己批評を支援するAIエージェント型のディレクター機能が注目されています。これは人間の演出家を置き換えるものではなく、反復作業とアイデア出しを補助する存在です。
協働の第一段階は、意図の言語化です。物語の目的、視聴者、尺、トーン、必須カットを人間が決めます。第二段階で、AIエージェントにショットリストの草案を作らせます。第三段階で、各ショットのプロンプトを生成し、スタイルと一貫性のルールを適用します。第四段階で、生成結果を評価し、どの指示が効いてどの指示が無視されたかを記録します。第五段階で、プロンプトを改良し、再生成します。
このワークフローでは、プロンプトをバージョン管理することが重要です。変更前と変更後を比較できるように、プロンプト、パラメータ、使用した参照画像、生成結果のメモを一つの表にまとめます。うまくいったプロンプトはテンプレート化し、再利用します。失敗したプロンプトも、避けるべきパターンとして保存します。
AIエージェントに任せすぎるのも考えものです。エージェントは統計的な傾向から提案するため、物語上の意図やブランドの禁則を理解しないことがあります。人間が最終判断を下し、倫理、権利、表現の適切さを確認する責任を持ちます。
モデル特性に合わせたプロンプト適応
動画生成モデルは、大きく分けて自然言語を重視するタイプと、タグや短いキーワードを重視するタイプがあります。自然言語型は文章で文脈を伝えるのが得意ですが、長すぎる指示では重要度が薄まることがあります。タグ型は要素を簡潔に並べるのが得意ですが、複雑な動作や因果関係の表現は苦手です。
リアル調のモデルは、照明、レンズ、肌の質感、物理的な動きの記述に反応しやすいです。アニメ調のモデルは、線の太さ、彩色、表情、ポーズ、背景美術の指定が効果的です。画像から動画を生成するモデルでは、参照画像の構図が強く影響するため、プロンプトは動きとカメラに集中させます。
同じプロンプトでもモデルによって解釈が異なります。あるモデルで効果的な「ゆっくりとしたドリー」が、別のモデルでは急なズームになることがあります。モデルを変えるときは、プロンプトをそのまま移植せず、主要な要素だけを残して再調整します。最初に短いテストクリップを生成し、カメラ、動き、スタイルの反応を確認してから本番の長いシーンに進みます。
また、モデルの更新によって同じプロンプトの結果が変わることがあります。制作中のプロジェクトでは、使用したモデルの版、設定、日付を記録し、途中で変更する場合は比較テストを行います。
よくある失敗と改善チェックリスト
AI動画生成でよくある失敗には、次のようなものがあります。第一に、指示が曖昧でモデルの推測に頼りすぎるケースです。改善策は、主題、動作、環境、カメラ、スタイルをそれぞれ一文で明確にすることです。第二に、要素を詰め込みすぎるケースです。一つのショットに複数の動作、複数の人物、複雑なカメラ移動を入れると破綻しやすくなります。一ショット一目的を意識します。
第三に、矛盾する指示です。「静かな室内」と「強風が吹き荒れる」を同時に指定すると、モデルはどちらかを無視します。第四に、カメラ指示の過多です。回転、前進、ズーム、上下動を同時に指定すると、映像が不安定になります。第五に、ネガティブプロンプトの過剰使用です。不要な要素を減らすより、望む要素を具体化する方が効果的な場合が多いです。
第六に、キャラクターの一貫性不足です。参照画像、特徴記述、シード値、衣装の詳細を固定します。第七に、物理法則の無視です。重力、慣性、衝突、水しぶき、布の動きなど、現実の挙動を言葉で補います。第八に、音声や字幕の指示を映像プロンプトに混ぜるケースです。音声は別工程で扱い、映像生成では視覚情報に集中します。
改善チェックリストとしては、主題は具体的か、動作は一つに絞られているか、環境と照明は矛盾していないか、カメラ指示は実行可能か、スタイルは統一されているか、ネガティブ指定は最小限か、パラメータは記録されているか、複数カットの方向性は合っているかを確認します。
実践ワークフローとFAQ
ここからは、実際に短い物語シーンを作る流れを整理します。題材は「雨の夜、主人公が電話ボックスで誰かを待つ」という三十秒のシーンです。
プリプロダクション
まず目的を決めます。今回は緊張感と孤独感を伝えることが目的です。尺は三十秒、カット数は五つ、トーンは静かでシネマティック、色調は青緑とアンバーの対比とします。次にショットリストを作ります。ショット一は雨の降る街のロングショット、ショット二は電話ボックスに立つ主人公のミディアムショット、ショット三は受話器を持つ手のクローズアップ、ショット四は通り過ぎる車のヘッドライト、ショット五は主人公の顔のクローズアップです。
ルック開発
次に、スタイルを固定するための短いテストを生成します。照明は街灯の実用光源、レンズは35mmと85mm、フィルム粒子は弱め、被写界深度は中程度とします。モデルが雨、反射、ネオンの色をどのように解釈するかを確認し、プロンプトの表現を調整します。
ショット生成
各ショットのプロンプトには、共通のスタイル記述を入れます。たとえば「雨の夜、青緑の街灯、濡れた路面の反射、シネマティック、35mm、浅すぎない被写界深度、自然な動き」を共通ブロックにします。そのうえで、ショットごとに被写体、動作、カメラを変えます。ショット二なら「電話ボックスの中で、黒いコートの人物が受話器を握り、外の雨を見る。カメラは胸の高さで固定。窓ガラスに雨粒が流れる」とします。
選別と編集
生成したクリップから、動きの自然さ、顔の安定、カメラの滑らかさ、色調の一致を基準に選びます。必要に応じて再生成し、つなぎ目を編集で調整します。カットの順番、長さ、間の取り方で緊張感が変わります。速いカット割りは焦燥感を生み、長いカットは静けさと孤独を強調します。
仕上げ
最後に、色調整、粒子、軽い揺れ、音響効果を加えます。AI生成映像はそのままだと均一に見えることがあるため、コントラストや色温度を微調整すると映画的な奥行きが出ます。音は雨音、遠くの車、電話ボックスの反響などを重ね、映像の世界観を補強します。
FAQ
質問:プロンプトは長ければ長いほど良いですか。回答:長さよりも構造が重要です。主題、動作、環境、カメラ、スタイル、制約が明確に分かれていれば、長くても問題ありません。逆に、同じ意味の修飾語を並べるだけでは効果が薄れます。
質問:日本語でプロンプトを書いても大丈夫ですか。回答:モデルによります。日本語を理解するモデルも増えていますが、英語の方が安定する場合もあります。重要なのは言語ではなく、要素の分解と具体性です。日本語で書き、必要に応じて英語に翻訳して比較します。
質問:シード値を固定すれば完全に同じ映像になりますか。回答:完全に同じになるとは限りません。モデルの更新、解像度、フレーム数、他のパラメータによって結果は変わります。シードは再現性を高める補助であり、プロンプトと参照画像の固定と組み合わせて使います。
質問:ネガティブプロンプトには何を入れればよいですか。回答:まずは何も入れず、ポジティブ指示だけで試します。その後、実際に現れた不要な要素だけを追加します。顔の歪み、余分な手足、文字、ロゴ、過度なぼかしなどが一般的です。
質問:複数カットで同じ人物を出すコツはありますか。回答:参照画像を複数角度で用意し、衣装と身体的特徴を同じ言葉で記述し、シードや埋め込みを固定します。カットごとに変えるのは表情、ポーズ、カメラだけにします。
質問:カメラワークが効かないときはどうしますか。回答:カメラ指示を被写体の動作から分離し、始点と終点、速度、方向を具体的に書きます。同時に複数の動きを指定せず、一ショットにつき主要な動きを一つか二つに絞ります。
質問:生成結果が不自然なとき、最初に何を疑えばよいですか。回答:指示の矛盾、要素の詰め込みすぎ、モーション強度の高すぎ、参照画像の不足、解像度とアスペクト比の不一致を確認します。一度に一つずつ変更し、比較します。
質問:AIエージェント型ディレクターは必須ですか。回答:必須ではありません。ショットリストやプロンプトの草案作成を効率化したい場合に有用です。ただし、最終的な演出判断と倫理確認は人間が行います。
質問:プロンプトを再利用するにはどう管理すればよいですか。回答:プロジェクトごとに、目的、ショット、プロンプト、パラメータ、参照画像、生成結果、改善メモを表形式で保存します。成功例と失敗例の両方を残すと、次の制作が速くなります。
AI動画生成の品質は、モデルの性能だけで決まるわけではありません。望むシーンを言葉に分解し、カメラ、照明、演技、美術、編集の意図を構造化して伝える力が、安定した結果を生みます。基本ブロックを意識し、ネガティブ指定とパラメータを最小限に調整し、キャラクターの一貫性とアクションの分割を徹底する。そして、生成結果を記録し、改善を重ねる。この反復こそが、AI動画制作を再現可能なワークフローへと変える道です。

