AI動画生成でプロンプト設計が重要な理由
AI動画生成は、テキストから映像を生み出す技術として急速に進化しています。しかし、モデルの性能がどれほど高くなっても、入力するプロンプトが曖昧であれば、意図した映像は得られません。プロンプト設計は、単なるキーワード入力ではなく、映像の設計図を言葉で記述する作業です。主題、動作、背景、ライティング、カメラワーク、編集意図を整理して伝えることで、生成結果の再現性と品質が大きく向上します。
特に広告、eラーニング、映画のプリビズ、SNSショート動画などでは、シーンごとの一貫性が求められます。キャラクターの顔立ちが毎カットで変わったり、背景の時間帯が急に変わったりすると、視聴者はすぐに違和感を覚えます。プロンプトエンジニアリングを学ぶことは、AIを単なる偶然の生成器から、制御可能な制作パートナーへと変える第一歩です。
また、動画生成モデルは静止画生成モデルよりも、時間方向の一貫性、物理法則、カメラの動き、被写体のモーションを同時に扱う必要があります。そのため、静止画のプロンプトよりも情報の優先順位づけが重要になります。何を最初に伝え、何を補足し、何をネガティブ指定するのか。この順番を意識するだけで、生成結果は驚くほど安定します。
プロンプトの基本構造:五つの要素を分解する
強力なプロンプトは、単語の羅列ではありません。映像を構成する情報をレイヤーごとに分け、モデルが解釈しやすい順序で並べた指示書です。基本となる要素は、主題、動作、設定、スタイル、技術パラメータの五つです。これらを一度に長文で書くのではなく、意味のまとまりごとに整理すると、後から修正しやすくなります。
主題と動作を明確にする
主題は「誰が」「何が」映るのかを決めます。人物、動物、乗り物、商品、風景など、最初に固定します。次に動作です。「歩く」「振り返る」「手を伸ばす」「風に髪がなびく」など、動詞を使って具体的に指定します。動作は一度に複数詰め込みすぎると、モデルがどの動きを優先すべきか迷います。1カットにつき主要な動作は一つか二つに絞るのが実践的です。
たとえば「女性がカフェでコーヒーを飲む」よりも、「30代の女性が窓際の席でカップを持ち上げ、湯気を見つめながら微笑む」のほうが、映像としての解像度が上がります。ただし、情報を増やしすぎると破綻も増えるため、まずは主題と主要動作を決め、次に環境や感情を足していく順序が安全です。
設定・背景・ライティングを指定する
設定は、場所、時間帯、天候、周囲の小道具を決めます。屋内か屋外か、都市か自然か、朝か夕方か、雨か晴れか。これらは映像のトーンを大きく左右します。ライティングはさらに重要です。逆光、柔らかな拡散光、蛍光灯、ネオン、ローソクの炎、曇天の自然光など、光源の種類と方向を指定します。
背景は「何があるか」だけでなく「どの程度ぼけるか」も指定すると効果的です。被写界深度を浅くしたいなら、背景を柔らかくぼかす、前景に花やカウンターを置く、被写体を画面の三分割位置に配置する、といった構図の指示を加えます。これにより、生成される映像が単なる記録ではなく、意図的なショットになります。
スタイルとカメラワークを言語化する
スタイルは、写実的、シネマティック、アニメ、水彩、クレイアニメ、レトロフィルム、ドキュメンタリー風など、映像全体の質感を決めます。同時に、カメラワークも指定します。固定ショット、パン、ティルト、ドリー、クレーン、ハンドヘルド、ドローン旋回、ズームイン、ズームアウトなどです。カメラワークは動画生成において特に重要で、静止画プロンプトとの大きな違いです。
たとえば「シネマティックで浅い被写界深度、ゆっくりしたドリーイン、35mmレンズ、黄金時間の逆光」と指定すると、映像の空気感が定まります。反対に「かっこいい感じ」だけでは、モデルごとに解釈がばらつきます。感覚的な言葉は、具体的な視覚要素に翻訳してから使うのがコツです。
技術パラメータとネガティブ指定
技術パラメータには、アスペクト比、フレームレート、解像度、モーションの強さ、シード値などがあります。これらはモデルやツールによって名称が異なりますが、意図を安定させるために有効です。縦型ショート動画なら9:16、映画的なワイドショットなら16:9、SNSフィードなら1:1や4:5など、用途に合わせて選びます。
ネガティブ指定も欠かせません。不要な要素を明示することで、余計なオブジェクトや不自然な変形を減らせます。たとえば、指の本数が崩れる、顔が歪む、文字がぐちゃぐちゃになる、画面がちらつく、といった問題に対して、ネガティブプロンプトや除外設定を活用します。ただし、ネガティブ指定を増やしすぎると、モデルが萎縮して動きが硬くなることもあります。まずはポジティブ指定を整理し、問題が出たときだけ追加するのが現実的です。
モデル特性に合わせたプロンプト戦略
同じプロンプトでも、モデルによって得意分野は異なります。写実的な人物に強いモデル、アニメ調に強いモデル、長回しに強いモデル、カメラワークの再現に強いモデルなど、それぞれ癖があります。大切なのは、モデルを無理に同じ使い方で扱わず、特性に合わせてプロンプトの書き方を変えることです。
テキスト動画モデルと画像参照モデルの違い
テキストから直接動画を生成するモデルは、シーン全体をゼロから構築します。自由度が高い一方で、キャラクターの一貫性を保つのが難しい場合があります。画像を参照できるモデルは、開始フレームやキャラクターの見た目を固定しやすいため、シリーズものや商品紹介に向いています。
たとえば、同じ人物が複数カットに登場するストーリーでは、最初にキャラクターの基準画像を作り、それを参照しながら各カットを生成します。テキストだけで一貫性を出そうとすると、髪型、服、年齢、顔の輪郭がカットごとに揺れやすくなります。参照画像を使えるなら、積極的に使うのが合理的です。
縦型・横型・正方形の構図設計
アスペクト比は単なる出力サイズではなく、構図と演出に影響します。縦型は人物の全身やスマートフォン視聴に強く、横型は風景や群衆、映画的な空間表現に向いています。正方形は商品と人物を同時に見せやすく、フィード投稿で目を引きます。
縦型のときは、被写体を画面中央に置きすぎず、上下の余白を意識します。字幕やUIが重なる場所も考慮し、重要な情報を画面の下部に置きすぎないようにします。横型では、左右の空間を使って視線誘導を行い、背景に奥行きを作ります。モデルに構図を伝えるときは、アスペクト比だけでなく、被写体の配置、前景、背景、余白の使い方まで指定すると安定します。
キャラクターの一貫性を保つプロンプト技術
複数カットの映像で最も難しいのが、キャラクターの一貫性です。顔、髪、肌の色、体型、年齢、衣装、小道具がカットごとに変わると、視聴者は別の人物だと認識します。これを防ぐには、キャラクターの定義をテンプレート化し、毎回同じ記述を使うことが重要です。
キャラクターシートとキーフレーム
まず、主人公の設定を文章と画像の両方で用意します。名前、年齢、性別、髪型、髪色、目の色、肌のトーン、体型、服装、アクセサリー、表情の癖などを箇条書きにします。これをキャラクターシートとして保存し、各カットのプロンプトに共通部分として貼り付けます。
さらに、重要なカットではキーフレーム画像を生成します。最初のフレーム、中間のフレーム、最後のフレームを用意し、それを参照して動画化すると、動きの始点と終点が明確になります。キーフレームを使う方法は、手間はかかりますが、完成度の安定という点で非常に効果的です。
参照画像を組み合わせる
画像参照に対応したモデルでは、顔だけ、衣装だけ、背景だけを別々に参照させる方法も有効です。ただし、参照画像が多すぎると、モデルがどの要素を優先すべきか混乱します。重要なのは、参照の役割を分けることです。人物の顔はこの画像、衣装はこの画像、背景はこの画像、というように役割を明確にします。
また、参照画像のライティングや角度がばらばらだと、生成結果も不安定になります。できれば同じ照明、同じレンズ感、同じ色温度で揃えた参照画像を用意します。そうすることで、カット間のつながりが自然になります。
衣装・小道具・特徴の固定
衣装や小道具は、物語の連続性を支える重要な手がかりです。赤いスカーフ、丸い眼鏡、革のジャケット、特定のロゴが入ったカバンなど、視聴者が記憶しやすい要素を固定します。プロンプトでは「赤いスカーフを首に巻いた」「左耳に小さな銀のイヤリング」のように、位置と色まで指定します。
逆に、毎回変えてよい要素と変えてはいけない要素を分けておくことも大切です。表情やポーズはカットごとに変えても、髪型や服は変えない。このルールを決めておくと、プロンプトの修正が速くなります。
シーンと背景の一貫性を維持する方法
キャラクターだけでなく、背景も一貫させます。同じ部屋、同じ街並み、同じ森の中での出来事なら、壁の色、家具の配置、木の種類、天気、時間帯を固定します。背景が変わると、視聴者は場所が変わったと解釈します。
背景記述をテンプレート化する
背景の説明もテンプレート化します。たとえば「白い壁、大きな窓、木製の床、観葉植物、午後の柔らかな光」という記述を、そのシーンの全カットで使い回します。カメラアングルが変わっても、同じ要素を同じ順序で書くことで、モデルは同じ空間を再構築しやすくなります。
背景に動きがある場合は、何が動き、何が静止しているかを分けます。木の葉は揺れる、カーテンはなびく、机の上のコップは動かない。この区別をプロンプトに含めると、不自然な揺れや消失を減らせます。
時間帯とライティングを固定する
時間帯は映像の連続性に直結します。朝、昼、夕方、夜、深夜。同じシーンなら同じ時間帯を維持します。もし時間経過を表現するなら、カットごとに光源の角度と色温度を段階的に変えます。夕方から夜へ移るなら、オレンジから青へ、影の長さを長く、街灯を点灯させる、といった変化を指示します。
ライティングは、光源の方向を言葉にします。左からの窓光、右後方からの逆光、頭上からの蛍光灯、足元からの炎。光源の方向がカットごとに変わると、同じ部屋でも別の空間に見えます。
カメラ位置とレンズを継続させる
カメラ位置も一貫性の要素です。同じ会話シーンなら、話者Aは画面左、話者Bは画面右というように、イマジナリーラインを意識します。レンズの焦点距離も、広角、標準、望遠で印象が変わります。広角は空間を広く見せ、望遠は背景を圧縮して人物を際立たせます。
プロンプトでは「35mmレンズ相当」「85mmポートレートレンズ」「広角24mm」などと指定します。同じシーンでレンズ感が急に変わると、視聴者は違和感を覚えます。カットごとに変える場合でも、意図的な演出として説明できるようにしましょう。
モーションとトランジションを制御する
動画生成の醍醐味は動きです。静止画では表現できない時間の流れ、被写体の動作、カメラの移動、シーン転換を扱います。しかし、動きはモデルにとって難易度が高く、崩れも出やすい領域です。
動きの方向・速度・強度
動作を指定するときは、方向、速度、強度を分けて考えます。方向は「左から右へ」「手前に向かって」「時計回りに」などです。速度は「ゆっくり」「素早く」「一定のテンポで」などです。強度は「穏やかに」「力強く」「控えめに」などです。
たとえば「女性がゆっくりと振り返り、髪が肩から流れる」は、動作と速度と副次的な動きが明確です。これに「カメラは固定、背景の光はわずかに揺れる」と加えると、主動作と環境動作の区別ができます。
自然なトランジションの指定
トランジションは、カット間のつながりを滑らかにします。フェード、ディゾルブ、ワイプ、マッチカット、カメラの振りを使ったスウィッシュなどがあります。AI動画では、カットの最後と次のカットの最初を近づけることで、自然なトランジションを作れます。
たとえば、前のカットで人物がドアに手を伸ばし、次のカットでドアが開くところから始めます。動作の続きを次のカットで受け止めることで、視聴者は編集点を意識しにくくなります。プロンプトにも「前のカットの動作を受けて」「同じ方向にカメラが動く」と記述すると効果的です。
物理法則と不自然さの回避
AI動画は物理法則を完全には理解していません。手が物体をすり抜ける、足が地面に沈む、液体が逆流する、影が不自然に伸びる、といった問題が起こります。これを減らすには、動きを単純化し、接触や衝突を明確にし、影の方向を指定します。
「足音が聞こえるように地面をしっかり踏む」「手のひらでカップを包み込む」「机の上に影が落ちる」など、物理的な手がかりを加えます。また、速すぎる動きや複雑な絡み合いは破綻しやすいため、カットを分けて対応するのも有効です。
実践ワークフロー:短編映像を一本作る
ここからは、実際に短編映像を一本作る流れを整理します。大切なのは、いきなり完成形を目指さず、小さくテストを繰り返すことです。
企画と絵コンテ
まず、伝えたいことを一文で決めます。誰が、どこで、何をし、どう感じるのか。次に、必要なカットを絵コンテにします。各カットの目的、尺、カメラ、動作、背景、セリフや字幕の有無を書き出します。この段階で情報を整理しておくと、プロンプト作成が格段に楽になります。
絵コンテは簡単な棒人間で構いません。構図、視線、動きの方向、カメラの位置が分かれば十分です。AI動画は絵コンテの代わりにはなりませんが、絵コンテがあるとAIの出力を評価しやすくなります。
プロンプトの反復テスト
各カットについて、基本プロンプトを作り、短い尺でテスト生成します。一度に長い映像を作らず、まず数秒で動きと構図を確認します。うまくいかない場合は、主題、動作、背景、スタイル、カメラの順に切り分けて修正します。
テストでは、同じプロンプトを複数回生成し、ばらつきを確認します。安定して良い結果が出るプロンプトは、テンプレートとして保存します。逆に、たまたま良かっただけのプロンプトは再現性が低いため、本番では避けます。
編集と後処理
生成したカットを編集ソフトでつなぎます。色調整、音響、字幕、モーショングラフィックスを加えます。AI生成映像はカットごとに色温度やノイズ感が異なることがあるため、カラーグレーディングで統一します。
音は映像の説得力を大きく左右します。環境音、足音、衣擦れ、BGMを加えることで、AI生成特有の無機質さを減らせます。必要に応じて、フレーム補間や手ぶれ補正、アップスケールを行います。
よくある失敗と改善チェックリスト
AI動画生成でよくある失敗には、キャラクターが変わる、背景が変わる、動きが不自然、カメラが勝手に動く、文字が崩れる、画面がちらつく、などがあります。これらは原因を切り分けることで改善できます。
チェックリストとして、主題は一つか、動作は明確か、背景の要素は固定されているか、ライティングの方向は指定したか、カメラワークは具体的か、アスペクト比は適切か、ネガティブ指定は最小限か、参照画像の役割は分かれているか、カット間の動作はつながっているか、を確認します。
また、プロンプトを長くしすぎると、モデルが重要度を誤解することがあります。最初の一文で主題と動作を伝え、その後に環境、スタイル、カメラ、技術指定を続けるのが基本です。不要な修飾語は削り、具体的な名詞と動詞を残します。
FAQ:AI動画プロンプトの疑問
Q. プロンプトは日本語と英語のどちらが良いですか。
A. モデルによります。英語の学習データが多いモデルでは英語のほうが安定することがありますが、日本語に対応したモデルも増えています。重要なのは言語そのものより、主題、動作、設定、スタイル、カメラの情報が明確に入っていることです。
Q. 同じキャラクターを出し続けるにはどうすればよいですか。
A. キャラクターシートを作り、共通の記述を毎回使います。さらに参照画像やキーフレームを併用します。顔、髪、衣装、小道具のうち、変えてはいけない要素を明確に決めておくことが重要です。
Q. 動きがカクカクしたり不自然になったりします。
A. 動作を単純化し、速度を落とし、接触や影を指定します。一度に多くの動きを詰め込まず、カットを分けます。モーションの強度設定を下げることも有効です。
Q. カメラワークを指定しても意図通りになりません。
A. カメラワークはモデルにとって難しい指示です。固定、パン、ドリー、ズームなど、一つのカットに一つだけ指定します。方向と速度も加え、被写体の動きと競合しないようにします。
Q. ネガティブプロンプトは多いほうが良いですか。
A. いいえ。必要な問題に対して最小限に使います。増やしすぎると、映像が硬くなったり、動きが抑制されたりします。まずポジティブ指定を整理し、それでも出る問題にだけ追加します。
Q. 生成した映像の一貫性を編集で補うことはできますか。
A. できます。カラー調整、トリミング、フレーム補間、音響で違和感を減らせます。ただし、根本的なキャラクターの不一致は編集では直しにくいため、生成段階での参照画像とテンプレート化が重要です。
まとめ:意図通りの映像を生む設計原則
AI動画生成で思い通りの映像を得るには、魔法の呪文を探すのではなく、映像の設計図を丁寧に言葉へ変換する姿勢が欠かせません。主題、動作、設定、スタイル、カメラ、技術パラメータをレイヤーごとに整理し、キャラクターと背景の一貫性をテンプレートで守ります。
モデルごとの得意分野を理解し、参照画像やキーフレームを適切に使い、モーションとトランジションを単純化します。テスト生成を繰り返し、再現性のあるプロンプトだけを本番に使います。編集と後処理で色と音を整えれば、短いカットの積み重ねでも説得力のある映像になります。
最も大切なのは、一度に完璧を目指さないことです。小さく作り、観察し、修正する。このサイクルを回すことで、プロンプトは単なる入力文から、あなたの映像制作を支える信頼できる設計ツールへと変わっていきます。



