Limited Time Sale: Get 30% OFF on Next-Gen AI Video Creation 🎉

AI動画プロンプト設計入門|高品質な映像を生む実践ガイド

Sep 14, 2026

プロンプト設計がAI動画の品質を決める理由

AI動画生成は、実験的なデモの段階を終え、広告、教育コンテンツ、商品紹介、SNSショート、社内トレーニングなど実務の現場で使われる段階に入った。それと同時に、多くの制作チームが同じ壁にぶつかっている。「同じモデルを使っているのに、出てくる映像の質に大きな差がある」という問題だ。

この差を生む最大の要因は、モデルの性能差ではなくプロンプトの設計品質である。モデルは与えられた指示を忠実に解釈しようとするが、指示が曖昧であれば、模型は「平均的な映像」に収束させる。逆に、構造化された指示を与えれば、同じモデルから驚くほど意図に近い映像が返ってくる。

プロンプトは、いわば映像の設計図だ。撮影現場でいう脚本、絵コンテ、撮影指示書、照明設計、編集ノートを、ひとつのテキストに圧縮したものだと考えると理解しやすい。設計図が雑であれば、どれほど優秀な技術者でも意図した建物は建たない。

この記事では、AI動画生成におけるプロンプト設計を、次の流れで体系的に扱う。

  1. モデルの特性を把握する
  2. プロンプトを4つのブロックに構造化する
  3. 動きと時間軸をコントロールする
  4. 一貫性を保つ仕組みを作る
  5. 実際のショット制作手順に落とし込む
  6. 失敗を切り分けて修正する

読み終えたとき、あなたの手元には「なんとなく書く」から「設計して書く」への切り替えスイッチができているはずだ。

まずモデルの「個性」を把握する

AI動画モデルは、それぞれ異なる学習データとアルゴリズムで構築されている。そのため、プロンプトへの反応の仕方が根本的に違う。同じ文章を投げても、あるモデルはシネマティックな質感で返し、別のモデルはアニメ調の動きで返す。まずこの前提を押さえることが、あらゆる上達の出発点になる。

シネマティック重視型

RunwayのGenシリーズやLumaのRayシリーズは、カメラワークの解釈と光の表現に強い。ドリー、パン、オービットといった撮影用語を比較的正確に理解し、フィルム的な質感を出しやすい。CM風の映像、ブランドムービー、リアルな人物ショットに向く。

この系統では「lens」「aperture」「shot size」といった撮影用語が効きやすい。逆に抽象的な情緒表現だけを並べると、平凡な構図に落ち着きやすい。

アニメ・イラスト表現型

Viduや一部のスタイル特化モデルは、線の強弱、セル画的な陰影、キャラクターの表情変化に強い。日本のアニメ表現を狙うなら、この系統が第一候補になる。

アニメ系モデルでは「線の太さ」「セルの塗り分け」「背景の描き込み密度」といった作画用語が有効だ。実写用語を混ぜすぎると、質感が中途半端になる。

物理リアリズム・人物表現型

MiniMax Hailuo系やPixVerse系は、身体の動きの自然さ、重力、布の揺れ、人物の魅力の表現に強みを持つ。ダンス、スポーツ、人物の心情表現を含むショットで安定しやすい。

モデル選定の判断基準

モデルを選ぶときは、次の順で考えると迷いが減る。

  • 被写体は何か:人物の顔が主役なら人物表現に強いモデル、風景なら光と質感に強いモデル
  • 動きの種類は何か:静的なカメラ移動か、身体の激しい動きか
  • テイストは何か:実写調、アニメ調、CG調、レトロ調
  • 尺はどのくらいか:数秒のカットか、複数カットの連接か
  • テキストやロゴが入るか:文字表現が絡むとモデルごとの差が大きい

重要なのは、「最強のモデル」を探すのではなく「このショットに合うモデル」を選ぶという発想だ。1本の動画の中でモデルを混ぜることも、表現の幅を広げる有効な手段になる。

プロンプトの基本構造:4ブロック設計

高品質なプロンプトは、明確な構造を持つ。長ければ良いわけではなく、情報の種類が整理されていることが重要だ。実務では次の4ブロックに分けると扱いやすい。

第1ブロック:主題(Subject)

誰が、何を、どうしているのかを書く。ここが最も曖昧になりやすい。

  • 人物の場合:年齢層、服装、髪型、表情、姿勢
  • 物体の場合:素材、色、大きさ、状態
  • 動作の場合:進行中の動作を現在形で

悪い例:「女性が歩いている」
良い例:「30代の女性が、ベージュのトレンチコートを着て、雨上がりの舗道をゆっくり歩いている。視線はやや下、表情は落ち着いている」

第2ブロック:環境・設定(Setting / Context)

場所、時間帯、天候、空間の広さ、周囲の要素を書く。

  • 場所:屋内・屋外、都市・自然、具体的な情景
  • 時間帯:朝もや、昼、夕暮れ、夜
  • 天候と空気:雨、霧、ほこり、湿度感
  • 周辺要素:看板、人混み、木々、水面

環境は映像の「説得力」を大きく左右する。被写体がどれほど良くても、背景が空虚だと安っぽく見える。

第3ブロック:スタイルと技術指示(Style / Technical Directives)

ここが映像の質感を決める部分だ。

  • 映像ルック:フィルムグレイン、シネマティック、ドキュメンタリー調、VHS風
  • カメラ:レンズ焦点距離、被写界深度、アングル、ショットサイズ
  • 色調:暖色系、寒色系、彩度低め、ハイコントラスト
  • ライティング:逆光、リムライト、ソフトボックス、自然光
  • 参考スタイル:特定の時代やジャンルの雰囲気

第4ブロック:モーションと時間(Motion / Time)

カメラの動き、被写体の動き、変化の速度、ショットの長さを指定する。

  • カメラ:スローパン、ドリーイン、オービット、ハンドヘルド
  • 被写体:歩く、振り返る、髪が揺れる
  • 速度:スローモーション、通常速度、加速
  • 変化:光が差し込む、霧が晴れる、表情が変わる

4ブロックを1本にまとめた例

「主題:40代の男性パティシエが、白いエプロン姿で、カウンター越しにクリームを絞っている。手元に集中した表情。環境:朝の自然光が差し込む小さな工房、木製の作業台、粉がうっすら舞っている。スタイル:35mmレンズ相当、浅い被写界深度、暖色寄りの色調、フィルムグレイン控えめ、シネマティック。モーション:カメラはゆっくり右へスライド、被写体の手の動きは通常速度、最後に彼が顔を上げて微笑む」

この形に慣れると、修正も簡単になる。「表情が違う」なら第1ブロック、「光が違う」なら第3ブロックを直せばよい。

モーションと時間軸をコントロールする

AI動画で最も失敗が多いのが、動きの制御だ。静止画的な美しさは保てても、動かした瞬間に崩れるケースが非常に多い。

カメラワークの語彙を増やす

モデルが理解しやすい代表的な指示を整理しておこう。

  • 固定(static / locked off):最も安定する。人物の演技を見せたいときに最適
  • パン(pan):左右の首振り。空間の広がりを見せる
  • ティルト(tilt):上下。建物や人物の全身を見せる
  • ドリー(dolly in / out):前後移動。感情の接近や離脱に使える
  • トラッキング(tracking):被写体と並走。歩行シーンで定番
  • オービット(orbit):被写体の周囲を回る。商品や人物の見せ場に
  • クレーン(crane up):上昇。場面転換やクライマックスに
  • ハンドヘルド(handheld):揺れ。臨場感やドキュメンタリー感

一度に複数のカメラムーブを指定すると破綻しやすい。「1ショット1ムーブ」を原則にすると安定する。

速度とイージング

動きの質感は速度指定で大きく変わる。

  • スローモーション:ドラマチック、商品の質感表現
  • 通常速度:ドキュメンタリー、自然な日常
  • わずかな遅延からの加速:衝撃や驚きの演出

「ゆっくりと」「徐々に」といった副詞は、モデルが動きの立ち上がりを緩やかにする助けになる。逆に「素早く」を多用すると、意図しない急な動きが入りやすい。

ショット分割の考え方

10秒を超える映像を1回の生成で作ろうとすると、後半で崩れる確率が上がる。実務では次のように分けると安定する。

  • 1ショット3〜5秒を基本単位にする
  • 感情の変化点、動作の区切りで切る
  • 各ショットの冒頭と末尾を次のショットにつなげる
  • 編集でつなぐ前提で、同じライティングと色調を指定する

「1回で完璧な長尺を作る」よりも「短いショットを確実に作り、編集で組み立てる」ほうが、最終的な品質は高くなる。

一貫性を保つ:キャラクターとスタイルの固定

複数ショットの動画で最も難しいのが一貫性だ。同じ人物のはずが、ショットごとに顔が変わる。同じ場所のはずが、色調が変わる。これを防ぐには仕組みが必要になる。

キャラクター固定の基本手順

  1. 基準カットを1枚作る:正面に近い、ニュートラルな表情、均一な光
  2. 特徴を言語化する:髪の長さ、生え際、眉の形、服の色と素材、年齢感
  3. 参照として使い回す:以降のショットで同じ記述と参照をセットで渡す
  4. 変化させる要素を限定する:表情、姿勢、カメラ位置だけを変える

記述は毎回同じ言葉を使うこと。「黒髪」と「ダークブラウンの髪」を混ぜるだけで、モデルは別人物として解釈することがある。

参照画像とキーフレームの活用法

参照画像は、テキストだけでは伝わらない情報を補う。

  • 人物参照:顔立ちと髪型の固定
  • スタイル参照:色調、粒子感、ライティングの統一
  • 構図参照:ショットサイズと配置の再現

参照を複数使う場合は、役割を分けると効果的だ。「人物はA、色調はB、構図はC」というように、どこから何を借りるのかを意識する。1枚の参照にすべてを求めると、どれも中途半端になりやすい。

スタイル固定のチェック項目

  • レンズ感(広角か望遠か)
  • 被写界深度(背景のボケ量)
  • 色温度(暖色か寒色か)
  • コントラスト(軟調か硬調か)
  • 粒子とノイズの量
  • 光源の方向と種類

これらを数値や短いキーワードで毎回同じように書く。スタイルの一貫性は、映像の「ブランドらしさ」に直結する。

実践ワークフロー:15秒のショットを作る

ここまでの内容を、実際の制作手順に落とし込む。

ステップ1:目的を1文で書く

「誰に、何を伝える映像か」を1文にする。例:「新商品の保温ボトルを、通勤シーンで使う30代に向けて紹介する」。この文が全判断の基準になる。

ステップ2:絵コンテを3〜4カットで描く

ラフでよい。カットごとに「何を見せるか」を決める。

ステップ3:モデルを選ぶ

人物の表情が主役なら人物表現に強いモデル、商品の質感が主役なら質感表現に強いモデルを選ぶ。迷ったら2つ試作して比較する。

ステップ4:4ブロックでプロンプトを書く

主題、環境、スタイル、モーションを分けて書く。1カットにつき1ムーブを守る。

ステップ5:低コストで試作する

解像度や長さを抑えた設定で、まず構図と動きを確認する。ここで方向性が違えば、文章を根本から見直す。

ステップ6:1要素ずつ修正する

複数箇所を同時に変えると、何が効いたのか分からなくなる。1回の試行で変えるのは1ブロックまでにする。

ステップ7:採用カットを固定する

良いカットが出たら、そのプロンプトと参照を保存する。これが資産になる。

ステップ8:編集でつなぐ

トランジション、音楽、字幕、カラー調整を加える。AI生成の弱点は編集でかなり補える。特にカットの切り替えを早めにすると、動きの粗さが目立たなくなる。

よくある失敗とデバッグ手順

キャラクターが別人になる(ドリフト)

原因は参照の不足か、記述の揺れだ。対処は、基準カットを作り直し、記述をテンプレート化して固定すること。表情や姿勢の変化は許容し、顔立ちの記述は変えない。

体が溶ける、指が崩れる

激しい動きや手の大写しで起きやすい。対処は、動作を単純化する、手を画面から外す、カメラを引いて全身を小さく写す、ショットを短くする。

動きが速すぎる

「素早く」という語を外し、「ゆっくりと」「わずかに」に置き換える。スローモーション指定も有効だ。

構図が意図と違う

ショットサイズとアングルを明示する。「クローズアップ」「ローアングル」「正面」「画面左に配置」など、位置情報を具体的に書く。

色調が毎回変わる

スタイルブロックに色温度、コントラスト、粒子量を明記し、参照画像を併用する。

文字やロゴが崩れる

多くのモデルは文字描写が苦手だ。映像内でテキストを見せるのは避け、編集でオーバーレイするほうが確実で速い。

品質チェックリストと反復改善

生成したカットは、感覚ではなく項目で確認する。

  • 主題は一目で伝わるか
  • 主題と環境の関係は自然か
  • カメラの動きは1つに絞られているか
  • ライティングの方向は前後のカットと一致しているか
  • 色調と粒子感は統一されているか
  • 人物の顔は前のカットと同一に見えるか
  • 手や指に不自然な箇所はないか
  • 冒頭1秒で引きがあるか
  • 末尾は次のカットにつながるか

修正は「大きい問題から小さい問題へ」の順で行う。構図が違う状態で色を調整しても意味がない。

反復のコツは、1回の生成で得た結果を必ず記録することだ。うまくいったプロンプト、失敗したプロンプト、変更点を残しておくと、次回の立ち上がりが劇的に速くなる。

チームで運用するためのプロンプト資産化

個人の制作なら記憶でも回るが、チームになると仕組みが必要になる。

命名規則を決める

例:「案件名_カット番号_モデル_バージョン」のように統一する。後から探せるかどうかが、生産性を大きく左右する。

テンプレートを共有する

4ブロック構造のテンプレートを用意し、空欄を埋める形にする。属人的な書き方を減らせる。

レビューの観点を固定する

「主題の明確さ」「動きの安定」「一貫性」の3点で確認する。感覚的な批評ではなく、項目で合意できる。

再利用可能な部品をためる

ライティング記述、色調記述、カメラムーブの言い回しなど、再利用できるパーツを貯めておく。新しい案件でも、パーツを組み替えるだけで初稿が作れる。

よくある質問

Q. プロンプトは長いほど良いのですか

いいえ。長さよりも情報の整理が重要です。同じ内容を繰り返すと、モデルがどの指示を優先すべきか判断できず、結果が不安定になります。4ブロックに整理し、各ブロックを簡潔にまとめるのが基本です。

Q. 同じプロンプトでも結果が変わります。なぜですか

生成には確率要素が含まれるため、完全に同じ結果は出ません。ばらつきを抑えたい場合は、参照画像の併用、シード固定(対応している場合)、記述のテンプレート化を行います。また、1回で決めようとせず複数回生成して選ぶ前提で進めるのが現実的です。

Q. 実写風とアニメ風、どちらから始めるべきですか

作りたい映像から選んでください。実写風はカメラ用語が効きやすく、学習の入口として分かりやすい面があります。アニメ風は作画用語の習得が必要ですが、表現の幅は広いです。

Q. 動きのあるシーンがうまく作れません

動作を1つに絞り、ショットを短くし、カメラを固定すると安定します。複数の動作を同時に指定すると破綻しやすくなります。まず静止に近い状態で完成度を上げ、そこから動きを足していく順序が有効です。

Q. 商用利用で気をつけることはありますか

利用するモデルやサービスの規約、学習データの扱い、生成物の権利条件を事前に確認してください。人物に似た表現、商標、既存作品に近いスタイルは、たとえ意図がなくても問題になり得ます。社内で確認フローを決めておくと安心です。

Q. 上達を早める練習法はありますか

1つの題材を、ライティングだけ変えて5パターン作る練習が効果的です。変数を1つに絞ると、各指示が結果に与える影響を体感できます。これを数回繰り返すだけで、プロンプトの解像度が大きく上がります。

まとめ:設計する習慣が品質を決める

AI動画生成の品質は、モデルの進化だけでは決まらない。同じツールを使っても、設計図の精度で結果は何倍も変わる。押さえるべき要点は次のとおりだ。

  • モデルごとの得意分野を把握し、ショットに合わせて選ぶ
  • プロンプトを主題・環境・スタイル・モーションの4ブロックに分ける
  • カメラムーブは1ショット1つに絞る
  • 一貫性は参照とテンプレートで仕組み化する
  • 失敗は項目ごとに切り分けて1要素ずつ修正する
  • うまくいったプロンプトを資産として蓄積する

最初は4ブロックを意識するだけで十分だ。慣れてくれば、どのブロックを触ればどの変化が起きるのかが予測できるようになる。その感覚が身についたとき、AI動画生成は「運任せの作業」から「設計された制作工程」に変わる。

Alexander

Alexander