Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画生成のプロンプト設計術:ショットの意図を映像に落とし込む実践ガイド

Sep 23, 2026

ショット設計という考え方:プロンプトは「撮影指示書」である

AI動画生成のプロンプトは、魔法の呪文ではありません。撮影指示書です。監督がカメラマンに渡すコンテ、ショットリスト、ライティングプランを一枚に圧縮したものだと考えれば、書くべき情報が自然に見えてきます。指示書に必要なのは、被写体、動作、カメラの位置、レンズ、カメラの動き、照明、時間の長さ、そして「なぜその画が必要なのか」という意図です。逆に言えば、これらが抜け落ちたプロンプトは、AIが「もっとも無難な映像」で空欄を埋めてしまいます。無難な映像は平均点であり、記憶には残りません。

この記事で扱うのは、単発のクリップをきれいに出すコツではありません。複数のショットをつないで一本の映像として成立させるための、プロンプト設計とショット設計の技術です。短編映像、商品紹介、SNS用の縦型動画、音楽に合わせたモンタージュ。用途は違っても、必要な考え方は共通しています。

よくある誤解を先に潰しておきます。

  • 長いプロンプトほど良い:誤りです。長さではなく、情報の種類と優先順位が重要です。修飾語を十倍に増やしても、カメラの動きが書かれていなければカメラは止まったままです。
  • モデルを変えれば解決する:半分だけ正しい。モデルの得意分野は確かに違いますが、指示が曖昧なまま乗り換えても結果は同じです。まず設計、次にモデル選びです。
  • 一発で完璧な映像を出す:ほぼ不可能です。実務では一つのショットに対して複数回生成し、良いテイクを選び、必要なら一部だけ作り直します。映画撮影でもテイクを重ねるのと同じです。

つまり、AI動画生成は「プロンプトを書く作業」ではなく「ショットを設計し、検証し、選ぶ作業」です。この前提に立つと、作業の順番がはっきり変わります。

生成前に決める3つの前提:意図・トーン・尺

プロンプトを書き始める前に、三つの問いに答えてください。ここを飛ばすと、後工程でどれだけ修正しても収束しません。

1. 意図(誰に何を伝えるショットか)

そのショットを見た人が、次の瞬間に何を理解し、何を感じるべきかを一文で書きます。例:「主人公が決断したことを、観客に悟らせる」。この一文があるだけで、必要な画角と動きが絞り込まれます。決断を悟らせるなら、寄りの表情、わずかな呼吸、浅い被写界深度。逆に、決断の「結果」を見せるショットなら引きの画が必要です。

2. トーン(温度と質感)

映像の温度は、照明と色彩で決まります。暖色の柔らかい光は親密さと郷愁を、寒色の硬い光は緊張と孤立を生みます。コントラストを高くすれば不安や危険、低くすれば穏やかさや日常感が出ます。ここで大事なのは、作品全体で一つのトーンを決め、ショットごとに勝手に変えないことです。トーンは設計の一部であり、気分で決めるものではありません。

3. 尺(ショットの長さとテンポ)

生成できるクリップの長さには上限があります。そのため「一曲分」ではなく「数秒単位の積み木」として構成を考えます。目安として、情報を伝えるショットは長めに、感情を切り替えるショットは短めに。平均値を揃えるより、意図的に長短を作ったほうが編集でリズムが生まれます。

この三つを決めたら、いよいよプロンプトの構造に入ります。

プロンプトを構成する7つの要素

ショット設計のプロンプトは、次の七つの層で組み立てると過不足が出ません。順番もほぼこのままで構いません。AIモデルは前段の情報を強く参照する傾向があるため、重要な要素ほど前に置きます。

1. 被写体とアクション

誰が、何を、どのようにしているか。名詞だけでなく動詞を必ず入れます。「女性、カフェ、窓際」では止まった絵になります。「女性が湯気の立つカップを両手で包み、ゆっくり顔を上げる」まで書くと動きが生まれます。動作は一つか二つに絞るのがコツです。三つ以上入れると、どれも中途半端になります。

2. カメラワーク

静止(固定)、パン、チルト、ドリー、トラック、ズーム、クレーン、ハンドヘルド、オービット。動きの種類と方向、速さを指定します。ここを省略すると、モデルは勝手に「それらしい」揺れを加えてきます。

3. レンズと構図

広角、標準、望遠、マクロ。絞りの浅さ。アングル(ロー、ハイ、アイレベル)。被写体を画面のどこに置くか(三分割、中央、余白の位置)。レンズの指定は、パースと被写界深度を通じて画面の「意味」を変えます。

4. 照明と色彩

光源の種類と方向(逆光、サイド光、トップ光、実用光源)、硬さ、色温度、コントラスト、そして全体のカラーパレット。ここはトーン設計と直結します。

5. 時間とテンポ

クリップの長さ、動きの速さ、スローモーションの有無、時間経過の表現。

6. スタイルと質感

写実的か様式的か、フィルムグレインの有無、アニメ調、ミニチュア風、ドキュメンタリー風など。作品全体で固定する要素です。

7. 制約と除外

避けたい要素(不要な人物、文字、ロゴ、指の崩れ、過剰な動き)をネガティブ側に分けて書きます。

実際のプロンプトは、たとえば次のような構造になります。

[被写体とアクション] 40代の女性が古い手紙を読み、指先で紙の端をなぞる
[カメラ] 85mm相当の望遠、浅い被写界深度、ゆっくりとしたドリーイン、わずかなハンドヘルド感
[構図] アイレベル、被写体を画面右三分の一に配置、左に余白
[照明] 窓からの逆光、柔らかい拡散光、暖色寄り、低コントラスト
[時間] 6秒、動きは緩やか、呼吸の上下がわずかに見える
[スタイル] 写実的、微細なフィルムグレイン、彩度は控えめ
[除外] 文字、ロゴ、余計な人物、急なカメラ移動

この形に慣れると、修正すべき箇所が一目でわかるようになります。「なんか違う」という曖昧な不満が、「カメラの速度が速すぎる」という具体的な修正指示に変わります。

カメラワークを言語化する:動きの語彙と書き方

AI動画生成でもっとも差がつくのがカメラワークの指定です。映画用語を知っているだけで、結果は別物になります。ただし、用語を並べるだけでは不十分で、方向と速さと目的を添える必要があります。

用語 意味 プロンプトでの書き方の例
固定(Static) カメラを動かさない 固定カメラ、三脚、動きなし
パン(Pan) 水平に振る 左から右へゆっくりパン、被写体を追従
チルト(Tilt) 上下に振る 足元から顔へゆっくりチルトアップ
ドリー(Dolly) 前後に移動 被写体へ静かにドリーイン、背景が圧縮される
トラック(Track) 横方向に並走 被写体と同速で横移動、背景が流れる
ズーム(Zoom) レンズの焦点距離を変化 ゆっくりズームアウト、空間の広がりを見せる
クレーン(Crane) 上下に大きく移動 高い位置から地面へ降りるクレーンショット
オービット(Orbit) 被写体を周回 被写体を中心に半周、一定速度で回り込む
ハンドヘルド 手持ちの揺れ 軽い手持ちの揺れ、ドキュメンタリー的な臨場感

書き方の原則は三つです。第一に、動きは一つに絞る。ドリーとズームとパンを同時に指定すると、モデルはどれかを無視するか、すべてを誇張します。第二に、速さを形容する。「ゆっくり」「一定の速度で」「加速しながら」など、副詞が効きます。第三に、目的を添える。「背景の看板を明かすためにパン」と書けば、動きの終点が安定します。

もう一つの重要な技術が、動きの主語を分けることです。カメラが動くのか、被写体が動くのか、両方なのか。これを曖昧にすると、被写体が画面外に出て行ったり、カメラが被写体を追い越したりします。「カメラは固定、被写体が画面手前から奥へ歩く」のように、主語を明示してください。

マルチショットで一貫性を保つワークフロー

単発のクリップなら多少の揺れは許容できますが、複数ショットをつなぐと、わずかなズレが致命的になります。人物の顔、衣装の色、光の方向、レンズの圧縮感。これらがショットごとに変わると、観客は「別の作品を見ている」ような違和感を覚えます。

キャラクター記述のレジストリ化

もっとも効果的な方法は、人物の記述をテキストとして固定し、使い回すことです。年齢、髪型と色、肌のトーン、体型、衣装の素材と色、アクセサリー、表情の癖。これを一つの段落として書き、すべてのショットのプロンプトに同一の文言で貼り付けます。要約したり語順を変えたりすると、モデルは別の人物として解釈します。一字一句同じにするのが鉄則です。

[キャラクター固定ブロック]
30代前半の男性、短く整えた黒髪、日焼けした肌、細身だが肩幅がある、
濃紺のウールコート、白いシャツの襟、左手に銀色の腕時計

スタイルブロックの固定

キャラクターと同じく、映像の質感も固定ブロックにします。レンズの傾向、カラーパレット、グレインの量、コントラスト、参照したいジャンルの空気感。作品全体で一つに決め、ショットごとに変えないこと。ここを変えると、同じ人物が同じ場所にいても、別の日に撮影したように見えてしまいます。

ショットリストとテンポ設計

プロンプトを書く前に、ショットリストを表で作ります。各ショットについて、番号、目的、画角、カメラの動き、尺、必要なアクションを一行ずつ書く。この表があると、生成がうまくいかなかったときに「どの要素が欠けていたか」を特定できます。

# 目的 画角 カメラ 尺 アクション
1 場所の提示 超広角 固定 4秒 街の朝、人が行き交う
2 主人公の導入 中景 ゆっくりドリーイン 5秒 立ち止まり、上を見る
3 感情の転換 寄り 固定 3秒 目を細める、息を吐く
4 行動 望遠 横トラック 6秒 歩き出す、背景が流れる

ポイントは、尺を揃えないことです。すべて5秒にすると、編集でリズムが死にます。3秒と6秒を混ぜると、同じ素材でも呼吸が生まれます。

生成順序の最適化

最初にすべてのショットを本番クオリティで作ろうとすると、後半で方針が変わったときに全部やり直しになります。まず全ショットを低コストな設定で粗く作り、つながりを確認します。問題なければ、重要なショットから順に作り込んでいきます。編集のタイミングで「このショットは不要だった」と気づくことはよくあるので、最初から完璧を狙わないことが結果的に速くなります。

モデルの特性に合わせてプロンプトを調整する

テキストから動画を生成するモデルは、それぞれ得意分野が違います。同じプロンプトでも、あるモデルではカメラの動きが素直に反映され、別のモデルでは人物の造形が崩れます。モデル名を覚えることより、「どの系統のモデルか」を理解して使い分けることが実務では重要です。

リアリズム型と演出型

写実的な人物や自然な質感を得意とする系統は、控えめな動きと丁寧な照明指定に反応します。一方で、様式的な映像や大きなカメラ移動を得意とする系統は、動きの指示をはっきり書いたほうが伸びます。前者に「激しいオービット」を頼むと破綻しやすく、後者に「微細な表情の変化」を頼むと平板になります。

画像から動画への橋渡し

一貫性を最優先するなら、動画生成の前にキーフレーム画像を作る方法が有効です。画像生成でキャラクターとスタイルを固め、その画像を起点に動きだけを指定して動画化します。この方法の利点は、構図と人物がすでに確定しているため、モデルの自由度が下がり、ショット間のブレが減ることです。欠点は、動きの創造性が制限されること。動きの大きいショットは、テキストから直接生成したほうが自然な場合もあります。

パラメータの考え方

多くのツールには、動きの強さ、シード値、アスペクト比、フレームレートの設定があります。動きの強さは「指示の強さ」ではなく「変化量の上限」だと考えてください。強くすると忠実になるのではなく、大きく動きます。シード値を固定すれば同じ出発点を再利用できますが、内容を変えるとシードの意味は薄れます。アスペクト比は構図に直結するので、縦型なら縦型のつもりで最初から指定します。正方形で作って後から切ると、意図した余白が消えます。

乗り換えの判断基準

同じショットを三回生成して、三回とも同じ問題が出るなら、プロンプトの書き方を変えるべきです。三回とも別の問題が出るなら、モデルとの相性を疑ってください。この切り分けをしないと、延々とプロンプトを書き換え続けることになります。

ネガティブプロンプトの体系化

ネガティブプロンプトは「嫌いなものを並べる欄」ではありません。作品の一貫性を守るためのガードレールです。むやみに長くすると、必要な要素まで抑制されることがあります。カテゴリごとに整理し、優先度の高いものだけを残します。

構造のカテゴリ

  • 人体:指の本数、手の形、顔の歪み、余分な手足
  • 画面内の要素:文字、字幕、ロゴ、透かし、不要な人物
  • 動き:急激なカメラ移動、不自然なスローモーション、脈打つような揺れ
  • 質感:過剰なシャープネス、プラスチックのような肌、彩度の飽和、圧縮ノイズ
  • 構図:被写体の切断、極端な歪み、意図しない中央配置

書くときの原則

第一に、除外したい理由が説明できるものだけを書きます。「なんとなく嫌」で追加した語は、たいてい副作用を生みます。第二に、作品ごとに固定のセットを作り、ショット固有の除外は最小限に留めます。第三に、ポジティブ側で解決できるものはポジティブ側で書きます。「暗くしない」より「柔らかい拡散光で明るく」のほうが効果的です。否定形は、モデルにとって処理しにくい指示です。

よくある失敗と修正チェックリスト

生成結果が思い通りにならないとき、原因はたいてい数パターンに分類できます。以下の表を使って、症状から修正箇所を特定してください。

症状 考えられる原因 修正の方向
人物の顔がショットごとに変わる キャラクター記述の揺れ 固定ブロックを一字一句統一する
カメラが勝手に揺れる カメラ指定の欠落 「固定カメラ、三脚」を明示する
動きが速すぎる 速さの指定がない 「ゆっくり」「一定速度」を追加する
色味が毎回違う 照明記述の曖昧さ 光源の方向と色温度を数値感覚で書く
手や指が崩れる 手が画面で大きすぎる 画角を変える、手を画面外に置く
余計な人物が入る 除外指定の不足 ネガティブに「他の人物」を追加する
表情が硬い アクションが抽象的 具体的な動作と呼吸を書く
背景が溶ける 画面内の情報量過多 要素を減らし、被写界深度を浅くする

この表の使い方は簡単です。生成結果を見て、当てはまる症状を探し、右の列だけを実行します。複数の修正を同時に行うと、何が効いたのかわからなくなります。一度に一つずつ変えること。これは地味ですが、上達がもっとも速い進め方です。

実践:30秒の短編を1本作り切る手順

ここまでの内容を、実際の流れに落とし込みます。題材は「雨上がりの街で、傘を畳む人物」の30秒短編とします。

ステップ1:意図を一行で書く

「雨が止んだことに気づき、少しだけ前向きになる瞬間」。これがすべての判断基準になります。

ステップ2:トーンを決める

濡れた路面の反射、青みがかった残光、柔らかい拡散光、低めのコントラスト。彩度は控えめ。この段落は全ショットで固定します。

ステップ3:ショットリストを作る

6ショット構成にします。1) 濡れた路面の寄り、2) 傘の水滴のマクロ、3) 人物の中景、4) 傘を畳む手元の寄り、5) 顔の寄り、6) 歩き出す後ろ姿の引き。尺は3秒から6秒の範囲で配分します。

ステップ4:固定ブロックを用意する

キャラクター記述とスタイル記述を書き、テキストファイルに保存します。すべてのプロンプトに同じ文言で貼ります。

ステップ5:粗く全ショットを生成する

解像度と長さを抑えた設定で、6ショットすべてを一度作ります。この段階では美しさを求めません。つながりと方向性の確認だけを行います。

ステップ6:問題ショットを特定する

尺が合わない、動きの方向が逆、光の向きが揃わない。こうした問題をメモし、ショットリストを更新します。

ステップ7:重要な3ショットを作り込む

顔の寄り、手元、歩き出す後ろ姿。この三つが作品の印象を決めるので、繰り返し生成して良いテイクを選びます。

ステップ8:編集でつなぐ

つないだときに、動きの方向が揃っているかを確認します。前のショットが左へ流れ、次のショットが右へ流れると、観客は無意識に混乱します。方向の連続性は、色の一致以上に効きます。

ステップ9:音を後から設計する

映像だけでは感情の強弱が伝わりにくい場面は、環境音と無音の切り替えで補います。雨音が止む瞬間、足音が始まる瞬間。音の設計はショット設計の延長線上にあります。

この手順を一度通せば、次回からはショットリストの作り方が速くなります。二本目、三本目と作るうちに、自分のプロンプトの癖と、モデルの癖が見えてきます。

FAQ:ショット設計とプロンプトの疑問

プロンプトは英語で書くべきですか、日本語で書くべきですか

モデルが日本語を解釈できるなら、日本語で構いません。ただし、カメラ用語や映像の専門語は英語のほうが精度が高いことがあります。実務的には、日本語で意図を書き、カメラとレンズの用語だけ英語を併記する方法が安定します。もっとも確実なのは、同じ内容を両方で試して、自分の環境で結果が良いほうを選ぶことです。

プロンプトの理想的な長さはありますか

七つの要素が過不足なく書けていれば、長さは問題ではありません。ただし、修飾語を重ねるほど各要素の重みが薄まる傾向があります。目安として、被写体と動きで二文、カメラで一文、照明とスタイルで一文、除外で一文。これで足ります。

ショットの長さはどれくらいが適切ですか

生成できる上限の中で、伝える情報量で決めます。状況説明は長め、感情の切り替えは短め。編集を前提にするなら、短めに作って必要に応じて伸ばすより、長めに作って切るほうが自由度が高いです。ただし、長いクリップほど後半で動きが破綻しやすくなる点は覚えておいてください。

一貫性を保つ最優先の方法は何ですか

キャラクターとスタイルの記述を完全に固定し、すべてのプロンプトで同じ文言を使うことです。これだけで問題の半分は消えます。次に効くのは、画像を起点にした生成です。

生成結果が毎回違うのはなぜですか

多くのモデルは、同じ入力でも毎回異なる結果を返します。シード値が固定できる場合は固定し、できない場合は「同じプロンプトで複数回生成し、良いテイクを選ぶ」という前提で作業を組み立てます。一回で決めようとすると、かえって時間がかかります。

撮影の知識がないと難しいですか

必要なのは、撮影の経験ではなく、語彙です。カメラの動き、レンズ、照明の用語を数十個覚えれば、表現の幅は大きく広がります。逆に、語彙がないまま感覚だけで書くと、同じ結果に何度もたどり着けません。用語は、意図を伝えるための共通言語です。

複数のモデルを使い分けるべきですか

作品単位で見れば、すべてのショットを同じモデルで作るほうが一貫性は高くなります。ただし、どうしても再現できない動きや質感がある場合は、そのショットだけ別のモデルで作り、色調整とグレインで馴染ませる方法が現実的です。使い分けるなら、撮影の段階で混ぜるのではなく、編集の段階で統一感を作ります。

上達するには何を練習すればよいですか

一つの静止画から始めて、そこに動きを一つだけ足したクリップを作る練習が効果的です。固定、パン、ドリー、オービットを順に試し、それぞれの表現効果を体で覚えます。次に、同じ人物を三つの異なるショットで作る練習をします。この二つを繰り返すだけで、プロンプトの解像度は驚くほど上がります。

まとめ:設計が先、生成は後

AI動画生成の品質を左右するのは、モデルの性能だけではありません。意図を言葉にし、ショットを設計し、一貫性を守るための記述を固定する。この地味な工程が、結果の差になります。プロンプトは呪文ではなく指示書であり、指示書は書く順番と構造が決まっていれば、誰でも一定の水準まで到達できます。

今日からできる最初の一歩は、次に作りたい映像について、ショットリストを一枚の表に書き出すことです。番号、目的、画角、カメラ、尺、アクション。六つの列を埋めるだけで、生成の成功率は目に見えて変わります。生成を始めるのは、その後です。

Alexander

Alexander