生成AIを使った映像制作は、もはや「動く絵が出れば十分」という段階ではありません。短尺のSNS広告から企業のブランドムービー、商品紹介、音楽ビデオまで、視聴者は当たり前にシネマティックな画を期待しています。一方で、制作に割ける予算と納期は年々厳しくなっています。このギャップを埋める鍵は、高性能な生成モデルそのものよりも、その手前にあるショット設計にあります。
本記事では、限られた予算で映画品質に近づけるためのショット設計を、企画の分解からプロンプト設計、生成の進め方、編集、失敗時のリカバリまで、ひと続きのワークフローとして整理します。特定のツールに依存しない形で説明するため、どの生成環境でも応用できるはずです。
なぜショット設計がコストを決めるのか
AI動画生成の費用対効果を語るとき、多くの人はモデルの単価や解像度の話に飛びつきます。しかし実際に予算を食うのは、生成そのものではなく作り直しです。曖昧な指示で生成し、意図と違う絵が出て、また生成し直す。このループが10回、20回と積み重なれば、単価の安さは簡単に吹き飛びます。
さらに厄介なのは、やり直しが「見えないコスト」だという点です。生成の待ち時間、確認の手間、編集での再調整、関係者への再確認。これらは請求書に現れませんが、確実に納期と品質を削ります。設計を詰めることは、こうした見えないコストを削る作業だと言い換えてもいいでしょう。
コストが膨らむ3つの典型的な原因
第一に、指示の抽象度が高すぎることです。「かっこいい街の夜景」では、時間帯、天候、レンズ、カメラの高さ、被写体の位置がすべて運任せになります。運任せの結果は再現できず、別のカットで同じ雰囲気を再現しようとしても失敗します。
第二に、尺とカット数の見積もり誤りです。30秒の動画に必要なカット数を決めずに走り出すと、途中で尺が足りない、あるいは余るという事態が起きます。尺が足りない場合は無理な引き伸ばしが発生し、余った場合は捨てるしかありません。どちらも損失です。
第三に、一貫性の欠如です。同じ人物がカットごとに別人になり、同じ部屋がカットごとに別の部屋になる。使えるカットが減るということは、生成した回数のうち何割かが無駄になったということです。
「安く作る」ではなく「作り直しを減らす」
低コスト化の本質は、単価の安いツールを探すことではなく、やり直しの回数を減らすことです。設計に1時間かけることが、生成10回分の節約になり得ます。逆に言えば、設計を省いた制作は、どれだけ優れたツールを使っても高くつきます。だからこそ、撮る前の工程にこそ投資対効果が集中します。
ショットを「情報の単位」として分解する
ショット設計で最初に身につけるべき考え方は、1カット=1情報という原則です。1つのカットに「人物の表情」「街の広さ」「商品の質感」を全部詰め込もうとすると、AIはどれも中途半端に処理します。人間の編集者も、そのカットをどこで使えばいいのか判断できません。
ショットの3要素:被写体・カメラ・ライト
どんなショットも、次の3要素に分解できます。
- 被写体:誰が/何が、何をしているか。服装、表情、動作の速度、視線の向き。
- カメラ:距離(ロング/ミディアム/クローズアップ)、高さ(ロー/アイレベル/ハイ)、動き(固定/パン/ドリー/手持ち)、レンズ感(広角/標準/望遠)。
- ライト:光源の種類(自然光/実用光/ストロボ)、方向(順光/逆光/サイド)、色温度(暖色/寒色/混合)。
この3要素を文章で書き出せれば、それはそのままプロンプトの骨格になります。逆に、この3要素が言語化できないうちは、何度生成しても結果は安定しません。まず紙に3要素を書く。これが最短の上達ルートです。
カット尺とテンポの設計
尺の目安を持っておくと、必要なカット数が逆算できます。
| 用途 | 平均カット尺 | 30秒あたりの目安カット数 |
|---|---|---|
| 商品紹介・短尺広告 | 1.5〜2.5秒 | 12〜18 |
| ブランドムービー | 2.5〜4秒 | 8〜12 |
| チュートリアル・解説 | 3〜6秒 | 5〜8 |
| 音楽ビデオ | 1〜3秒 | 12〜25 |
重要なのは、平均値ではなく緩急です。すべてのカットを2秒で揃えると単調になり、すべてを5秒にすると退屈になります。導入は長め、山場は短め、締めは再び長め。この波形を先に決めておくと、必要なカットの種類が見えてきます。
撮る前の準備:企画を生成AIが扱える形に翻訳する
従来の映像制作は、脚本→絵コンテ→ショットリスト→撮影という順序で進みます。生成AIのワークフローでもこの順序は有効ですが、決定的な違いがひとつあります。AIは行間を読まないということです。脚本に「彼は疲れている」と書いてあっても、AIはそれを画に変換できません。「目の下のくま、肩を落とした姿勢、青みがかった照明、口元の力が抜けた表情」まで書く必要があります。
ログライン→シーン→ショットの3階層
- ログライン:動画全体を1〜2文で表す。「朝の光の中で、ひとり暮らしの静かな豊かさを描く30秒」。
- シーン:場所・時間・目的が変わる単位で分割する。「キッチン/朝」「リビング/朝」「玄関/出発前」。
- ショット:1カット1情報に従って切り分ける。「ケトルから湯気が立つ寄り」「窓辺でカップを持つ手元」。
企業案件でよくある失敗は、いきなりショットから作り始めることです。シーンの目的が曖昧なままショットを量産すると、編集段階で「このカットは何のために撮ったのか」が誰にも分からなくなります。
キャラクターシートと世界観メモの作り方
人物が複数カットに登場する場合、外見を固定する情報を1枚にまとめます。年齢、髪型、髪色、瞳の色、肌のトーン、体格、服装、小物、そして「表情の傾向」。これを毎回のプロンプトに同じ言葉で貼り付けます。
環境も同じです。時間帯、天候、主要な色、建築様式、家具の雰囲気、小道具の配置。特に色は重要で、「木目の茶」「生成りの布」「鈍い真鍮」のように具体名で書くと、カット間の統一感が格段に上がります。
参照画像の整備
参照画像を使える環境なら、人物ごとに3〜5枚を用意します。正面、斜め45度、引きの全身、寄りの顔。色味を揃えることが重要で、暖色と寒色が混ざった参照セットは、かえって一貫性を壊します。背景が無地に近いものを選ぶと安定します。
ショットリストとプロンプト設計の実務フォーマット
ここからは具体的なフォーマットです。表計算ソフトでもメモ帳でも構いませんが、列を固定すると抜け漏れが減ります。列の例は「カット番号/秒数/被写体/アクション/カメラ/ライト/スタイル/備考」です。
プロンプトの5ブロック構造
プロンプトは次の5ブロックに分けて書くと、修正箇所を特定しやすくなります。
- 被写体:30代の女性、黒いタートルネック、短いボブヘア
- アクション:窓辺でカップを持ち上げ、静かに微笑む
- カメラ:ミディアムクローズアップ、アイレベル、ゆっくりしたプッシュイン、85mm相当
- ライト:逆光の朝日、柔らかい拡散光、暖色寄り
- スタイル:フィルムグレイン、浅い被写界深度、自然な肌の質感
この構造の利点は、問題が起きたときにどのブロックを直すかを判断できることです。人物が崩れたら被写体ブロック、動きが破綻したらカメラブロック、色が合わなければライトブロックを見直します。全部を書き換える必要はありません。
ネガティブ指定の使い方
除外指定は「あれば便利」程度に考え、依存しすぎないのがコツです。有効なのは「画面内の文字」「ロゴ」「余分な指」「速いパン」「過度な彩度」「ゆがんだ手」など、繰り返し発生する具体的な問題です。逆に「下手な絵」のような抽象的な除外語は効果が薄く、プロンプトを長くするだけです。
一貫性を保つ記述ルール
- 語順を固定する。毎回同じ順番で書く。
- 言い換えない。「柔らかい光」を別カットで「優しい光」と書かない。
- 参照画像のセットを固定する。カットごとに変えない。
- カメラ記述だけをカットごとに変える。被写体とライトは極力共通化する。
この4つを守るだけで、使えるカットの割合は体感で大きく変わります。
生成フェーズ:プレビュー先行で手戻りを減らす
まず低解像度・短尺でラフを作る
いきなり高解像度・長尺で生成するのは、最も費用がかさむ進め方です。まずは短い尺と低い解像度で全カットを仮生成し、編集ソフトでつないでみます。この段階で確認するのは画質ではなく、尺とリズムと情報の過不足です。
この「アニマティック工程」を挟むと、構成の修正が生成のやり直しではなく編集の並べ替えで済みます。並べ替えは無料ですが、再生成は無料ではありません。
モデルの選び分け
生成環境を複数使える場合、カットごとに得意分野で選び分けます。
| 重視する点 | 向いているカット | 判断の目安 |
|---|---|---|
| 速度と反復 | ラフ、構成検討、テスト | 短尺で数多く試す |
| 質感とディテール | 主観カット、寄り、製品 | 1カットに時間をかける |
| カメラ制御 | ドリー、パン、回り込み | 動きの再現性を優先 |
| スタイル化 | 世界観の演出、抽象表現 | 一貫した画風を優先 |
すべてのカットを同じエンジンで作る必要はありません。ただし、同じシーン内では混ぜすぎないこと。質感が揃わないと、編集でつないだときに違和感が出ます。
生成回数を管理する
1カットあたりの試行上限を先に決めます。たとえば6回。上限に達したら、プロンプトをいじるのをやめて設計に戻ります。同じプロンプトの語尾を変え続けても、根本的な問題は解決しません。上限ルールは、無限ループから抜け出すための安全装置です。
編集とポスト:最後の2割で見え方が決まる
つなぎの技術
- アクションつなぎ:前カットの動作を次カットで継続させる。
- マッチカット:似た形や動きでつなぐ。丸いカップから丸い時計へ、など。
- ジャンプカット:同一構図で時間を飛ばす。テンポを上げたいときに有効。
- 音先行:次カットの音を先に鳴らし、画を後から合わせる。
AI生成のカットは動きの起点と終点が曖昧なことが多いため、アクションつなぎと音先行が特に効きます。
音が8割
映像の印象は音で大きく変わります。環境音を敷き、動作に効果音を当て、BGMで感情の波を作る。無音のカットは意図がない限り避けます。AI生成特有のノイズや不自然な動きは、環境音と効果音でかなり隠せます。
カラーと粒子の統一
カットごとに色温度が違うと、どれだけ画が良くても素人っぽく見えます。基準となるカットを1つ決め、そこに全カットを寄せます。LUTを1つ決めて全体に適用し、その上で微調整するのが現実的です。粒子感も同様に、弱めのグレインを全体にかけると統一感が出ます。
よくある失敗と対処法
キャラクターが別人になる
原因の多くは、プロンプトの記述ゆれか参照画像の不一致です。対処は、人物記述を1つのテキストブロックとして固定し、コピー&ペーストで使い回すこと。参照画像は同一セットを使い続けます。カットを分けずに1カットを長くして対応するのも有効です。
カメラが勝手に動く/被写体が溶ける
動きの指示が過多か、逆に曖昧すぎる場合に起きます。「ゆっくり」「一定速度」など速度の形容を加え、動きの種類を1つに絞ります。溶ける現象は尺が長すぎることでも起きるため、カット尺を短くして分割するのが定石です。
手・文字・反射が崩れる
手や文字は生成が苦手な領域です。手は画面外に出す、手袋や小物で隠す、寄りすぎない。文字は生成せず、編集ソフトで後から載せる。鏡やガラスの反射は、映り込みを減らす構図に変えるか、反射をぼかす指示を加えます。
動きが速すぎる/遅すぎる
カット尺の設計ミスであることがほとんどです。速すぎるなら尺を伸ばすのではなく、動作をゆっくり指示し直すか、スロー編集で対応します。遅すぎる場合は、動作を2つのカットに分割してテンポを作ります。
低コストを維持するための運用ルール
配分の目安
設計・生成・編集の工数を、たとえば4:3:3で配分します。設計に4割を割くのは多いと感じるかもしれませんが、後工程の手戻りを減らす効果を考えると妥当です。逆に、生成に8割を割いている制作は、ほぼ確実に作り直しで消耗しています。
素材の再利用設計
同じ背景、同じ人物、同じライトで撮れるカットを意図的に増やします。1つのシーンから複数のカットを切り出す設計にすると、設定の再現コストが下がります。編集で使わなかったカットも、次回の別案件に流用できる形で保存しておくと資産になります。
外注との分業
すべてを内製する必要はありません。ショット設計と編集を内製し、生成だけを外注する分業は相性が良い形態です。逆に、設計を外注して生成を内製すると、指示の意図が伝わらず手戻りが増えがちです。
ケーススタディ:30秒の商品プロモを組み立てる
朝のキッチンを舞台にした30秒の商品プロモを例にします。カット数は12、平均2.5秒で設計します。
- 窓から差し込む朝光(3秒・固定・ロング)
- ケトルから立つ湯気の寄り(2秒・固定・クローズ)
- カップに注ぐ手元(2秒・やや俯瞰・寄り)
- 人物の横顔(3秒・アイレベル・ミディアム)
- 商品を手に取る動作(2秒・固定・ミディアムクローズ)
- 商品のディテール(2秒・マクロ・浅い被写界深度)
- 窓辺で一口飲む(3秒・逆光・ミディアム)
- 視線を上げる(2秒・プッシュイン)
- 外の光とカーテン(2秒・固定)
- 商品を置く手元(2秒・寄り)
- 部屋全体を引く(3秒・固定・ロング)
- ロゴと余韻(4秒・静止画+テキスト)
この構成のポイントは、被写体とライトを全カットで共通化し、カメラだけを変えていることです。人物記述ブロックを固定できるため、一貫性が保ちやすくなります。12カットのうち9カットが同じ人物・同じ部屋で完結するので、環境設定の再現コストも小さく済みます。
FAQ
予算感の目安はどう考えればいいですか
生成にかけられる量ではなく、作り直しの許容量で考えます。「1カットあたり何回まで試せるか」を先に決め、その範囲で収まるようカット数を調整するのが現実的です。カット数を減らすことは、最も確実なコスト削減です。
無料のツールだけでもプロ級は作れますか
作れますが、条件があります。ショット設計を丁寧に行い、カット数を絞り、編集と音に力を入れることです。逆に、設計を省いて高機能なツールだけを使っても、結果は良くなりません。差を生むのはツールではなく工程です。
実写とAI生成は混ぜてもいいですか
問題ありません。むしろ、人物の手元や小道具など実写が強い部分を実写で補い、広い画や非現実的な画を生成で作るハイブリッドは、コストと品質のバランスに優れています。色味とグレインを揃えることだけ意識してください。
日本語のプロンプトでも大丈夫ですか
対応状況は環境によりますが、判断の基準は「曖昧さが残らないか」です。日本語で具体度を上げられるなら日本語で構いません。英語の方が語彙の選択肢が広いと感じる場合は、カメラ用語だけ英語にする折衷案も有効です。
スタイルを真似すると権利上問題になりますか
特定の作家名や作品名をそのまま指定するのは避け、雰囲気を要素に分解して記述するのが安全です。「フィルムグレイン」「低彩度」「自然光」「浅い被写界深度」のように、技術的な要素として書けば、再現性も上がります。
まとめ:設計に時間を使うほど、制作は速く安くなる
低予算でプロ級の映像を作る方法は、魔法のツールを探すことではありません。1カット1情報に分解し、被写体・カメラ・ライトを言語化し、全カットで共有できる部分を固定し、ラフで構成を固めてから本生成に進む。この順序を守るだけで、作り直しは目に見えて減ります。
そして、この工程は一度身につけばどんなツールにも移植できます。生成環境が変わっても、ショット設計の考え方は古びません。まずは30秒の短い動画を1本、カットリストを書き出すところから始めてみてください。




