AI動画制作の全体像:プロンプトは「注文」ではなく「仕様書」
テキストから動画を生成するツールが一気に身近になり、数行のプロンプトから数秒から十数秒の映像を出力できるようになりました。ところが実際に手を動かしてみると、多くの人が同じ壁にぶつかります。それらしい映像は簡単に出せるのに、意図した映像を安定して出すのは驚くほど難しい、という壁です。
この差を生む最大の原因は、プロンプトの捉え方にあります。プロンプトは「こういう感じの動画を作って」と丸投げする注文票ではありません。撮影監督に渡す仕様書であり、絵コンテであり、カメラの設定表です。被写体が何で、どこにいて、どう動き、カメラがどう動き、光がどこから来て、どんな質感で、何秒続くのか。これらを分解して記述できる人ほど、出力のブレは小さくなります。
動画生成のワークフローは、大きく次の流れで捉えると整理しやすくなります。
- 企画と目的の定義(誰に何を伝える映像か)
- 絵コンテとショットリストの作成(カット割り)
- プロンプト設計(各カットの仕様記述)
- 生成と選別(複数候補から採用テイクを選ぶ)
- 編集・音・カラー調整
- 書き出しと配信
初心者がつまずきやすいのは、いきなり3番から始めてしまうことです。ショットリストがないままプロンプトを書き始めると、出てきた映像をつなげても物語にならず、結果として何度も作り直すことになります。まず「何カット必要か」を決め、そのうえで各カットを仕様化する。この順番を守るだけで、作業時間は大きく変わります。
プロンプト設計の基本構造
5要素テンプレートで書く
動画生成のプロンプトは、次の5要素に分けて書くと安定します。
- 被写体:誰が、何が、どんな見た目で(年齢感、服装、素材感、色)
- 動作:何をするか、どのくらいの速度で、どんな順序で
- カメラ:ショットサイズ(寄り・引き)、アングル、動き(固定、パン、ドリー、オービット)
- 光と環境:時間帯、光源の方向、天候、背景の要素
- スタイル:実写風、アニメ調、フィルムグレイン、色調、レンズ感
たとえば「公園を歩く女性」では情報が足りません。次のように具体化します。
30代の女性が、朝の光が差し込む並木道をゆっくり歩く。ミディアムショット、腰の高さから。カメラは被写体と並走して前方にゆっくり移動。逆光で髪の輪郭にリムライト。浅い被写界深度、35mm相当のレンズ感、落ち着いた暖色の色調。
この粒度になると、出力の再現性が上がります。「ゆっくり」といった曖昧語は、可能なら「1秒に1歩程度」のように数値化できるとさらに安定します。
ショットリストに分解する
1本の動画は、1つのプロンプトで作るものではありません。30秒の映像なら、6秒×5カット程度に分けるのが現実的です。
| カット | 役割 | ショットサイズ | カメラ | 長さ |
|---|---|---|---|---|
| 1 | 状況提示 | ロング | 固定 | 5秒 |
| 2 | 被写体紹介 | ミディアム | ゆっくりドリー | 5秒 |
| 3 | ディテール | クローズアップ | 固定 | 4秒 |
| 4 | 変化・動作 | ミディアム | ハンドヘルド風 | 6秒 |
| 5 | 締め | ワイド | ゆっくり引き | 6秒 |
カットごとに「この1カットで何を伝えるか」を1文で書いておくと、プロンプトが膨らみすぎません。1つのプロンプトに複数の出来事を詰め込むと、モデルはどれかを犠牲にします。1カット1アクションが原則です。
ネガティブ指定と禁止事項を分けて考える
避けたい要素は、ネガティブプロンプトとして指定できる場合と、プロンプトの書き方で回避する場合があります。
- 指の崩れ、余分な手足、文字の混入は、ネガティブ指定が効きやすい典型例です
- 構図の崩れは、ショットサイズを明示するほうが効果的です
- 被写体の変形は、参照画像を併用するほうが確実です
ネガティブ指定を長くしすぎると、有効な要素まで弱まることがあります。まずは5項目程度に絞り、効果を見ながら調整するのが実務的です。
モデル選定の判断基準
動画生成モデルは日々入れ替わりますが、選び方の軸はそれほど変わりません。判断基準は「品質」「制御性」「速度」「コスト」「尺」の5つです。
プレミアム系モデルを選ぶべきケース
- 人物の顔や手が大きく映るカット
- 物理的な動きの説得力が求められるカット(水、布、煙、衝突)
- クライアント提出や広告用途で、細部の粗さが許されない案件
- 1カットだけ極端に品質を上げたい「見せ場」
プレミアム系は生成に時間がかかり、試行回数も限られます。そのため、いきなり本番カットで試すのではなく、同じプロンプトを短い尺でテスト生成して構図を確認してから本番に進むと無駄が減ります。
ミッドレンジ・オープン系モデルを選ぶべきケース
- ラフ段階の絵コンテ検証
- 背景のみ、あるいは人物が小さく映るカット
- 大量のバリエーションが必要なA/Bテスト
- 社内共有用のドラフト
ラフは安価なモデルで大量に回し、採用が決まったカットだけ高品質モデルで作り直す。この二段構えが、時間と予算の両方を守る最も現実的な方法です。
特殊用途モデルを使い分ける
- リップシンク:話している人物の口の動きを音声に合わせる
- モーション転送:参照動画の動きを別のキャラクターに移す
- アップスケール:解像度を上げて配信用に仕上げる
- インターポレーション:フレームを補間して滑らかにする
これらは単体で使うより、パイプラインの後工程として組み込むほうが効果を発揮します。たとえば生成した6秒クリップをアップスケールし、フレーム補間をかけ、最後にリップシンクを適用する、という順序です。順序を逆にすると、せっかくの同期が崩れることがあります。
一貫性を保つための実践テクニック
複数カットをつなげたとき、最も目立つ破綻は「同じ人物なのに別人に見える」「同じ部屋なのに家具の配置が違う」という一貫性の崩れです。ここは技術的な工夫でかなり改善できます。
参照画像とシード値を固定する
キャラクターの一貫性を出す最も確実な方法は、参照画像を使うことです。正面、斜め45度、横顔の3枚を用意し、全カットで同じ参照を指定します。シード値が固定できるモデルなら、シードも合わせて記録します。
記録しておくべき項目は次のとおりです。
- 使用モデルとバージョン
- プロンプト全文(ネガティブ含む)
- シード値
- 参照画像のファイル名
- アスペクト比と解像度
- 生成日時
これを表計算ソフトでもよいので台帳にしておくと、後から「あのカットだけやり直したい」というときに確実に再現できます。
環境・衣装・小物を言葉で固定する
参照画像だけでは背景の一貫性は保てません。背景は言葉で固定します。
- 部屋なら「白い壁、左手に木製の棚、窓は右上」のように位置まで書く
- 屋外なら「舗装された歩道、右側に低い生け垣、遠景に鉄塔」のように要素を列挙する
- 衣装は「紺のニット、白いシャツの襟、シルバーの時計」のように素材と色まで指定する
同じ説明的な枕詞を毎カットで繰り返すのは冗長に見えますが、一貫性のためには有効です。テンプレート化して使い回すとよいでしょう。
ショット間のつなぎを設計する
カットが切り替わるとき、視線の方向と動きのベクトルが連続していると、視聴者は自然につながりを感じます。
- 前カットで右へ歩き始めたら、次カットも右方向の動きから始める
- 前カットが寄りなら、次は引きにして空間を見せる
- 動作の途中で切ると、次のカットで動作を完了させるとリズムが出る
生成段階では各カットが独立しているため、このつながりは編集で作り込みます。したがって、生成時に「動きの余白」を前後に1秒ずつ多めに確保しておくと、編集で切りやすい素材になります。
映像制作パイプライン:プリプロから書き出しまで
プリプロダクション
最初に決めるのは、尺、アスペクト比、配信先です。縦型のショートは横型の広告とは構図が根本的に変わります。縦型なら被写体を中央に置き、上下に余白を作らない。横型なら左右の空間を使って情報を足す。これを決めずに生成を始めると、後から全カットを作り直すことになります。
次にトーンを決めます。参照する既存映像を3本程度選び、共通する色調、カメラの動き、カットのテンポを言語化します。「暗めで静か、カメラは固定中心、カットは長め」といった具合です。
生成フェーズ
生成は、いきなり全カットを回さず、次の順序で進めます。
- 各カットの代表フレームを静止画で作る(構図の確定)
- 静止画を動画化して4〜6秒のテストを生成する
- 動きと光を確認し、プロンプトを調整する
- 採用した設定で本番尺を生成する
- 1カットにつき2〜4本の候補を出し、最も良いものを選ぶ
この流れの利点は、失敗が早く分かることです。動画生成は1回あたりの待ち時間が長いため、構図の誤りを動画で発見するのは非効率です。静止画段階でつぶしておくと、無駄な待ち時間が激減します。
ポストプロダクション
生成されたクリップは、そのままでは作品になりません。
- 選別:候補を並べて見比べ、手の崩れや不自然な動きがあるものを外す
- 速度調整:動きが速すぎる場合は0.8倍程度に落とすと自然になることがある
- 安定化:わずかな揺れが気になる場合に適用する
- カラー調整:全カットに共通のルックを適用して統一感を出す
- 音:環境音、BGM、効果音、必要ならナレーション
- 字幕:縦型では特に重要
音は後回しにされがちですが、体感品質への影響は映像以上です。無音のまま編集を進めると、テンポの判断を誤ります。早い段階で仮のBGMを当てておくと、カットの長さが自然に決まります。
よくある失敗と回避策
プロンプトが長すぎて何も伝わらない
要素を詰め込むほど、モデルは優先順位を失います。1カット1アクション、修飾語は10個以内を目安に削ります。
動きが不自然になる
原因は大きく3つです。動きの指示が抽象的、尺が短すぎる、あるいは1カットに複数の動きを入れている。対策は、動きを1つに絞り、尺を6秒以上に伸ばすことです。
顔が毎回変わる
参照画像を使っていない、あるいは参照画像の角度が偏っていることが原因です。正面だけでなく複数角度を用意し、衣装の記述も統一します。
文字が崩れる
生成モデルは文字の描画が苦手です。映像内に文字を入れず、編集段階でテロップとして乗せるのが基本です。どうしても看板などの文字が必要な場合は、短い単語に留めます。
解像度が足りない
最初から高解像度で生成すると待ち時間が伸びます。低解像度で構図を確定し、採用カットだけアップスケールするほうが効率的です。
編集で切れない
生成クリップの前後がぎりぎりまで動いていると、つなぎ目が不自然になります。各カットの前後に静止に近い余白を1秒程度確保しておきます。
実践例:30秒の商品紹介動画を作る
ここまでの内容を、実際の短い案件に当てはめてみます。題材は、卓上サイズのコーヒーミルの紹介動画とします。
カット設計
| カット | 内容 | 尺 | モデル方針 |
|---|---|---|---|
| 1 | 朝のキッチン、窓辺に置かれたミル | 5秒 | ミッドレンジ(背景のみ) |
| 2 | 手がミルを掴み上げる | 4秒 | プレミアム(手が大きく映るため) |
| 3 | 豆を入れるクローズアップ | 5秒 | プレミアム(質感が主役) |
| 4 | ハンドルを回す動作 | 6秒 | プレミアム(動きの説得力が必要) |
| 5 | 抽出されたコーヒーが注がれる | 5秒 | プレミアム(液体表現) |
| 6 | 完成したカップと商品の並び | 5秒 | ミッドレンジ |
手や液体が映るカットは品質が露呈しやすいため、上位モデルに寄せます。背景だけ、あるいは静止に近いカットはミッドレンジで十分です。
プロンプト例(カット4)
木製のコーヒーミルのハンドルを、右手でゆっくり一定のリズムで回す。クローズアップ、やや上方からのアングル。カメラは固定。朝の自然光が左の窓から差し込み、金属部分に細いハイライトが入る。木目の質感と微細な粉の飛散が見える。35mm相当、浅い被写界深度、暖色寄りの色調。
ネガティブ指定は「余分な指、変形した手、文字、ロゴ、過度な手ぶれ」程度に絞ります。
編集のポイント
- カット3とカット4の間は、動作の途中で切ると弾みが出ます
- カット5は0.9倍に減速すると液体の動きが上品になります
- 全カットに同じカラールックを適用し、色温度を揃えます
- 環境音(豆が擦れる音、抽出の音)を重ねると一気に実在感が出ます
- 最後の2秒で商品名と一言コピーをテロップで表示します
この構成なら、生成するクリップは6本、候補を含めても20本前後です。1日から2日で十分に形になります。
チームで運用するときの設計
個人制作と違い、チームで回す場合は再現性が最優先になります。次の3点を決めておくと、属人化を避けられます。
- 命名規則:案件名_カット番号_バージョン(例:coffee_c04_v02)
- プロンプト台帳:誰がどの設定で生成したかを1か所に集約する
- レビュー基準:構図、一貫性、動きの自然さ、尺の4項目で採点する
レビューは感覚で「なんか違う」と言い合うと収束しません。「カット2の手の指が6本に見える」のように、修正対象を具体化してから差し戻します。また、修正が必要なカットはプロンプトを少しずつ変えず、1回に1変数だけ変えて比較するのが原則です。複数を同時に変えると、何が効いたのか分からなくなります。
FAQ
Q. どのモデルから始めればよいですか
まずは無料枠や低価格枠のあるモデルで構図の検証を始め、手や顔が大きく映るカットだけ上位モデルに切り替えるのが失敗の少ない順序です。最初から最高品質のモデルだけを使うと、試行回数を確保できず、結果として完成度が下がることがあります。
Q. 1本の動画に何カット必要ですか
15秒なら3〜4カット、30秒なら5〜7カット、60秒なら10〜14カットが目安です。1カットあたり4〜6秒を基本にすると、生成の手間と見栄えのバランスが取れます。
Q. プロンプトは英語と日本語のどちらがよいですか
モデルによって得意な言語は異なります。迷った場合は、主要な要素を英語で書き、補足を日本語で足すのではなく、どちらか一方に統一したほうが再現性が高まります。同じプロンプトを両言語で試し、安定するほうを採用するのが確実です。
Q. 生成した映像が実写に見えません
レンズの焦点距離、被写界深度、光源の方向、フィルムグレインの有無を明示すると改善します。特に「光源の方向」は見落とされがちで、効果が大きい要素です。
Q. 尺が足りないと言われました
生成で尺を延ばすより、編集で複数カットをつないで尺を作るほうが安定します。1カットを無理に長くすると、動きが破綻しやすくなります。
Q. 同じ人物を別の動画にも登場させたい
参照画像セットとプロンプトテンプレートを保存しておけば、別案件でも同じ人物を再現できます。衣装だけを差し替える運用にすると、バリエーションを出しやすくなります。
Q. 音声はどう作ればよいですか
まず映像を確定させ、その尺に合わせてBGMと効果音を配置します。ナレーションが必要な場合は、映像のカット割りに合わせて文を区切り、1文を1カットに収めると同期が取りやすくなります。
Q. 権利面で注意することはありますか
参照画像や学習データの扱いはツールごとに条件が異なります。商用利用の可否、生成物の扱い、他者の肖像や商標が映り込む場合の対処を、制作前に確認しておくことが重要です。
まとめ:品質はプロンプトの前に決まる
AI動画制作で成果を分けるのは、最新モデルを使っているかどうかではありません。ショットリストを作り、各カットを仕様として言語化し、参照画像とシードで一貫性を固定し、低コストで検証してから本番に進む。この地味な工程を守れるかどうかです。
特に効くのは次の5点です。
- 1カット1アクションを徹底する
- カメラ、光、スタイルを必ず明記する
- 参照画像と生成設定を台帳に残す
- ラフは安く、見せ場は高品質に
- 前後に余白を確保して編集でつなぐ
最初は1カットだけ、5秒の映像を作ってみてください。うまくいかない理由が必ず1つに絞れるはずです。その1つを潰す。これを繰り返すことが、遠回りのようで最も速い上達の道です。ツールは入れ替わっても、この進め方は変わりません。

