AI動画生成が変えた制作の前提
数年前まで、動画制作の工程は「撮影できるかどうか」を起点に組み立てられていた。ロケハン、出演者の調整、照明機材の手配、撮影日数の確保。これらすべてが企画の形を決める制約だった。現在はそこに「生成する」という選択肢が加わり、撮影・CG・生成を目的に応じて混ぜ合わせるハイブリッドな制作が、特別な設備がなくても現実的に選べるようになった。
ただし、生成技術を魔法の箱として扱うと失敗する。生成モデルは、与えられた条件の範囲で最も確からしい映像を出力する装置である。条件の設計が甘ければ、出力もまた曖昧になる。品質を決めているのはモデルの性能だけではなく、その前後にある工程設計だ。
よくある誤解を先に潰しておく。
- 誤解1:プロンプトが上手ければ一発で完成する。実際の現場では、公開できる1本の映像に対して数十回の生成と選別が行われる。
- 誤解2:生成は撮影の代替にすぎない。むしろ価値が出るのは、撮影では現実的でないカット(存在しない場所、危険な動作、過去の風景、非現実的なカメラワーク)を補う場面である。
- 誤解3:一貫性はツールが自動で解決してくれる。実際には、参照素材の設計と記録の管理が品質の大半を決める。
この記事では、特定のサービスの使い方ではなく、どのツールを使っても通用する制作フローの組み立て方を扱う。30秒から3分程度の映像を、1人から数人の体制で作る場面を想定している。
制作ワークフローの全体像
工程を7つに分けると、どこで失敗しているかが特定しやすくなる。以下は、実際の現場で回しやすい順序だ。
工程1:目的と制約を先に固定する
公開先(縦型のSNS、横型のWebサイト、展示スクリーン)、尺、縦横比、解像度、納品形式、トーン、そして使える予算と時間。これらを1枚のメモに文章で書き出す。生成の工程は自由度が高いぶん、制約を決めておかないと試行回数が際限なく増える。「なんとなく良い感じに」は、生成AIにとって最も再現性の低い指示である。
尺は特に重要だ。15秒の映像と3分の映像では、必要なショット数が10倍以上違う。最初に「何秒で、何を伝えるか」を1文で書く。この1文が、後のすべての判断基準になる。
工程2:脚本と絵コンテに落とす
1ショットは3〜6秒を目安にする。長いカットは破綻が蓄積しやすく、修正コストも跳ね上がる。1カットにつき「1つの動作」だけを書くのが原則だ。「歩きながら話して、途中で振り向いて、看板を指差す」这样的複合動作は、3カットに分割する。
絵コンテは上手に描く必要がない。構図、被写体、動作、カメラの4点がメモできていれば十分である。加えて、各カットに「このカットが無いと成立しない理由」を一行添える。説明できないカットは削る候補になる。
工程3:参照素材を準備する
キャラクターは正面・斜め・横・背面の4方向、可能なら表情差分も用意する。衣装、小物、ロケーション、カラーパレット、ライティングの参照も集める。重要なのは「多いほど良い」ではなく「矛盾がないほど良い」ということだ。解像度より一貫性を優先する。
参照素材は、生成のたびに迷わないようフォルダ構造を固定する。例えば「01_character」「02_location」「03_props」「04_lighting」「05_palette」のように分け、ファイル名に連番を振る。後から「どの参照を使ったか」を追えることが、修正の速さに直結する。
工程4:モデルとショットを割り当てる
すべてのショットを同じモデルで作る必要はない。人物の寄り、風景の引き、商品のクローズアップ、口の動きの同期など、得意分野は異なる。まず各系統のショットを1つずつ選び、それぞれ3案だけテスト生成する。当たりの出るモデルを見極めてから本番に入る。
テストの段階では解像度を落とし、尺も短くする。構図と動きの方向性だけを確認する。ここで妥協すると、後工程で倍以上の時間を失う。
工程5:生成と選別
選別の基準を先に決めておく。構図が意図どおりか、動きが自然か、指や文字が破綻していないか、前後のカットと照明・色がつながるか。感覚で選ぶと、後で「なぜこれを選んだのか」が分からなくなる。
1案だけ残して他を捨てるのではなく、良かった部分をメモしておく。「前半3秒の動きが良い」「背景の角度が正しい」といった記録は、部分的な作り直しのときに効いてくる。
工程6:一貫性を補正する
基準となるショットを1つ決め、そこから横に広げていく。前のカットの最終フレームを次のカットの参照として渡すと、つながりが保たれやすい。パラメータと乱数シードは記録表に残す。破綻が1箇所だけなら、全体を作り直さず、部分的な再生成や描き直しで対応する。
工程7:編集・音・書き出し
生成されたカットは長さが揃わない。編集で詰め、テンポを作る。カット間の色温度を合わせるだけでも、見た目の連続性は大きく改善する。音は映像の説得力を左右する要素であり、ナレーション、環境音、効果音、音楽の4層で考えると整理しやすい。字幕の有無、書き出しのコーデック、ビットレート、フレームレートまでを工程として明記しておく。
モデル選定の判断基準
モデルを選ぶときは「有名かどうか」ではなく、自分の用途に対して何を優先するかで決める。評価すべき軸は次のとおりだ。
- 一貫性の保持力:同一人物・同一場所を複数カットで維持できるか
- 動きの自然さ:関節の動き、重心、髪や布の揺れに破綻が出ないか
- 入力の種類:テキストのみか、画像参照、動画参照、音声入力に対応するか
- 尺の上限:1回の生成で何秒まで作れるか
- 生成速度:試行回数を稼げるかどうか
- 料金体系:従量か定額か、失敗した生成にも費用がかかるか
- 商用利用の条件:公開先や広告利用に制限がないか
- 出力の安定性:同じ指示で毎回同じ方向の結果が出るか
用途別の優先度をまとめると、次のようになる。
| 用途 | 最優先の軸 | 次に重視する軸 |
|---|---|---|
| 人物の会話シーン | 一貫性、口の動き | 表情の自然さ |
| 商品のクローズアップ | 質感、光の再現 | 細部のディテール |
| 風景・空撮風カット | スケール感、動きの滑らかさ | 生成速度 |
| アニメ調の演出 | 線の安定、色の統一 | スタイル再現性 |
| 説明動画・図解 | 文字や図形の保持 | 尺の自由度 |
| SNS向け短尺 | 生成速度、縦型対応 | インパクトのある動き |
複数のモデルを併用する場合でも、画面のトーンを揃える作業は必ず必要になる。編集ソフト側で色を寄せる前提で工程を組んでおくと、モデル間の差が問題になりにくい。
一貫性を保つ実践テクニック
一貫性は「運」ではなく、再現できる手順として設計できる。以下は効果が大きい順に並べたものである。
基準ショットを最初に作る
全カットを並行して作ると、後から基準を合わせる作業が発生する。まず最も情報量の多いショット(人物の顔がはっきり写るカット)を1つ完成させ、それを基準として他のカットを寄せていく。
プロンプトを固定部分と可変部分に分ける
「被写体・衣装・場所・時間帯・光の質」は固定し、「動作・カメラ・構図」だけをカットごとに変える。文章全体を毎回書き直すと、意図しない差異が混入する。テンプレートを表計算ソフトで管理するだけでも効果が大きい。
記録表を作る
カット番号、使用モデル、参照素材、シード値、パラメータ、採用理由を1行ずつ記録する。地味な作業だが、修正依頼が来たときに同じ状態を再現できるかどうかを左右する。
環境の語彙を統一する
「夕方の室内」と「オレンジ色の照明の部屋」は、人間には同じ意味でもモデルには別の意味になり得る。場所・時間・光を表す言葉をプロジェクト内で固定し、表現を揺らさない。
前のカットの最終フレームをつなぐ
カットの終わりを次のカットの参照として使うと、服装・小物・背景の位置が保たれやすい。動きの連続性も自然になる。
変化の少ないカットから作る
動きの激しいカットを先に作ると、基準が定まらないまま作業が進む。静止に近いカット、緩やかなパン、歩き始めなど、変化の小さいショットから積み上げる。
修正は部分で行う
顔だけ、手だけ、背景だけを直せるなら、全体を再生成しない。部分修正は時間の節約だけでなく、他の部分が変わってしまうリスクを避ける意味でも有効だ。
最後に色でつなぐ
どうしてもカット間の色が合わない場合は、編集段階で色温度・コントラスト・彩度を揃える。生成で解決できない差は、ポストプロダクションで吸収するという前提を持っておくと判断が速くなる。
プロンプト設計の型
プロンプトは文章力ではなく、要素の網羅性で決まる。次の5要素を必ず入れる。
- 被写体:誰が、何が、どんな外見か
- 動作:何をしているか。1カット1動作
- 環境:どこで、いつ、周囲に何があるか
- カメラ:距離、角度、動き、レンズ感
- 光と質感:光源の方向、硬さ、色、粒子感やフィルム感
悪い例は「かっこいい街の映像」。良くない理由は、被写体も動作もカメラも曖昧で、毎回違う結果になるからだ。改善するなら「雨上がりの夜、ネオンの看板が並ぶ路地を、黒いコートの人物が奥へ歩いていく。カメラはやや低い位置からゆっくり前進。看板の光が濡れた路面に反射し、髪とコートの裾がわずかに揺れる」となる。
カメラの語彙は事前にリスト化しておくと速い。引き、寄り、俯瞰、目線の高さ、肩越し、背後からの追従、横移動、旋回、固定。光の語彙も同様に、逆光、拡散光、窓明かり、青い時間帯、蛍光灯、ローソクの灯り、などを使い分ける。
避けたい書き方も決まっている。否定形の多用(「〜しないで」)は意図が伝わりにくいので、望む状態を肯定形で書く。1つの文に複数の出来事を詰め込むのも避ける。抽象的な感情語(感動的な、美しい)は、具体的な光や動きに置き換える。
品質チェックリストとよくある失敗
公開前に次の項目を確認する。
- 冒頭3秒で内容が伝わるか
- カット間で人物の顔、髪、衣装が一致しているか
- 手や指の形が破綻していないか
- 背景の建物や小物が勝手に変化していないか
- 文字やロゴが崩れていないか
- 音と映像のタイミングがずれていないか
- 縦横比とセーフエリアに収まっているか
- 音量がプラットフォームの基準内に収まっているか
よくある失敗と対策を挙げる。
顔が毎回別人になる
参照画像の角度が足りていないか、プロンプトの記述が揺れている可能性が高い。4方向の参照を用意し、人物の説明文を完全に固定する。
手が崩れる
手は現状でもっとも破綻しやすい部位である。手を画面から外す、手袋やポケットで隠す、構図を寄りすぎない、といった演出側の工夫が最も確実な対策になる。
動きが速すぎて不自然
動作の指示が複合的になっていないか確認する。ゆっくり歩く、静かに振り向くなど、動詞を1つに絞ると安定する。
カットのつなぎで色が変わる
基準ショットの色を数値で控え、編集で合わせる。生成側で揃えるより、編集で揃えるほうが速い場合が多い。
文字が読めない
生成に文字を任せず、編集でテロップを載せる。映像内に文字を出したい場合は、生成後に差し替える前提で設計する。
尺が足りない、余る
先に尺を決めずに作り始めると必ず起きる。工程1に戻り、カット数と秒数を再配分する。1カットを伸ばすより、カットを足すほうが破綻しにくい。
時間とコストの最適化
生成には試行回数に比例してコストがかかる。費用対効果を上げる考え方はシンプルで、「探索」と「本番」を分けることだ。
探索段階では、低い解像度、短い尺、少ない案数で方向性を決める。本番段階では、採用が決まった設定だけを高い品質で回す。この分離を徹底するだけで、無駄な消費を大きく減らせる。
見積もりの立て方は次の式で考えられる。
必要コストの目安 = ショット数 × 1ショットあたりの案数 × 1回あたりの単価 + 修正分の余裕
ここで重要なのは「修正分の余裕」を必ず確保することだ。初回の生成だけで予算を使い切ると、納品直前の修正ができなくなる。全体の2〜3割を予備として残しておく。
コストを下げる具体的な手段は次のとおり。
- ショット数を減らす。長回しではなく、意味のあるカットだけを残す
- 動きの少ないカットは静止画から生成し、編集で動きを加える
- 一度作った背景や小物を別カットで再利用する
- 採用が決まった設定をテンプレート化して、判断の時間を削る
- 生成待ち時間の長い処理はまとめて実行する
- 同じカットを何度も作り直さず、部分修正で対応する
時間の最適化は、作業の順序を変えることでも達成できる。参照素材の準備とスクリプトの確定を先に終わらせ、生成は一気に流す。生成と編集を交互に進めると、切り替えの負荷が積み重なる。
チームで回すための運用設計
複数人で制作する場合、品質のばらつきは個人のスキル差ではなく、運用の設計不足から生まれる。
最初に決めるべきは役割である。企画と脚本、参照素材の管理、生成の実行、選別と編集、最終チェック。小規模なら兼任で構わないが、「誰が最終判断を下すか」は必ず1人に決める。
次に命名規則を決める。プロジェクト名、カット番号、バージョン番号をファイル名に含める。例として「pj01_c012_v03」のような形式にしておくと、会話の中でも指示が通じやすい。
レビューは段階を分ける。参照素材の承認、基準ショットの承認、全カットの承認、編集後の承認。各段階で見るべき項目を固定すると、後戻りが減る。
フィードバックの書き方にもコツがある。「なんか違う」は最も伝わらない指摘だ。「顔がカット3より幼く見える」「背景の明るさがカット5と合っていない」のように、比較対象と具体的な差分で書く。
素材の保管も運用の一部である。採用カット、没カット、使用した参照画像、設定の記録を同じ階層にまとめておく。後から別の編集者に引き継ぐ可能性を常に想定しておくと、結果的に自分の作業も速くなる。
よくある質問
生成だけで完結させるべきですか
いいえ。撮影できるカットは撮影したほうが速く、確実で、費用も安い場合が多い。生成は「撮れないもの」「撮ると高すぎるもの」に使うのが合理的である。
一貫性を完璧にする方法はありますか
完全な自動解決は難しい。参照素材の設計、プロンプトの固定、記録の管理、編集での色合わせという4つの工程を組み合わせることで、実用上問題ないレベルに到達できる。
どのモデルを選べばよいですか
用途によって異なる。まず自分の主要なショット種別を3つ挙げ、それぞれでテスト生成を行い、当たりの出るものを選ぶ。話題性ではなく、自分の素材で試した結果で判断する。
生成に時間がかかりすぎます
探索と本番を分離し、探索は低設定で大量に、本番は確定設定のみで回す。また、ショット数を減らすことが最も効果的な短縮策になる。
音声はどう扱えばよいですか
ナレーション、環境音、効果音、音楽の4層に分けて考える。映像より音のほうが視聴維持率に影響する場合も多いため、工程として時間を確保する。
失敗した生成は無駄ですか
無駄にならない。失敗の傾向を記録しておくと、次のプロジェクトで同じ罠を避けられる。特に参照素材とプロンプトの組み合わせに関する知見は資産になる。
まとめ
AI動画生成の品質を決めるのは、モデルの性能だけでなく、その前後にある工程の設計である。目的と制約を先に固定し、脚本と絵コンテでショットを分解し、矛盾のない参照素材を準備する。テスト生成で方向性を決め、基準ショットから横に広げ、記録を残しながら部分修正で仕上げる。最後に編集と音でつなぎ、書き出し設定まで含めて工程として管理する。
この流れを一度作ってしまえば、あとはプロジェクトごとに中身を差し替えるだけで回せる。ツールは入れ替わっても、工程の型は長く使える。まずは15秒の短い映像を1本、最後まで通してみることを勧めたい。その経験が、次に作る3分の映像の品質を大きく変える。

