AI動画制作を「パイプライン」として捉え直す
AI動画生成ツールが身近になったことで、多くの人が最初に触れるのは「短いプロンプトから数秒の映像を出す」という体験です。ただ、これを仕事としての動画制作に持ち込むと、ほとんどの場合で壁にぶつかります。理由ははっきりしていて、業務で求められるのは「一度だけ奇跡的にきれいな映像が出たこと」ではなく、「決められた尺・トーン・世界観の中で、同じ品質の映像を繰り返し出せること」だからです。
そこで必要になるのが、動画制作を単発の生成ではなく、複数工程がつながったパイプラインとして設計する視点です。工程は大きく七つに分けられます。
- 企画:誰に何を、どの尺で伝えるのかを決める
- 設計:絵コンテ、ショットリスト、カメラワーク、光と色の設計
- 素材準備:参照画像、キャラクター設定、背景、小道具、フォント
- 生成:モデル選定、プロンプト、パラメータ、試行回数の管理
- 選別:テイク比較、破綻チェック、採用判断
- 仕上げ:編集、アップスケール、フレーム補間、音声、カラー調整
- 配信と運用:書き出し設定、字幕、サムネイル、派生カットの展開
この七工程を一つの流れとして図にすると、次のようになります。
企画 → 設計 → 素材準備 → 生成 → 選別 → 仕上げ → 配信
↑ ↓
└────── フィードバックループ ──────┘
重要なのは、どの工程も「後戻りできる」ように設計することです。たとえば生成段階でキャラクターの顔が崩れたとき、原因が参照画像にあるのか、プロンプトにあるのか、モデルの特性にあるのかを切り分けられなければ、闇雲に再生成を繰り返すことになります。再生成のたびに時間と計算資源が消えていくため、切り分けのしやすさはそのまま制作コストの削減につながります。
もう一つの原則は、「上流で決めたことを下流で覆さない」ことです。ショットリストの段階でカメラワークを決めておけば、生成時に迷う時間が減ります。逆に、生成しながら構図を考える進め方は、初心者ほど破綻しやすいやり方です。AIは決まった指示を高精度に再現するのは得意ですが、曖昧な意図を汲み取って一貫した演出を組み立てるのは苦手だからです。
企画とプリプロダクション:後工程を決める最初の設計
ログラインと尺から逆算する
最初に決めるべきは、映像の長さと目的です。15秒の縦型ショート、60秒の商品紹介、3分の解説動画では、必要なカット数も、一カットあたりの生成秒数も、求められる一貫性の水準もまったく変わります。
目安として、次のように考えると設計がぶれません。
| 尺 | カット数目安 | 1カットの生成秒数 | 重視すべき点 |
|---|---|---|---|
| 15秒 | 4〜6 | 2〜4秒 | テンポ、視線誘導 |
| 30秒 | 8〜12 | 2〜5秒 | 一貫性、音との同期 |
| 60秒 | 15〜25 | 3〜6秒 | 世界観、キャラの安定 |
| 3分以上 | 40〜80 | 3〜8秒 | ショット間の連続性、色設計 |
長尺になるほど、一カットあたりの完成度より「ショット間のつながり」が作品の質を決めます。逆にショート動画では、冒頭2秒で引き込めるかどうかがほとんどすべてです。
ショットリストとプロンプト設計書
業務として制作するなら、ショットリストは表計算ソフトかドキュメントで管理するのが現実的です。最低限、次の列を用意します。
- カット番号
- 画面の内容(誰が、どこで、何をしているか)
- カメラワーク(固定、パン、ドリー、手持ち風など)
- 尺とフレームレート
- 使用モデル
- 参照画像のファイル名
- プロンプト本文
- 採用テイクのファイル名
- 備考(失敗パターン、再生成の条件など)
たとえば1カット分の記録は、次のような粒度で残します。
#03 / 女性が窓辺で振り返る / スロー・ドリーイン / 3.0秒・24fps
モデル:動きの自然さを優先する系統
参照画像:char_A_front.png, char_A_45.png
プロンプト:30代前半、黒髪を後ろで束ねた女性、薄いグレーのシャツ、
午後の柔らかい逆光、室内、浅い被写界深度、落ち着いた色調
採用:take_03b.mp4(手の位置が安定)
備考:横向き構図は指が崩れやすいので正面寄りに変更
この表があるだけで、後から同じ映像を作り直せるようになります。逆に、プロンプトをチャット履歴にしか残していない運用は、数週間後に必ず破綻します。生成AIの出力は確率的なので、「たまたま良かった」を再現するには記録が必須です。
プロンプトは、次の四つのブロックに分けて書くと管理しやすくなります。
- 被写体(人物、服装、年齢感、表情)
- 環境(場所、天候、時間帯、光源の位置)
- カメラ(レンズ感、アングル、動き、被写界深度)
- スタイル(質感、色調、フィルムグレイン、参照作家の雰囲気)
このうち、全カットで共通にするのは「1」と「4」です。「2」と「3」はカットごとに変えます。固定部分をテンプレート化しておけば、書き換えミスによる一貫性の崩れを減らせます。
モデル選定の判断基準を言語化する
四つの評価軸
動画生成モデルは数が多く、名前だけを見てもどれを選ぶべきか判断できません。選定の基準を、次の四軸に整理しておくと意思決定が速くなります。
- 描写力:質感、ディテール、ライティングの自然さ
- 一貫性:同一キャラクター・同一構図を維持できるか
- モーション:動きの自然さ、破綻の少なさ、カメラワークの追従性
- 速度とコスト:生成時間、消費する計算資源、試行回数の余裕
この四つはトレードオフの関係にあります。描写力の高いモデルは生成に時間がかかり、高速なモデルは細部が甘くなりがちです。したがって「どのモデルが一番良いか」という問いには意味がなく、「このカットで何を優先するか」という問いに置き換える必要があります。
たとえば、人物のクローズアップで感情を伝えるカットなら描写力と一貫性を優先します。逆に、背景だけが流れるトランジション用のカットなら、速度を優先して数を出す方が合理的です。
用途別の使い分け例
- 人物の感情カット:描写力と一貫性を優先。解像度を上げ、参照画像を複数渡す
- 商品の質感カット:描写力とライティング再現を優先。ゆっくりした動きで破綻を抑える
- 風景のパン・ドリー:モーションの自然さを優先。被写体を減らして失敗率を下げる
- SNS用の短尺フィラー:速度を優先。数を作って良いものを選ぶ
- 長尺の背景映像:速度と安定性を優先。動きの量を最小限にする
比較テストのやり方
モデルを選ぶときは、感覚で決めずに比較テストを行います。手順は次のとおりです。
- 代表的なカットを三個選ぶ(人物、風景、動きのある場面)
- プロンプトと参照画像を完全に固定する
- 候補モデルを三〜四つに絞り、同じ条件で各三回生成する
- 破綻率、所要時間、手戻りの回数を記録する
- 採用モデルをショットリストに書き込む
回数を三回にするのは、一回だけでは偶然に左右されるためです。同じ条件でも出力は毎回変わるので、三回のうち何回使えるテイクが出たかを見る方が実際の運用に近い評価になります。
また、評価は「良かったテイク」ではなく「捨てたテイクの理由」を記録するのが有効です。手が崩れた、顔が別人になった、背景が溶けた、といった失敗の傾向が分かると、プロンプトの改善点が見えてきます。
キャラクターと世界観の一貫性を保つ技術
一貫性はAI動画制作で最も難しい課題であり、最も差がつく部分です。ここでは実務で効果の大きい方法を整理します。
参照画像セットの作り方
同じ人物を複数カットに登場させる場合、参照画像は一枚ではなく、セットで用意します。
- 正面のバストアップ(表情はニュートラル)
- 斜め45度のバストアップ
- 全身(立ち姿)
- 別の角度の全身
- クローズアップ(目と肌の質感が分かるもの)
- 特徴的な小道具や服装のディテール
合計6〜10枚が現実的なラインです。重要なのは、すべての画像で照明条件と色温度をそろえることです。片方が暖色の室内、もう片方が曇天の屋外だと、モデルは「同じ人物」ではなく「似た別人」として解釈し、カットごとに顔つきが揺れます。
参照画像は、画像生成モデルで作っても、撮影しても、どちらでも構いません。ただし解像度は高めに、背景はシンプルに、顔に強い影が落ちていないものを選びます。
プロンプトの固定部分と可変部分
キャラクターの記述は、できるだけ短く固定的に書きます。「30代前半、黒髪を後ろで束ねた女性、薄いグレーのシャツ」のように、識別に必要な要素だけを残します。形容詞を積み上げると、カットごとにモデルが別の解釈を選ぶ余地が増え、かえって不安定になります。
一方、感情や動作は可変部分として書き換えます。「静かに微笑む」「眉をひそめる」「目線をそらす」といった短い動作指示を差し替えるだけで、同じ人物のままシーンを展開できます。
色設計も一貫性の一部です。作品全体のベースカラー、アクセントカラー、影の色を決めておき、各カットのプロンプトに同じ色の記述を入れると、つなぎ合わせたときの統一感が大きく変わります。
シードとバリエーションの管理
同じ構図で表情だけを変えたい場合は、乱数の種を固定し、可変部分だけを書き換えます。逆に、まったく別のテイクが欲しい場合は種を変えます。この二つを混ぜてしまうと、「何を変えたから結果が変わったのか」が分からなくなり、改善の手掛かりが失われます。
独自スタイルを再現する追加学習の運用法
既製モデルでは満たせない固有の画風や人物を扱う場合、自前のデータで追加学習を行います。ここは専門的ですが、手順を理解しておけば数日で回せるようになります。
データセット設計
- 枚数の目安は20〜40枚。多すぎると学習に時間がかかり、過学習のリスクも上がる
- 構図、距離、角度、背景を意図的にばらす
- 解像度は学習対象の仕様に合わせて統一する
- 破綻した画像、指が欠けた画像、文字が混入した画像は必ず除外する
- 色味が極端に偏った画像は枚数を抑える
キャプションは「何が写っているか」を簡潔に書きます。固有名詞を入れすぎると、その言葉がトリガーとして強く効きすぎ、汎用性が落ちます。逆にキャプションが不足すると、背景や服装まで学習してしまい、スタイルだけを再現したいときに邪魔になります。
過学習を避ける評価サイクル
学習は一度で終わらせず、途中経過を評価します。学習の進行度を段階的に保存し、各段階で同じ評価用プロンプトを回して比較します。評価用プロンプトは5〜10個用意し、学習前に決めておきます。ここで毎回プロンプトを変えると、改善したのか偶然なのかが分からなくなります。
チェックすべきは次の三点です。第一に、狙ったスタイルが出ているか。第二に、学習していない構図やポーズでも破綻しないか。第三に、他の要素(背景、服装、照明)を指示どおりに変えられるか。第三点が弱い場合、過学習のサインです。
シーン構成とディレクション:AIに任せる範囲を決める
パイプラインを組んでも、演出の判断までAIに任せると作品は散らかります。役割分担を決めておくことが重要です。
人間が決めるべきは、次の項目です。
- どのカットで何を見せるか(情報設計)
- 感情のピークをどこに置くか(構成)
- カメラがどう動くか(視線誘導)
- 色と光のトーン(世界観)
AIに任せてよいのは、次の項目です。
- 指定した構図・動きの範囲内での細部の作り込み
- 質感や粒子の再現
- バリエーション出し(同一カットの複数テイク)
- 短い尺のフィラー映像
ショットのつなぎでは、前のカットと次のカットで「視線の方向」と「光源の方向」をそろえるだけで、映像の説得力が大きく上がります。逆にこれを無視すると、一カットずつは美しくても、つなげた瞬間に安っぽく見えます。
カメラワークの記述例
カメラの動きは、曖昧な言葉ではなく速度と方向まで書きます。「ゆっくり前進」「右から左へ一定速度で流れる」「固定、被写体のみが動く」「手持ち風にわずかに揺れる」のように、動きの量を数値や比較で示すと、テイク間のばらつきが減ります。
テンポも設計のうちです。3秒のカットを10枚並べるより、2秒・4秒・1.5秒と変化をつける方が、視聴者は長く感じません。AI生成は一カットの尺を後から伸縮しにくいため、尺は生成前に決めておき、編集で微調整する前提で少し長めに作っておくのが実務的です。
生成コストと時間を最適化する実践テクニック
生成には計算資源と時間がかかります。ここを最適化できるかどうかが、制作本数を左右します。
- 低解像度でテストし、構図と動きが決まってから高解像度で本番生成する
- 同一の参照画像と種を使い回し、変化させる要素を一つに絞る
- 背景が固定のカットは、静止画を先に作り、動きだけを後から加える
- 複数の候補をまとめて生成し、採用判断を後回しにせず、その場で捨てる
- 失敗が明らかなテイクは最後まで見ず、途中で打ち切る
特に効果が大きいのは、最初のテスト段階を軽い設定で済ませる方法です。構図が決まっていない段階で高品質な生成を繰り返すのは、最も無駄の多い進め方です。
また、生成の待ち時間は別の作業に充てる前提でスケジュールを組みます。一本の動画を最初から最後まで通しで作るより、複数カットのテスト生成をまとめて流し、その間に編集や素材整理を進める方が、体感の生産性は高くなります。
一日の進め方の一例
- 午前:参照画像の整理とショットリストの更新
- 昼前:全カットのテスト生成をまとめて投入
- 昼:待ち時間に素材の選別と音声の準備
- 午後:採用カットだけを本番生成
- 夕方:編集、カラー調整、書き出し
この順番にすると、待ち時間が作業の空白になりません。
ポストプロダクション:生成物を「作品」に変える工程
生成されたカットは、素材であって作品ではありません。ここからの工程で完成度が決まります。
- 編集:不要なフレームを削り、テンポを整える。カットの頭と尻は必ず少し詰める
- アップスケール:必要に応じて解像度を上げる。上げすぎると不自然な質感が出るため、元の描写力に見合った倍率にとどめる
- フレーム補間:滑らかにしたい場合に使うが、動きの激しいカットでは残像が出ることがある
- カラー調整:全カットに同じカラー処理をかけ、色のばらつきを吸収する
- 音声:ナレーション、環境音、効果音、音楽。無音のAI動画は一気に安く見える
- 字幕:読みやすさを優先し、一行の文字数を抑える
- 書き出し:配信先の仕様に合わせ、ビットレートとフレームレートを確認する
| 用途 | 解像度 | フレームレート | 補足 |
|---|---|---|---|
| 縦型ショート | 1080×1920 | 30fps | 冒頭2秒を最優先で調整 |
| 横型Web動画 | 1920×1080 | 24〜30fps | 24fpsはフィルム的な質感 |
| プレゼン埋め込み | 1920×1080 | 30fps | 字幕を大きめに |
| 高精細上映 | 3840×2160 | 24fps | 元素材の解像度を確認 |
特に音の有無は、視聴者の印象を大きく変えます。同じ映像でも、環境音と軽い音楽を入れるだけで「作品」に見えます。逆に、音がないまま映像だけを並べると、どれだけ画が良くてもテスト映像の印象を抜け出せません。
よくある失敗とトラブルシューティング
- 顔が別人になる:参照画像の照明条件をそろえる。キャラクター記述を短く固定する
- 手や指が崩れる:手が大きく写る構図を避ける。手を隠す、後ろに回す、小道具を持たせる
- 背景が勝手に変わる:背景の記述を増やし、参照画像に背景を含める。カットごとに背景を固定する
- 動きが不自然に溶ける:モーション量を減らし、カット尺を短くする。動きの少ない構図に切り替える
- 色がカットごとに違う:全カットに共通のカラー記述を入れ、最後にまとめてカラー調整をかける
- 長尺で一貫性が崩れる:カットを短く分割し、参照画像を都度与える。連続した長回しを避ける
- 文字が崩れる:映像内に文字を生成させず、編集ソフトで後から載せる
- 同じ失敗を繰り返す:失敗の理由をショットリストに記録し、次の生成条件に反映する
トラブルの多くは、モデルの性能不足ではなく、上流工程の曖昧さに起因します。原因を切り分ける順序は、参照画像 → プロンプト → パラメータ → モデル、の順で確認するのが効率的です。
よくある質問と最終チェックリスト
Q. 初心者はどの工程から学ぶべきですか。
A. 設計と選別です。生成のテクニックより、ショットリストの書き方と、採用・不採用の判断基準を先に身につける方が、上達は早くなります。
Q. モデルは一つに絞るべきですか。
A. 絞る必要はありませんが、用途ごとに「第一候補」を決めておくことを勧めます。迷う時間が減り、比較テストの蓄積も活きます。
Q. 一貫性を保つ最も簡単な方法は。
A. 参照画像をセットで用意し、照明条件をそろえることです。これだけで失敗の多くが減ります。
Q. 追加学習は必須ですか。
A. 既製モデルで表現できる範囲なら不要です。固有の画風や特定の人物を継続的に使う場合に検討します。
Q. 生成に時間がかかりすぎます。
A. テスト段階の解像度と尺を下げ、採用が決まったカットだけを本番生成します。待ち時間には別の作業を割り当てます。
Q. 音声はどう用意しますか。
A. ナレーションは音声合成、環境音と音楽はライブラリから調達するのが現実的です。映像の尺に合わせて先に音を決めると、編集が楽になります。
Q. どのくらいの本数をこなせば安定しますか。
A. 10本程度作り、毎回ショットリストと失敗記録を残すと、自分の環境での判断基準が固まります。
Q. 商用利用で気をつける点は。
A. 参照画像や学習データの権利、素材の利用条件、人物の肖像に関する同意を事前に確認します。判断に迷う素材は使わないのが安全です。
Q. チームで進める場合のコツは。
A. ショットリストを共有の正とし、プロンプトと参照画像の置き場所を固定します。担当が変わっても同じ手順を再現できる状態が理想です。
最終チェックリスト
- 尺とカット数を先に決めたか
- ショットリストにモデル名と参照画像を記録したか
- 参照画像の照明条件はそろっているか
- プロンプトの固定部分と可変部分を分けたか
- テスト生成を軽い設定で済ませたか
- 失敗テイクの理由を記録したか
- 全カットに共通のカラー処理をかけたか
- 音声と字幕を確認したか
- 配信先の書き出し設定を確認したか
再現性は、才能ではなく設計から生まれます。上流工程を丁寧に決め、記録を残し、失敗の理由を次の生成に反映する。この当たり前の循環を回せるかどうかが、AI動画制作を継続的な仕事にできるかどうかの分かれ目です。



