AI動画制作ワークフローの全体像
数年前まで、AIで動画を作ると言えば数秒の不思議な映像を眺める遊びに近いものでした。現在は状況が一変し、15秒のSNS広告、3分の製品紹介、10分の解説動画まで、AIを主軸にした制作が現実的な選択肢になっています。背景には、テキストから映像を生成するモデルの画質向上、静止画を自然に動かすモデルの安定性向上、そして編集・音声・アップスケールといった周辺工程を支えるツール群の成熟があります。
ただしツールが増えたことで新たな問題も生まれました。どの工程でどのモデルを使うべきか、どこまで自動化し、どこから人間が介入すべきか。この判断を誤ると、生成のたびに絵柄が変わり、尺が足りず、音が合わない、いわゆるつぎはぎ動画になってしまいます。
本稿では特定のサービスに依存しない汎用的なAI動画制作ワークフローを整理します。企画から納品までの工程を7段階に分け、各工程の判断基準、プロンプト設計の考え方、一貫性を保つ技術、よくある失敗と対処法までを扱います。
骨格は次の通りです。プリプロダクション、素材生成、選別とリテイク、編集、音声、仕上げ、レビューと納品。重要なのは、これを一方通行ではなくループとして捉えることです。編集段階で尺が足りないと分かれば生成に戻り、音声を入れて間延びに気づけば編集に戻る。AI制作は反復が前提であり、反復コストを下げる設計こそが生産性の源泉になります。
従来の撮影ワークフローとの違い
従来の撮影では、ロケ地、出演者、機材、天候といった制約が最初から計画に織り込まれます。AI制作では、その制約がモデルの得意・不得意に置き換わります。たとえば人物が歩く全身カットは比較的安定しますが、手で細かい作業をするカットは破綻しやすい。この特性を知らずに絵コンテを切ると、後工程で大量のリテイクが発生します。
完成品質を決める3つの変数
品質を左右する変数は、モデルの性能だけではありません。第一に素材の設計、つまりどんな参照画像とプロンプトを与えるか。第二に尺の設計、つまり1ショットを何秒で見せるか。第三に後処理の設計、つまりつなぎ、色調整、音の作り込みです。高性能なモデルを使っても、この3つが崩れていれば鑑賞に耐える映像にはなりません。
失敗しにくい体制の作り方
おすすめは、いきなり本編を作らず、30秒のパイロット版で全工程を一度通すことです。パイロットで分かった落とし穴を本編の設計に反映させると、手戻りが大幅に減ります。特にキャラクターの一貫性、カメラワークの再現性、ナレーションの尺の3点は、パイロット段階で検証しておく価値があります。
モデル選定の基準:工程ごとに最適なツールを割り当てる
AI動画のツール選びで最も多い失敗は、ひとつのモデルですべてを済ませようとすることです。実際には、工程ごとに得意分野がはっきり分かれています。ここでは系統別に整理します。
テキストから動画を生成する系統
プロンプトだけで映像を作る系統は、情景カット、風景、抽象的なトランジション、雰囲気重視のオープニングに向いています。物理法則の再現度が高く、カメラの動きを言語で指定できる点が強みです。一方で、特定の人物を何度も同じ顔で登場させる用途には向かず、尺も短尺に留まります。物語の骨格ではなく、世界観の提示に向いた系統だと考えてください。
画像から動画を生成する系統
参照画像を起点に動かす系統は、キャラクターの一貫性を保ちたい作品の主戦力になります。同じ人物画像を複数ショットで使い回せるため、シリーズ物や企業の広告で効果を発揮します。動きの自由度はテキスト起点より狭いものの、破綻が少なく、リテイクの回数を抑えられます。まず静止画でキャラクターを確定させ、それを動かすという順序が基本です。
画像生成モデルの使い分け
起点となるキービジュアルの品質は、最終映像の品質をほぼ決定づけます。フォトリアル系のモデル、イラスト系のモデル、スタイル転送に強いモデルを用途別に使い分けましょう。製品撮影風のカットはフォトリアル系、ブランドのイラスト調カットはイラスト系、既存写真のトーンを揃えたい場合はスタイル転送系が適しています。
編集・補助ツールの役割
生成したクリップは、そのままでは使えないことがほとんどです。フレーム補間、手ぶれの安定化、ノイズ除去、アップスケール、色調整を担うツールを用意します。編集ソフトはDaVinci Resolve、Premiere Pro、Final Cut Proなど、扱いに慣れたものを選べば十分です。After Effects系のコンポジットツールは、字幕やエフェクトの作り込みに効きます。
選定チェックリスト
- 商用利用の条件は明確か
- 出力解像度と最大尺は要件を満たすか
- 参照画像やシード値による再現性があるか
- 生成速度と待ち時間が制作リズムに合うか
- 縦型・横型・正方形のすべてに対応できるか
- 生成コストが本数×尺のスケールで破綻しないか
- チームでアカウントを共有できるか
- ポリシー違反時の判定基準が読めるか
このチェックを工程ごとに当てはめ、ひとつのツールに依存しない構成を作ることが、長期的な安定運用につながります。
プリプロダクション:企画・絵コンテ・ショットリストの作り方
AI制作でも、企画の重要性は撮影と変わりません。むしろ生成の自由度が高いぶん、方向性を決める作業が成果を大きく左右します。
目的と評価指標を先に決める
最初に決めるのは、誰に何を伝え、何を行動してもらうかです。認知拡大なのか、製品理解なのか、資料請求なのか。目的が曖昧なまま生成を始めると、美しいが伝わらない映像になります。指標は再生数だけでなく、視聴維持率、完視聴率、クリック率、コンバージョンなど、目的に応じて1つか2つに絞ります。
尺から逆算してショット数を決める
30秒の動画は、おおむね6から10ショットで構成されます。1ショット3秒から5秒が基本単位です。AI生成は1カットが短いため、尺の長い動画はショット数を増やしてつなぐ設計になります。逆に、1ショットを長く見せたい場合はスローモーションやパンで伸ばす工夫が必要です。
絵コンテはラフでよい
手描きでも箇条書きでも構いません。カットごとに、被写体、背景、カメラの動き、尺、ナレーションの内容を一行で書きます。この一覧がそのまま生成の指示書になり、後工程の抜け漏れを防ぎます。
ショットリストの実例
たとえば新製品の紹介なら、次のような構成が考えられます。1カット目は暗い空間に光が差す導入、2カット目は製品のシルエット、3カット目は手に取る動作、4カット目は使用シーン、5カット目は細部のクローズアップ、6カット目はロゴと締めのコピー。各カットに3秒から4秒を割り当てれば、20秒前後の簡潔な構成になります。
素材の準備リスト
生成前に用意しておきたいのは、参照画像、ロゴデータ、フォント、使用許諾済みの音楽、ナレーション原稿です。特に参照画像は、解像度が高く、顔と服装がはっきり写っているものを複数角度で揃えると、後の一貫性作業が格段に楽になります。
プロンプト設計とカメラ語彙の実践
プロンプトは思いつきで書くものではなく、構造化して再利用するものです。
基本構造を固定する
推奨する構造は、被写体、動作、環境、ライティング、カメラ、スタイル、品質指定の順です。たとえば、若い女性が窓辺で本を読む、午後の柔らかな逆光、肩越しのミディアムショット、ゆっくりとしたドリーイン、落ち着いたフィルム調、高精細という形で並べます。順序を固定すると、差分の管理が容易になります。
カメラ語彙を共通言語にする
映像の印象を決めるのは、被写体よりもカメラの扱いであることが少なくありません。寄りか引きか、固定か移動か、目線の高さはどこか。ドリーイン、ドリーアウト、パン、ティルト、トラッキング、ハンドヘルド、クレーンアップといった語彙をチーム内で共有しておくと、指示の精度が上がります。
ライティングとレンズの指定
柔らかな窓明かり、リムライト、ネオン、ゴールデンアワーといった光の表現と、35ミリ相当の広角、85ミリ相当のポートレート、マクロといったレンズ感の指定を組み合わせると、意図が伝わりやすくなります。逆に、こうした語彙を一切使わないと、毎回異なる雰囲気のカットが返ってきます。
避けたい要素を明示する
破綻しやすい要素は、あらかじめ除外指定します。指の本数、文字の乱れ、余分な手足、顔の歪み、不自然な反射などが典型です。ネガティブ指定が使えないツールでは、ポジティブな表現で回避します。たとえば手を写さない構図、文字のない看板、背面からのアングルといった指定が有効です。
プロンプトのバージョン管理
うまくいったプロンプトは必ず保存します。被写体、ライティング、カメラ、スタイルの4ブロックに分けて記録し、変更履歴を残しましょう。この蓄積が、チームの資産になります。
キャラクターと世界観の一貫性を保つ技術
複数ショットをまたいで同じ人物に見えるかどうかは、AI映像の最大の難所です。ここを乗り越えられるかで、作品の完成度が決まります。
キャラクターシートを作る
まず正面、斜め45度、横顔、背面の4方向の画像を用意します。服装、髪型、アクセサリー、体型の比率を固定し、表情のバリエーションを数パターン追加します。これが以後すべてのショットの基準になります。
参照画像を最優先で使う
テキストだけで人物を再現しようとすると、ショットごとに別人になります。画像を参照できる機能を使い、同じ人物画像を複数のカットで使い回すのが基本です。参照の強度を調整できる場合は、強めに設定してから、動きが硬いと感じたカットだけ弱めます。
シードとスタイルを固定する
再現性を高めるには、乱数シードの固定、スタイル指定の固定、解像度とアスペクト比の統一が有効です。同じシードでもモデルのバージョンが変わると結果は変わります。制作期間中はバージョンを固定し、途中で変更しない運用が安全です。
長尺化のためのショット分割
AI生成の1カットは短いため、長い会話シーンや移動シーンは複数のカットに分割します。同じ人物、同じ背景、同じ光で少しずつアングルを変えれば、つないだときに自然な連続性が生まれます。逆に、背景を大きく変えると別人感が出ます。
世界観の一貫性
人物だけでなく、色温度、フィルムグレインの量、被写界深度、色調も統一します。ルックアップテーブルを1つ決めて全カットに適用すると、生成段階のばらつきを吸収できます。
生成から編集へ:つなぎ・尺・テンポの設計
生成したクリップを並べるだけでは動画になりません。編集でリズムを作ります。
つなぎの原則
基本は、動きの方向を揃える、視線の先をつなぐ、同ポジションのアングル違いで切る、の3つです。AI生成はカットごとに動きのベクトルがばらつくため、前半と後半で動きの向きが反転していると強い違和感が出ます。生成段階で進行方向を指定しておきましょう。
尺とテンポ
視聴維持率を意識するなら、冒頭3秒で情報を出し、5秒以内に最初の転換点を置きます。1カットを長く見せるのは、感情を溜めたい場面だけに絞ります。テンポはナレーションの速度と連動するため、音声を先に仮当てしてからカットの長さを詰める方法が効率的です。
フレーム補間とスローモーション
生成物のフレームレートが低い場合は、補間ツールで滑らかにします。ただし補間は動きの速いカットで破綻しやすいため、適用は人物のアップや静的なカットに限定するのが無難です。
アップスケールとノイズ処理
最終書き出しの前に、解像度を引き上げ、ノイズを抑えます。アップスケールは強くかけすぎると質感がのっぺりするため、顔とテクスチャのディテールが残る範囲で調整します。
トランジションの使いどころ
場面転換は、ハードカット、ディゾルブ、ホワイトアウト、モーションブラーつなぎの順に検討します。多用すると安っぽく見えるため、章の切り替えなど意味のある地点に限定しましょう。
音声・音楽・字幕まで含めた仕上げ
映像の印象は音で半分決まります。AI生成映像は無音のため、音声工程を軽視すると完成度が大きく落ちます。
ナレーション
合成音声を使う場合も、人間が読む場合も、原稿は話し言葉で書きます。一文を短くし、息継ぎの位置を指定します。読み上げ速度は1分あたり300字前後が聞き取りやすい目安です。固有名詞や数字は誤読しやすいため、読み仮名を添えておきます。
音楽と効果音
音楽は映像の感情を決めるため、編集の早い段階で当てます。ライセンスが明確な音源を選び、クレジット表記の要否を確認します。効果音は、カットの切り替わり、動作の強調、場面転換の3種類に絞ると散らかりません。
ミックスの基本
ナレーションを基準に、音楽をその下、効果音を必要な瞬間だけ持ち上げます。スマートフォンのスピーカーで確認し、ナレーションが埋もれていないかを必ずチェックします。
字幕とアクセシビリティ
字幕は音声をそのまま書き起こすのではなく、意味のまとまりで改行します。1行あたり全角15文字前後、表示時間は2秒以上が読みやすさの目安です。縦型動画では、画面下部のUIと重ならない位置に配置します。
品質管理チェックリストとレビュー体制
納品前の確認を属人化させないために、チェック項目を固定します。
- 冒頭3秒で主題が伝わるか
- カットごとの人物が同一に見えるか
- 手、指、目、歯の破綻がないか
- 背景の小物や文字が不自然に溶けていないか
- カメラの動きがカット間で矛盾していないか
- 色温度とグレインが全編で揃っているか
- ナレーションとカットの尺が同期しているか
- 音量が基準値に収まり、クリッピングしていないか
- 字幕の誤字脱字と表示時間が適切か
- ロゴ、権利表記、必要な免責事項が入っているか
- 縦型、横型、正方形の書き出しが揃っているか
- ファイル名と納品形式が指定通りか
レビューは、初稿、修正稿、最終稿の3段階に区切ります。各段階で確認する観点を変え、初稿は構成とテンポ、修正稿は一貫性と音、最終稿は表記と技術仕様に絞ると、指摘の往復が減ります。
よくある失敗とトラブルシューティング
人物が毎回別人になる
原因は参照画像の不足か、参照強度の低さです。キャラクターシートを4方向で作り、全ショットで同じ画像を参照します。それでも揺れる場合は、モデルのバージョン変更が原因のことがあるため、期間中の固定を徹底します。
動きが滑らかでない
生成のフレームレート不足か、動きの指定が過剰です。動きの指示を減らし、必要なら補間ツールで補います。激しい動きを求めるほど破綻しやすいため、動きの量と画質はトレードオフであると理解しておきましょう。
手や指が崩れる
手が写る構図自体を避けるのが最も確実です。腕を組む、ポケットに入れる、物を持つ、後ろ手にするなど、自然な回避策を絵コンテ段階で仕込みます。
文字が読めない
映像内の文字生成は、現状では不安定です。看板やパッケージの文字は、後工程で合成するのが定石です。撮影したテキスト素材をマスクで載せ、遠近感を合わせてなじませます。
尺が足りない、間延びする
尺の不足は、追加ショット、スローモーション、静止画のパン、クローズアップの挿入で補います。間延びは、ナレーションを先に確定させ、そこに映像を合わせることで解消しやすくなります。
生成物がポリシーで弾かれる
実在の人物、著名ブランドの意匠、暴力的表現、権利が不明瞭な素材が原因になりがちです。代替の描写に置き換え、商用利用が明確な素材だけを使い、必要に応じて法務確認を行います。
コストが読めない
生成は試行回数に比例して費用が増えます。1カットあたりの試行上限を決め、採用率を記録し、無駄な生成を減らします。低解像度で構図を固めてから高解像度で本番生成する、という二段構えが有効です。
チーム運用・FAQ
役割分担の設計
AI制作のチームは、企画、プロンプト設計、生成、編集、音声、品質管理の6役に分かれます。小規模なら兼任で構いませんが、責任の所在は明確にします。特に一貫性の判断は、ひとりの担当者が基準を持つとぶれません。
素材とプロンプトの管理
フォルダ構成は、プロジェクト、工程、バージョンの3階層にします。プロンプトはテキストファイルで保存し、採用したカットの番号と紐づけます。この運用を徹底すると、半年後に同じルックの続編を作れます。
スケジュールの立て方
パイロットに全体の2割、本生成に4割、編集と音声に3割、予備に1割を割り当てるのが現実的です。生成待ち時間は並行作業で吸収し、待っている間に別カットのプロンプトを整えます。
よくある質問
Q. どのモデルから始めればよいですか。A. まず画像生成でキャラクターを固め、画像を起点に動かせるモデルで短尺を作るのが最短です。テキスト起点のモデルは情景カットの補助として併用します。
Q. 長尺の作品は作れますか。A. 作れますが、1カットが短い前提で構成を組み替える必要があります。会話劇よりも、ナレーションと情景カットの組み合わせに向いています。
Q. どのくらいの期間で習得できますか。A. パイロットを1本通せば基礎は掴めます。その後、10本程度の反復で、プロンプトと編集の勘所が安定してきます。
Q. 実写と組み合わせることは可能ですか。A. 可能です。AIカットと実写カットを混ぜる場合、色調とグレインを揃えると違和感が減ります。実写を先に撮ってから、同じルックのAIカットを生成する順序が安全です。
Q. 権利面で気をつけることは。A. 参照画像の権利、生成物の商用利用条件、使用音源のライセンス、出演者の同意の4点を確認します。不明な場合は使用を避けるのが原則です。
Q. 品質が安定しません。A. 参照画像、シード、スタイル、解像度の4つを固定し、変更は一度にひとつだけにしてください。複数を同時に変えると、原因の切り分けができなくなります。
次の一歩
最初に取り組むべきは、30秒のパイロット制作です。企画を1枚にまとめ、キャラクターシートを作り、6カットを生成し、ナレーションと字幕を載せて書き出します。この一周を経験すると、自分の制作における律速工程がはっきり見えます。律速が生成ならモデルと参照設計を見直し、編集なら尺の設計を見直し、音なら原稿の書き方を見直す。改善の順番は、常にボトルネックから決めていきましょう。

