AI動画制作は「ツール名」ではなく「工程設計」で決まる
生成モデルの名前を追いかけることは、もはや制作スキルの中心ではありません。テキストから動画を作るモデル、静止画に動きを与えるモデル、口の動きを合わせるモデルは、数か月単位で入れ替わります。昨日まで最適だった設定が、今日の更新で別の挙動になることも珍しくありません。だからこそ、モデルの固有名詞に依存した手順書はすぐに陳腐化します。一方で、企画を言語化し、ショットに分解し、キーフレームを作り、動きを与え、音を載せ、編集で整えるという工程の並びは、モデルが変わってもほとんど変わりません。
AI動画で成果が出ない人の多くは、モデルの性能不足を疑います。しかし実際のボトルネックは、次の3点に集中しています。第一に一貫性。第二に尺と解像度。第三に音と映像の同期です。この3つはどれも、単体のモデルではなく工程設計で解決します。参照画像をいつ用意するのか、どの時点で尺を確定するのか、音声を先に作るのか後に作るのか。こうした順番の設計が、最終的な品質を大きく左右します。
この記事では、特定のサービスに依存しない形で、AI動画制作の実践的なワークフローを整理します。読み終えたとき、あなたの手元には「どのモデルを使うか」ではなく「どの順番で何を作るか」という判断基準が残ります。
全体像:6つの工程を俯瞰する
AI動画制作は、大きく3つのフェーズと6つの工程に分けると整理しやすくなります。プリプロ(企画・脚本・設計)、プロダクション(キーフレーム生成・動画化)、ポスト(編集・音声・仕上げ)です。重要なのは、この順番を飛ばさないことです。いきなりプロンプトを打ち込み始めると、後工程でほぼ必ず作り直しが発生します。
| 工程 | 主な作業 | 成果物 | つまずきやすい点 |
|---|---|---|---|
| 1. 企画 | 目的・視聴者・尺・トーンの確定 | 企画メモ1枚 | 目的が曖昧なまま生成を始める |
| 2. 脚本・絵コンテ | ショット分解、カメラ指示 | ショットリスト | 1カットに複数アクションを詰める |
| 3. ルック開発 | 参照画像、色、照明の定義 | キャラ設定・キービジュアル | 参照を後から作って崩れる |
| 4. 動画化 | キーフレームから動きを生成 | テイク素材 | 尺を長く取りすぎて破綻する |
| 5. 音声 | ナレーション、音楽、効果音 | 音声トラック | 映像を直してから音を合わせる |
| 6. 編集・書き出し | カット、整色、エンコード | 完成尺の動画 | 破綻カットを隠せていない |
この表のとおり、生成は6工程のうちの一部でしかありません。制作時間の感覚としては、プリプロに全体の3割、生成に4割、ポストに3割を配分すると破綻しにくくなります。生成に9割を使う人は、ほぼ確実に「素材はあるが使えない」状態で行き詰まります。
工程1・2:企画とショットリストを先に固める
企画メモに必ず書く5項目
最初に埋めるべきは、次の5項目です。縦型か横型か、完成尺は何秒か、音声はナレーションか会話か環境音か、トーンは実写風かイラスト調か、そして最後に何をしてほしいか。この5項目が決まっていないと、生成のたびに判断がブレて、テイクが積み上がるだけで完成しません。
たとえば「30秒の縦型ショート、商品の質感を見せる、ナレーション付き、実写風、視聴者に詳細ページを見てもらう」と決まれば、必要なショットは自動的に絞られます。逆に「なんとなくかっこいい動画」では、永遠にテイクを増やし続けることになります。
脚本は「1カット=1アクション」で書く
脚本段階で最も多い失敗は、1つのカットに複数の出来事を入れてしまうことです。AI動画生成は、1ショット内の動作が増えるほど破綻率が上がります。「人物が歩きながら振り返り、扉を開ける」という指示は、3つのショットに分けたほうが最終的な見栄えは良くなります。
ショットリストは表形式で管理するのが実用的です。列は「カット番号・尺・被写体・動作・カメラ・照明・場所・スタイル・音」の9項目。この表がそのままプロンプトの設計図になります。
プロンプトへ翻訳する型
生成モデルに渡す文章は、次の順序で組み立てると安定します。
- 被写体(誰・何か、年齢感、服装、素材感)
- 動作(1つだけ。動詞は具体的に)
- カメラ(固定、パン、ドリーイン、手持ち、俯瞰)
- 照明(逆光、窓明かり、柔らかい拡散光、夜のネオン)
- レンズ感(広角、85mm相当、被写界深度浅め)
- 環境(場所、天候、時間帯)
- スタイル(実写風、フィルムグレイン、セル画調)
この型を守るだけで、同じモデルでも当たりテイクの確率が目に見えて上がります。逆に、形容詞を並べただけの長文は、モデルにとってノイズになります。
工程3:一貫性を「作る前」に設計する
参照画像を最初に用意する
キャラクターの一貫性は、生成後に修正するものではなく、生成前に設計するものです。有効なのは、キャラクターシートを作ることです。正面・斜め45度・横顔の3方向、表情違いを2〜3種、衣装バリエーションを2種。これだけで、後続のショットで別人化する確率が大きく下がります。
参照画像は、画像生成モデルで作っても、撮影やイラストで用意しても構いません。大切なのは、解像度が十分で、照明が均一で、背景が整理されていることです。背景が複雑な参照画像は、その背景ごと動画に持ち込まれてしまいます。
シードと起点を固定する
同じキャラクターを別カットで再現するときは、シード値の固定、参照画像の再利用、画像から動画への変換を起点にする、という3点を組み合わせます。テキストだけで毎回生成し直す方法は、最も不安定です。まずキーフレームを画像として作り込み、そこから動かす。この順番を徹底するだけで、シリーズ物の制作が現実的になります。
背景や小道具も同様です。世界観のルックを、色温度・コントラスト・粒子感の3項目で数値化してメモしておくと、カット間のつながりが良くなります。編集ソフト側で同じLUTを全カットに適用する運用も有効です。
一貫性チェックリスト
- 顔の骨格と髪型が全カットで同じか
- 衣装のディテール(ボタン、ロゴ、素材)が一致しているか
- 時間帯と照明の方向が矛盾していないか
- 背景の小道具の位置が不自然に飛んでいないか
- 手や指の本数が破綻していないか
撮影後ではなく、各カットの採用判断の時点でこのチェックを回すのがコツです。
工程4:モデル選定と生成パラメータの実践
モデルは「役割」で選ぶ
生成モデルは、万能の1本を探すより、役割で分担したほうが結果が良くなります。分類すると、テキストから動画を直接作るタイプ、画像に動きを与えるタイプ、既存動画を変換するタイプ、人物の口の動きに特化したタイプ、長尺の一貫性を重視したタイプに分かれます。Runway、Luma Dream Machine、Kling、Pika、Veo、Sora系、Stable Video Diffusion系など、名前は挙げられますが、どれが最適かは用途次第です。
選定の判断基準は次の7項目です。リアリズムの高さ、スタイライズ表現の幅、動きの大きさへの耐性、カメラワークの制御性、1回で生成できる尺、最大解像度、そして生成速度。この7項目を5段階で自己評価し、案件ごとに重みを変えると、モデル選びで迷わなくなります。
パラメータは「動きの量」から調整する
生成が破綻するとき、多くの人はプロンプトを疑いますが、実際は動きの量が原因であることが多いです。人物が激しく動くシーンでは、モデルが身体構造を維持できずに崩れます。対策は、動きを小さくする、カットの尺を短くする、カメラを固定する、という3つです。
逆に、出力が静止画のように見える場合は、動きの指定が抽象的すぎます。「歩く」「振り返る」「手を伸ばす」のように、身体の部位と方向を含む動詞に置き換えてください。
失敗したときのデバッグ手順
- プロンプトから形容詞を削り、要素を5つ以下にする
- 尺を半分にしてみる
- カメラ指定を「固定」に変える
- 参照画像を1枚に絞る
- 解像度とアスペクト比を標準設定に戻す
- それでも崩れるなら、そのショットを分割する
この順番で切り分けると、原因がプロンプトなのか、パラメータなのか、モデルとの相性なのかが判断できます。闇雲に再生成を繰り返すのは最も時間を浪費する行為です。
工程5:音声を先に作ると尺が決まる
音声先行のすすめ
AI動画制作で最も効果の高い習慣は、音声を先に作ることです。ナレーション原稿を読み上げさせ、その長さに合わせてカットを割り付けると、尺の調整が不要になります。逆順で進めると、映像に合わせて原稿を削る作業が発生し、内容が薄くなります。
音声合成は、読み上げ速度と間の取り方を調整できるツールを選びます。日本語の場合、句読点の扱いとアクセントの自然さが品質を左右します。固有名詞や専門用語は、事前に読み方を登録しておくと事故が減ります。
リップシンクの実務
人物が話すカットでは、口の動きを合わせる工程が必要になります。ここでの注意点は、映像の尺と音声の尺を完全に一致させること、そして顔が画面内で大きすぎないことです。顔が小さめのカットのほうが、同期のズレが目立ちません。また、話している最中にカメラが大きく動くカットは、同期ズレが強調されるため避けたほうが無難です。
音楽と効果音の設計
音楽は、生成した楽曲でもライブラリでも構いませんが、音量設計を先に決めましょう。ナレーションがある動画では、ナレーションを-6dB前後、音楽を-18dB前後に置き、BGMが言葉を邪魔しないようにします。効果音は、カットの切り替わりに置くと視聴者の注意が自然に誘導されます。
工程6:編集でAI生成の粗を隠す
カットは短く、テンポは速く
AI生成の映像は、3秒を超えたあたりから破綻が目立ち始めます。したがって編集では、1カットを2〜4秒で刻むのが基本になります。長回しが必要なシーンでも、同じアングルを複数回生成してつなぐほうが、1本の長い生成より安定します。
破綻を隠すテクニックはいくつかあります。動きの速い部分でカットを切り替える、モーションブラーを軽くかける、フィルムグレインを薄く重ねる、コントラストを少し下げる。これらは素材の粗を目立たなくする一方で、安っぽく見えないための処理でもあります。
整色とアップスケール
全カットに同じカラー調整を適用すると、生成モデルごとの色味の違いが目立たなくなります。ホワイトバランス、コントラスト、彩度、粒状感の4項目を揃えるだけでも、別々に生成した素材が同じ作品に見えてきます。
解像度が足りない場合は、アップスケール処理を編集の前段で行います。先にアップスケールしてから整色すると、ノイズも一緒に強調されるため注意してください。整色してから軽くアップスケールする順番のほうが、結果が自然になることが多いです。
書き出し設定
縦型ショートなら1080×1920、横型なら1920×1080を基準にします。ビットレートは1080pで8〜12Mbps程度、4Kなら35〜50Mbps程度が目安です。SNSに直接アップロードする場合は、プラットフォーム側の再エンコードを考慮して、少し高めのビットレートで出すと画質の劣化を抑えられます。
音声はAAC 320kbpsまたはPCMで書き出し、ラウドネスは-14 LUFS前後に揃えます。プラットフォームごとに推奨値が異なるため、配信先を決めてから最終調整するのが確実です。
よくある失敗と回避策
失敗1:生成から始めてしまう
最も多い失敗です。絵コンテも参照画像もない状態で生成を始めると、素材は増えるのに編集で使えるカットがほとんどありません。回避策は単純で、ショットリストが完成するまで生成ボタンを押さないことです。
失敗2:1カットに情報を詰め込む
「雨の街を歩きながら傘をたたみ、振り返って微笑む」这样的指示は、モデルにとって処理しきれない情報量です。動作を1つに絞り、残りは別カットに分割してください。
失敗3:音声を後回しにする
映像を完成させてから音声を載せると、尺が合わずに再生成が発生します。ナレーション原稿を先に書き、音声を先に作り、その長さに映像を合わせる順番に変えるだけで、手戻りが大きく減ります。
失敗4:バージョンを管理しない
プロンプト、参照画像、シード値、採用テイクの番号を記録していないと、良い結果が出た理由が分からず再現できません。スプレッドシート1枚で構わないので、カット番号ごとに使用モデルと設定を残しておきましょう。
失敗5:破綻カットをそのまま使う
「動きが面白いから」という理由で破綻カットを残すと、視聴者はそこだけを覚えます。迷ったら捨てる。これがAI動画編集の原則です。
チームで回すための運用設計
個人制作なら不要でも、複数人で回す場合は工程の受け渡しを定義しておく必要があります。おすすめは、企画・脚本・絵コンテ・生成・編集の5段階でレビューを入れることです。特に絵コンテ段階でのレビューは、後の手戻りを最も大きく減らします。
命名規則も重要です。プロジェクト名_カット番号_テイク番号_日付のように統一しておくと、素材が増えても迷子になりません。生成モデルごとにフォルダを分ける運用は、後から差し替えが効かなくなるため避けたほうが無難です。
よくある質問
AI動画は無料で作れますか
短い尺の試作であれば、無料枠やオープンソースのモデルを組み合わせて作れます。ただし商用利用や長尺制作では、有料プランの利用が必要になることが一般的です。まずは無料枠で工程を一通り体験し、どこがボトルネックになるかを見極めるのが現実的です。
実写と見分けがつかない動画は作れますか
短いカットであれば、かなり自然な映像を作れます。ただし長尺になると、手の動き、視線、髪の揺れなどに不自然さが残ります。人がじっと見るカットではなく、動きのあるカットやカット割りの多い構成にすると、自然さが際立ちます。
1本作るのにどれくらい時間がかかりますか
30秒のショート動画で、慣れれば数時間から1日程度です。ただし初回は、参照画像の作成とモデルの挙動確認に時間がかかります。2本目以降は工程が固まるため、大幅に短縮されます。
商用利用は可能ですか
生成モデルやサービスごとに利用条件が異なります。学習データの扱い、生成物の権利、再配布の可否は個別に確認が必要です。特に人物の肖像や既存キャラクターに似た表現は、権利面でのリスクがあるため避けるのが安全です。
人物の顔が崩れるときの対処法は
顔を画面に対して小さくする、カメラを固定する、動きを減らす、参照画像を増やす、という4点を順に試してください。それでも改善しない場合は、そのカットを別アングルに置き換えるのが最も早い解決策です。
縦型と横型のどちらを選ぶべきですか
配信先で決めます。ショート動画プラットフォームは縦型、ウェブサイトやプレゼン資料は横型が基本です。両方必要なら、横型で生成してから縦型にクロップするのではなく、最初から2種類のアスペクト比で生成したほうが構図が破綻しません。
どのモデルから始めればよいですか
まずは画像から動画を生成できるタイプを1つ選んでください。テキストから直接動画を作るタイプより、キーフレームを自分でコントロールできる分、再現性が高く学習効率が良いです。慣れてきたら、口の動きに特化したモデルや長尺向けのモデルを追加していきます。
まとめ:工程を決めればモデルが変わっても戦える
AI動画生成の品質を決めるのは、モデルの性能だけではありません。企画を1枚に落とし、ショットに分解し、参照画像で一貫性を確保し、動きを小さく設計し、音声を先に作り、編集で整える。この流れを自分の型として持っていれば、モデルが入れ替わっても制作は止まりません。
逆に、ツールの名前だけを追いかけていると、更新のたびにゼロからやり直すことになります。まずは短い1本を、この6工程のとおりに最後まで通してみてください。完成させることが、最も効率の良い学習になります。




