AI動画生成ワークフローの全体像:6つの工程を分けて考える
動画生成AIを使った制作は、魔法のボタンを押す作業ではありません。実際には、企画、設計、生成、選別、編集、納品という6つの工程に分かれており、それぞれに固有の判断と作業量が発生します。多くの人が最初につまずくのは、生成そのものよりも「何を生成すべきか」を決めていない段階です。思いつきでプロンプトを書き始めると、後工程で素材が足りず、撮り直しならぬ「生成し直し」が大量に発生します。
工程を分ける最大のメリットは、失敗を小さくできる点にあります。企画と絵コンテの段階で尺や構図を固めておけば、生成時には「どのカットを、どのモデルで、どの解像度で作るか」だけに集中できます。逆に、編集段階でストーリーを組み立てようとすると、必要なカットが存在しないことに気づき、追加生成の連鎖でスケジュールが崩れます。
もう一つの原則は、「解像度・尺・一貫性のどれを優先するか」を最初に決めることです。この3つは同時に最大化しにくく、どれかを妥協する必要があります。SNS向けの短尺縦動画なら一貫性とテンポ、広告やプレゼン用なら解像度と精度、実験的な作品なら独自性を優先する、といった具合です。
さらに、生成AIの出力は確率的です。同じプロンプトでも結果が変わる前提で、「何度か試して選ぶ」工程をスケジュールに組み込んでおくことが、現実的な進行の鍵になります。
以下では、各工程を実務の手順として順に解説します。読み終えたときには、自分のプロジェクトに必要なモデルの選び方、プロンプトの書き方、編集の進め方、そしてチームで回すための運用ルールまでを、ひとつの流れとして組み立てられるようになります。
プリプロダクション:企画と絵コンテで手戻りを防ぐ
目的・尺・配信先を最初に固定する
制作の出発点は「何のために作るのか」です。企業の製品紹介、SNSの認知獲得、教育コンテンツ、個人の創作、プレゼン資料の挿入映像。目的が変われば、必要な尺も解像度も、そして求められる一貫性の水準も変わります。15秒の縦動画ならカット数は3〜5、30秒なら6〜10、1分を超えると20カット以上を想定します。尺を先に決めておくと、生成すべき素材の数が具体的な数字になり、スケジュールが現実的になります。
配信先も重要です。縦型のショート動画、横型の長尺動画、正方形のSNS投稿、プレゼン用の16:9、サイネージの特殊比率。生成後にアスペクト比を変えると構図が破綻しやすいため、最初から出力比率を決めてプロンプトや設定に反映させます。
ショットリストと絵コンテの作り方
ショットリストは、カット番号、内容、尺、カメラワーク、必要な素材、担当者の6列で作ると実用的です。表計算ソフトで十分機能します。絵コンテは手描きのラフで構いません。重要なのは「どのカットがどのカットにつながるか」を視覚的に確認することです。AI生成はカット単体の品質が高くても、つなげると破綻することがよくあります。先に並べておけば、つながりの弱い箇所を生成前に修正できます。
参照素材とムードボードを集める
色味、服装、照明、レンズの質感。言葉で説明しづらい要素は参照画像で伝えるのが最も確実です。ムードボードを10枚程度用意し、共通する要素を言葉に変換しておくと、プロンプトの精度が上がります。たとえば「夕方の逆光」「浅い被写界深度」「粒子感のあるフィルム質感」といった語彙に落とし込めれば、以降のカットでも同じ表現を再現しやすくなります。
生成モデルを選ぶための判断基準
写実・アニメ・モーションの得意分野で選ぶ
モデル選びで最初に見るべきは、解像度のスペックではなく「何を得意とするか」です。写実的な人物や風景に強いモデル、イラストやアニメ調の線を安定して出すモデル、カメラワークや動きの自然さに強いモデル、テキスト・トゥ・ビデオと画像・トゥ・ビデオで挙動が異なるモデル。同じプロンプトを複数のモデルに投げ、3秒だけ生成して比較する「味見テスト」を最初に行うと、後工程での迷いが激減します。
解像度・尺・速度のトレードオフ
高解像度の長尺生成は、時間も計算資源も大きく消費します。実務では、まず低解像度・短尺で構図と動きを検証し、採用が決まったカットだけを高解像度で再生成する二段構えが効率的です。動きの激しいカットは崩れやすいため、尺を短く切ってつなぐほうが結果が安定します。
ライセンスと商用利用の確認
生成物をクライアントワークや広告で使う場合、利用条件の確認は必須です。学習データの扱い、生成物の権利、商用利用の可否、クレジット表記の要否は、モデルごとに異なります。契約前に条件を確認し、社内のチェックリストに残しておくと、後のトラブルを防げます。
プロンプト設計の実践フレームワーク
被写体・カメラ・照明・動きの4要素
安定した出力を得るには、プロンプトを4つの層に分けて書きます。第一層は被写体(誰が、何が、どんな服装で、どんな表情か)。第二層はカメラ(画角、レンズの印象、カメラの位置、動き)。第三層は照明と色(時間帯、光源の方向、色温度、質感)。第四層は動きと時間変化(何がどう変化するか)。この順番で書くと、抜けが減り、修正箇所も特定しやすくなります。
時間変化を明示する
動画生成では「静止画の説明」だけでは不十分です。開始時の状態と終了時の状態を書き、その間の変化を指定します。「手前に歩いてくる」「カメラがゆっくり右へパンする」「煙が画面左手から立ち上る」など、動きのベクトルを言葉にすることが重要です。
ネガティブ指定とよくある失敗
避けたい要素はネガティブ指定に回します。文字の混入、余分な手足、ゆがんだ顔、過度な彩度、不自然な手の形などが典型です。ただしネガティブ指定を増やしすぎると、全体的に動きが止まり、無難で退屈な映像になりがちです。本当に困っている要素だけを3〜5個に絞るのが実践的です。
キャラクターとシーンの一貫性を保つ方法
参照画像とシード値の固定
複数カットに同じ人物を登場させる場合、テキストだけで同一性を保つのは困難です。参照画像を用意し、構図を変えながら同じ人物を登場させる方法が現実的です。シード値を固定できるモデルなら、シードと参照画像を組み合わせることで、髪型や服装の揺れを大幅に抑えられます。
スタイルガイドを数値と言葉で持つ
「色温度はやや暖色」「コントラストは中庸」「粒子は弱め」「カメラは基本的に固定か緩やかなスライド」。こうしたルールを一文でよいので文書化します。スタイルガイドがあると、複数人で作業しても仕上がりがそろいます。
連続カットのつなぎ方
一貫性は素材単体ではなく、つなぎで決まります。前のカットの終わりの構図と、次のカットの始まりの構図を近づける、視線の方向をそろえる、照明の方向を変えない。この3点を守るだけで、別々に生成したカットでも自然につながります。逆に、急に照明の向きが変わると、同じ人物でも別人に見えます。
音声・音楽・編集をどう統合するか
ナレーションとリップシンク
音声を後から載せる場合、カット尺を音声に合わせて調整するほうが、リップシンクを合わせるよりも簡単です。話者の口元を映すカットは短く切り、表情や手元、背景のカットでつなぐと、同期のズレが目立ちにくくなります。
音楽と効果音の設計
音楽は最後に足すのではなく、編集の初期に置くほうが作業が速くなります。ビートに合わせてカットを切るだけで、全体のテンポが整います。効果音は「見えているものの音」を足すと説得力が増します。足音、衣擦れ、環境音、空気感。逆に効果音を盛りすぎると、映像の粗が目立ちます。
カットのリズムとテンポ
同じ素材でも、カットの長さを変えるだけで印象が変わります。導入はやや長め、中盤は短くテンポよく、締めは余韻を残して長めに。この緩急があると、短尺でも物語を感じさせられます。
後処理とクオリティ管理
アップスケールとフレーム補間
生成した映像をそのまま書き出すと、細部の甘さやカクつきが残ることがあります。解像度を上げる処理と、フレームを補間してなめらかにする処理を組み合わせると、見た目の印象が大きく改善します。ただし補間は動きの速いカットで破綻しやすいため、適用するカットを選びます。
カラー調整とグレーディング
カットごとに色味がばらつくのは、AI生成で最も多い悩みです。撮影素材と同様に、全体に共通のルックを適用し、その後でカット単位の微調整を行います。先に全体をそろえ、例外だけを個別に直す順番が効率的です。
品質チェックの基準を決める
「顔が崩れていないか」「手指が破綻していないか」「カメラの動きが不自然でないか」「色が隣のカットと合っているか」「テロップの可読性はあるか」。チェック項目を5〜7個に絞って一覧化しておくと、見落としが減ります。
チーム運用とコストを抑える設計
命名規則とフォルダ構成
生成素材は名前が似たものが大量に増えます。プロジェクト名・カット番号・バージョン・モデル名を組み合わせた命名規則を最初に決めます。フォルダは素材、選別済み、編集プロジェクト、書き出しの4層で十分です。
レビューとバージョン管理
「どのカットの、どのバージョンに対する指摘か」を明確にしないと、修正が迷走します。動画にタイムコードを入れて共有し、コメントはカット番号で指定します。大きな変更は前後に分けて保存し、戻れる状態を保ちます。
低コストで試作し、本番は確定後に
試作は低解像度・短尺で行い、構図と動きが固まってから高品質で作り直します。また、よく使う構図や照明の設定をテンプレート化して再利用すると、作業時間と計算資源の両方を節約できます。コストが気になる場合は、生成回数を減らすよりも、手戻りの回数を減らすほうが効果的です。
よくある失敗とトラブルシューティング
顔や手指が崩れる
動きが大きいカット、顔が画面端にあるカット、複数人が重なるカットで発生しやすいです。構図を単純化し、人物を画面中央に置き、動きを減らすと改善します。それでも直らない場合は、顔のアップを使わず、手元や後ろ姿でつなぐ編集上の回避も有効です。
意図しないカメラワークになる
カメラの動きを書いていないと、モデルが勝手に動かすことがあります。逆に動きを細かく指定しすぎると破綻します。「固定」「ゆっくり前進」「緩やかなパン」の3種類程度に絞って指示するのが安定します。
ちらつき・フリッカーが出る
フレーム間で明るさや質感が揺れる現象です。照明条件を固定し、テクスチャの強い背景を避け、必要なら補間処理で軽減します。また、生成したカットを短く切って使うと目立ちにくくなります。
生成が遅い・失敗する
入力が複雑すぎる、尺が長すぎる、解像度が高すぎるのが主な原因です。要素を減らし、尺を短く分割し、解像度を下げて検証します。うまくいった設定を記録しておくと、次回の再現が容易になります。
よくある質問(FAQ)
初心者はどの工程から始めるべきですか
企画とショットリストから始めてください。いきなり生成を始めるより、15秒でカット4つの短い企画を1本作り切る経験のほうが、はるかに学習効率が高いです。
生成モデルはひとつに絞るべきですか
用途によります。写実とアニメでは得意分野が異なるため、2〜3種類を使い分けるのが現実的です。ただし管理が複雑になるので、プロジェクトごとに主軸を1つ決めます。
一貫性を保つ最も簡単な方法は
参照画像を用意し、構図と照明の方向をカット間でそろえることです。テキストだけで同一人物を再現しようとするのは、最も難易度が高い方法です。
長尺の動画は作れますか
短いカットを多数生成し、編集でつなぐ方法が現実的です。1本の長い生成に頼るより、制御しやすく修正も容易です。
音声は先に作るべきですか、後ですか
ナレーションがある場合は先に作り、その尺に映像を合わせるほうが作業が速くなります。音楽も早い段階で置くと、カットのリズムが決まります。
どのくらいの試行回数を見込むべきですか
カットあたり3〜5回の生成を想定しておくと、スケジュールが破綻しにくくなります。重要なカットほど回数を多めに確保します。
商用利用で気をつけることは
利用条件の確認、参照素材の権利、生成物の扱いの3点です。制作前に条件を確認し、記録として残しておくと安全です。
クオリティを上げる最短ルートは
プリプロダクションの精度を上げることです。絵コンテと参照素材がしっかりしていれば、生成と編集の手戻りが大幅に減り、結果として品質も安定します。

