AI動画制作ワークフローの全体像
AI動画生成のツールは短期間で驚くほど増えました。テキストを入力して数秒のクリップを作るだけなら、いまや特別なスキルは必要ありません。しかし、実際に「最後まで見られる動画」を安定して作れる人と、そうでない人の差は、使っているツールの性能差ではなく、工程の設計にあります。一度生成を試して「なんとなく惜しい」と感じた経験があるなら、原因の多くはプロンプトの文言ではなく、前後の工程が抜けていることにあります。
動画制作を料理にたとえるなら、生成AIは強力な調理器具です。器具だけを買い揃えても献立が決まっていなければ皿は出てきません。逆に、献立と段取りが決まっていれば、器具が多少違っても一定の水準に到達できます。AI動画のワークフローを学ぶ意味はここにあります。
パイプラインを8工程に分ける
実務で再現性が高いのは、次の8工程に分ける考え方です。
- 企画とコンセプト設計
- 脚本とログライン
- 絵コンテとショットリスト
- 基準カットの生成とスタイル固定
- カットの量産と選別
- 音声・音楽・効果音の設計
- 編集・色調整・書き出し
- 公開と効果測定、次の改善
この分け方の利点は、問題が起きたときに「どの工程に戻ればよいか」が明確になることです。生成結果が気に入らないとき、多くの人はプロンプトを書き換え続けます。しかし本当の原因がショットリストの粒度や参照画像の設計にある場合、プロンプトを何十回書き換えても解決しません。
やり直しコストを下げるのが目的
工程を分ける最大の目的は、やり直しのコストを下げることです。AI生成は試行回数が物を言う作業ですが、無計画に回数を増やすと時間も費用も膨らみます。逆に、上流の工程で決めごとを済ませておけば、下流では「選ぶ」作業に集中できます。
たとえば、主人公の髪型や服装を文章と参照画像で固定してから量産に入ると、後工程での修正は大幅に減ります。逆に、勢いで20カット生成してから「このキャラクターで統一しよう」と決めると、ほぼ全部を作り直すことになります。作業順序ひとつで工数が数倍変わるのが、AI動画制作の現実です。
ツールより順番が効く
生成モデルは数か月単位で入れ替わります。今日いちばん良いモデルが、半年後にいちばん良いとは限りません。一方で、工程の設計や判断基準は長く使えます。特定のツール名を覚えるよりも、「どの工程で何を決めるか」を身体に入れておくほうが、結果的に強い制作体制になります。
企画とコンセプト設計:最初の30分で勝負が決まる
AI生成は高速なので、企画を飛ばしてすぐ作り始めたくなります。しかし最初の30分を企画に使うと、後の数時間が節約できます。ここで決めるべきは、テーマの深掘りではなく「判断に迷ったときの基準」です。
誰に・何を・どの尺で
最初に決めるのは次の3点です。
- 誰に向けるか(年齢層、興味、視聴する場所)
- 何を伝えるか(1文で言い切れるか)
- どのくらいの尺か(15秒、60秒、3分、10分)
この3点が曖昧なまま生成を始めると、カットが増えるほど動画の焦点がぼやけます。とくに尺の決定は重要です。15秒の動画に10カットも入れれば、1カットあたり1.5秒しか使えません。逆に3分の動画を5カットで構成すると、テンポが重くなります。
1行ログラインとキービジュアルの言語化
企画の中心には、1行のログラインを置きます。「誰が、何を、どうする話か」を1行で書くだけです。書けない場合は、まだ企画が固まっていません。
次に、その動画を象徴する1枚のイメージを言葉にします。これは後工程で基準カットを作るときの指針になります。「夕暮れの屋上、逆光、手前の金網越しに街を見下ろす人物」のように、光・構図・被写体まで具体的に書くと、生成の再現性が上がります。
トーン&マナーを数値と形容詞で固定する
トーン&マナーは「かっこいい」では機能しません。形容詞だけでなく、数値や具体物に落とし込みます。
- 色:寒色中心、彩度は低め、影は青みを強く
- 光:逆光気味、コントラストは中程度
- レンズ:35mm相当、浅い被写界深度
- テンポ:1カット2〜4秒、カットチェンジはビートに合わせる
このメモをテキストファイルに残しておくと、生成プロンプトにも編集にもそのまま流用できます。属人的な感覚を再現可能な指示に変えることが、ワークフロー設計の第一歩です。
脚本・絵コンテ・ショットリストの作り方
脚本は文章、絵コンテは絵、ショットリストは表です。AI動画制作では、この3つの中でショットリストが最も重要になります。生成はカット単位で行うため、カットの一覧がそのまま作業指示書になるからです。
ショットリストの粒度は「1カット=1動作」
ショットリストには最低限、次の列を用意します。
| 列 | 内容 | 例 |
|---|---|---|
| カット番号 | 通し番号 | 04 |
| 尺 | 秒数 | 3.0秒 |
| 構図 | サイズとアングル | ミディアム、斜め前 |
| 動作 | そのカットで起きること | 振り返って微笑む |
| カメラ | 動き | ゆっくり前進 |
| 音 | 台詞・効果音 | 風切り音 |
ここで守るべき原則は「1カットに1動作」です。1つのクリップに「歩く」「止まる」「振り返る」を全部入れると、生成モデルは途中で形が崩れやすくなります。動作を分割してつなぐほうが、結果的に自然な映像になります。
プロンプトに必ず入れる5要素
生成プロンプトは毎回ゼロから書かず、テンプレート化します。安定するのは次の5要素です。
- 被写体:誰が、何が、どんな見た目か
- 動作:何をしているか、どの方向へ動くか
- カメラ:距離、アングル、レンズ、動き
- 光と環境:時間帯、光源、天候、背景
- スタイル:質感、色調、参照する映像ジャンル
この順番で書くと、抜けが減ります。とくにカメラ指示を省略すると、モデルは勝手に動きを決めてしまい、カット間のつながりが悪くなります。
尺の割り付けとテンポ設計
尺の割り付けは編集の成否を握ります。目安として、導入は短く、展開で情報を出し、最後に余韻を置きます。60秒の動画なら、0〜5秒でつかみ、5〜45秒で本題、45〜60秒で締め、という配分が扱いやすい形です。
生成の都合も考慮してください。多くのモデルは2〜5秒のクリップを得意とし、長尺になると一貫性が落ちます。長いカットが必要な場合は、短いクリップをつないで1つの長回しに見せるほうが安全です。
基準カットの生成とスタイル固定
量産の前に、必ず「基準カット」を1つ完成させます。これは動画全体の基準になるカットで、色・光・人物の造形・カメラの質感がここで決まります。
まず1カットを完成させる
基準カットは完成度にこだわり、納得いくまで試します。この段階で10回、20回と試行するのは無駄ではありません。ここで得た設定をそのまま横展開できるからです。逆に基準カットが曖昧なまま量産すると、カットごとに雰囲気が変わり、編集でどうにもならなくなります。
基準カットを決めるときは、次の3点を記録します。
- 使用したプロンプト全文
- シード値や参照画像
- 使用モデルと設定(解像度、アスペクト比、動きの強さ)
この記録が、動画のスタイルガイドになります。
キャラクターの一貫性を保つ3つの方法
同じ人物を複数カットに登場させるとき、一貫性は最大の課題です。実務で有効な方法は3つあります。
- 参照画像を使う:正面と横顔など複数アングルを用意し、毎回同じ画像を参照させる
- 画像から動画へ:先に画像生成でキャラクターを確定し、その画像を動画生成の開始フレームにする
- 固有の特徴を文章で固定する:髪色、瞳の色、服の素材、アクセサリーを毎回同じ言葉で書く
もっとも安定するのは2番目の方法です。静止画で納得いくまで追い込み、動画化するときに動きだけを指定する。この流れにすると、顔が変わる問題がほぼ解消されます。
スタイルをテキストで再現可能にする
スタイルは感覚ではなく、コピー可能なテキストにします。たとえば「フィルムグレイン強め、ハイライトは柔らかく、影は締める、色温度はやや低め」といった記述をテンプレート化し、全カットのプロンプトに貼ります。
さらに、参照画像を1枚用意して全カットで共有する方法も有効です。テキストと画像の両方で固定すると、モデルを乗り換えたときにも雰囲気を維持しやすくなります。
モデルとツールの選定基準
生成モデルは用途によって得意分野が異なります。「どれが最強か」ではなく「このカットにどれが合うか」で選ぶのが実務的です。Runway、Kling、Luma、Pika、Veo、Sora など、主要な選択肢はそれぞれ持ち味が違います。
実写寄り・アニメ寄り・モーション特化
大まかに3つのタイプで考えます。
- 実写寄り:人物の肌や質感、光の表現が自然。広告や商品紹介に向く
- アニメ・イラスト寄り:線が安定し、非現実的な演出に強い。キャラクター動画に向く
- モーション特化:カメラワークや物体の運動が滑らか。アクションや抽象表現に向く
動画全体を1つのモデルで作る必要はありません。人物カットは実写寄り、背景の空撮風カットはモーション特化、といった混成も一般的です。ただし混ぜるときは、色調を編集でそろえる工程を必ず入れてください。
解像度・生成時間・コストのトレードオフ
高解像度・長尺・高品質を同時に満たす生成は、時間も費用もかかります。実務では次の順で優先順位を決めます。
- 最終的に必要な解像度(配信先で決まる)
- 1カットの尺(構成で決まる)
- 試行回数(スケジュールで決まる)
縦型ショートは1080×1920、横型は1920×1080が基本です。SNS向けなら最初から縦で生成し、後からトリミングしないほうが構図が破綻しません。
縦型ショートと横型長尺で変わる最適解
縦型は画面が狭いため、被写体を大きく写し、背景情報を削る必要があります。テロップも必須に近い存在です。一方、横型は余白を使った構図が成立し、長回しや群衆シーンも映えます。
同じ企画でも、縦と横ではショットリストを別々に作ることをおすすめします。片方を流用すると、どちらかで必ず破綻が出ます。
テキストや手など弱点の補い方
生成モデルは手の指や文字を苦手とする傾向があります。対策は明確です。
- 手:手を画面に入れない構図にする、または手前でぼかす
- 文字:生成で描かせず、編集ソフトでテロップとして載せる
- ロゴ:画像として合成する
生成に苦手な領域を無理に任せず、後工程に逃がす判断が品質を上げます。
音声・音楽・効果音の設計
映像の印象は音で大きく変わります。AI生成映像は無音で出力されることが多いため、音声工程を独立して設計することが重要です。
ナレーションとリップシンク
ナレーションは音声合成で作る場合、話速と間の取り方を調整します。日本語は英語より情報密度が高く、同じ文字数でも短い時間で読めます。尺に合わせて原稿を調整するか、読み上げ速度を落として余韻を作るかを選びます。
人物が話すカットではリップシンクを使いますが、口元の動きが不自然になりやすいため、顔のアップは短く使うのが安全です。長い会話は、聞き手のリアクションカットを挟んで成立させます。
BGMと効果音のレイヤリング
音は3層で考えます。
- ベース:BGM。動画全体の感情を決める
- 中間:環境音。風、街噪、室内の残響
- 前景:効果音。動作や切り替えのアクセント
AI生成映像は動きが独特なため、効果音で動きを補強すると説得力が増します。カットの切り替えに短い音を置くだけで、編集の粗さが目立たなくなります。
ミックスの基本バランス
最終的な音量バランスは、ナレーションを基準に決めます。ナレーションが最も聞き取りやすく、BGMはその下、効果音は瞬間的に前に出る、という関係です。スマートフォンのスピーカーで試聴し、ナレーションが埋もれていないか必ず確認してください。
編集・仕上げ・書き出し
生成したカットは素材であり、作品ではありません。編集でリズムと意味を与えます。
カットのリズムとジャンプカット
AI生成のカットは、つないだときに動きの勢いが途切れやすいという特徴があります。対策として、動きの方向をそろえる、カットの変わり目で動きのある瞬間を使う、同じ構図を連続させない、といった基本を守ります。
テンポを上げたいときはカットを短くしますが、短くしすぎると内容が伝わりません。情報を伝えるカットは長め、つなぎのカットは短め、という緩急をつけるのがコツです。
色調整と質感の統一
異なるモデルで生成したカットは、色温度やコントラストがばらつきます。編集ソフトで全カットに同じ調整をかけるのではなく、カットごとに寄せたうえで、最後に全体へ共通のルックをかけます。DaVinci Resolve、Premiere Pro、CapCut など、使うツールは問いません。
質感を統一するには、グレインや軽いぼかしを全体に薄くかける方法も有効です。生成の粗さが目立ちにくくなります。
書き出し設定の実務
書き出しで押さえるのは次の点です。
- 解像度:配信先の推奨に合わせる
- フレームレート:素材の多数派に合わせる(24、25、30、60)
- コーデック:H.264が汎用、高品質ならH.265やProRes
- ビットレート:1080pで8〜16Mbps、4Kはその4倍程度を目安
- 音声:AAC 48kHz、ステレオ
フレームレートが混在すると動きがガタつきます。生成時に統一しておくのが理想ですが、難しい場合は編集で変換し、動きの速いカットだけ注意して確認します。
よくある失敗と回避策
キャラクターがカットごとに変わる
最も多い失敗です。原因は参照設計の不足で、解決策は画像から動画への流れに切り替えること、そして特徴を毎回同じ言葉で書くことです。服や髪のディテールは、プロンプトの先頭に固定文として置くと効きます。
手・文字・小物が崩れる
生成の限界であり、完全な解決は現実的ではありません。構図で避ける、後工程で合成する、カットを短くして目立たせない、という3つの対応を組み合わせます。
動きが不自然、途中で形が変わる
長すぎるクリップや複雑な動作が原因です。1カット1動作に分割し、尺を短くします。また、開始フレームと終了フレームを指定できるモデルなら、両端を固定すると崩れが減ります。
尺が足りない、間延びする
生成できる尺と構成上の必要尺がずれることで起きます。先にショットリストで合計尺を計算し、不足する場合はカットを足すのではなく、1カットを分割して見せ方を変えるほうが自然に収まります。
権利・商用利用・肖像の確認漏れ
生成物の利用条件は、ツールごとに異なります。商用利用の可否、生成物の扱い、学習データに関する方針を、制作前に確認しておきます。実在の人物に似た出力、既存キャラクターに似た出力、商標を含む映像は、公開前に必ず見直してください。クライアント案件では、この確認を工程として明記しておくとトラブルを防げます。
公開前チェックリスト
作業の最後に、次の項目を上から確認します。
映像
- 冒頭3秒で内容が伝わるか
- カット間で人物の見た目が破綻していないか
- 色調と質感が統一されているか
- 不要なカットが残っていないか
音声
- ナレーションが聞き取りやすいか
- BGMが邪魔をしていないか
- 無音の間が不自然でないか
- 左右のバランスが偏っていないか
技術
- 解像度とフレームレートが配信先に合っているか
- ビットレートが不足してブロックノイズが出ていないか
- ファイルサイズが許容範囲か
- スマートフォンで再生確認したか
権利と表記
- 商用利用の条件を満たしているか
- 実在人物・既存作品に似ていないか
- 必要な表記や注記が入っているか
公開設計
- タイトルとサムネイルが内容と一致しているか
- 説明文に要点が入っているか
- 縦横の比率が配信先に合っているか
FAQ:よくある質問
AIだけで動画は完結できますか
短尺のSNS動画であれば、生成から編集までAIツールだけで完結できます。ただし長尺や広告用途では、構図の設計、音声の調整、権利確認など、人間の判断が必要な工程が残ります。AIは工程を短縮しますが、判断をなくすわけではありません。
どのツールから始めるべきですか
まずは1つの動画生成モデルと1つの編集ソフトに絞ってください。ツールを増やすほど学びが浅くなります。基準カットを作れるようになってから、用途別に2つ目のモデルを足すのが定石です。
一貫性を保つ最も簡単な方法は
画像生成でキャラクターとスタイルを確定し、その画像を動画生成の開始フレームとして使う方法です。静止画の段階で納得いくまで調整できるため、動画の試行回数を大幅に減らせます。
長尺動画は作れますか
短いクリップをつないで構成する方法が現実的です。1カットを無理に長くするより、複数のカットで1つのシーンを作るほうが破綻が少なくなります。シーン単位でショットリストを分けて管理すると、作業も整理されます。
時間も予算も限られている場合の優先順位は
次の順で投資してください。第一にショットリスト、第二に基準カット、第三に音声、第四に編集のルックです。この4つを押さえれば、使用モデルが変わっても一定の品質を維持できます。
クライアント案件で気をつけることは
納品形式と利用範囲を最初に確認します。加えて、生成物であることの説明が必要かどうか、修正の範囲と回数をどう定義するかを決めておきます。工程を可視化しておくと、修正依頼が来たときにどの段階へ戻るかを合意しやすくなります。
まずは短い1本を作り、8工程のどこでつまずいたかを記録してください。次の制作では、その工程だけを改善します。ワークフローは一度に完成させるものではなく、作品を作るたびに精度が上がっていくものです。

