AI動画制作のワークフロー全体像
AIによる動画生成は、もはや「プロンプトを一度入力して奇跡を待つ」工程ではありません。企画、設計、生成、選別、編集、仕上げという複数の工程が連なる制作パイプラインであり、各工程に判断基準とチェックポイントが存在します。生成モデルの性能が上がるほど、成果物の差を生むのはモデルの新旧ではなく、前後の工程設計です。
標準的な流れは次の6段階です。
- 企画:誰に何を届けるか、尺と媒体、トーンを決める。
- 設計:絵コンテとショットリストを作り、必要な素材を洗い出す。
- 生成:テキスト・画像・動画から素材を生成し、テイクを量産する。
- 選別:使えるテイクだけを残し、足りないカットを追加生成する。
- 編集:カットをつなぎ、音声・字幕・カラーを整える。
- 仕上げ:書き出し設定、権利確認、表記ゆれの点検を行う。
重要なのは、この流れが一方通行ではないことです。編集で足りないと気づけば設計に戻り、生成のブレが大きければ参照素材を追加します。反復を前提にし、1回の生成で完璧を狙わないほうが結果的に速く仕上がります。
初心者がつまずきやすいのは、工程2を飛ばして工程3から始めることです。ショットリストがないまま生成を繰り返すと、使える素材が数本しか残らず、結局すべて作り直しに近い作業になります。逆に、尺とカット割りが決まっていれば、生成は「必要なピースを埋める作業」に変わり、判断が速くなります。
もう一つの原則は、素材を粗く速く作り、後工程で質を上げるという順序です。最初から高解像度・長尺で生成すると、1本あたりの待ち時間と修正コストが膨らみます。まず短尺・低解像度で構図と動きを確認し、採用が決まったテイクだけを高品質化する流れが現実的です。
さらに、工程ごとに「合格ライン」を決めておくことも有効です。たとえば生成段階では、輪郭の破綻がなければ仮採用とし、細部の粗さは編集段階の補正で吸収する、と決めておきます。すべての工程で完璧を求めると、どこまでも終わりません。
プリプロダクション:生成前に決める7つの要素
生成の前に決めておくべき項目は7つあります。ここを曖昧にしたまま生成に入ると、後工程で必ず手戻りが発生します。
- 目的と媒体:縦型ショートか横型の解説動画か。媒体によってアスペクト比、テロップの大きさ、冒頭のつかみ方が変わります。
- 尺とテンポ:15秒、30秒、3分ではカット数と1カットの長さが変わります。目安として、15秒なら4〜6カット、30秒なら8〜12カット、3分なら40〜70カットです。
- トーンと参照:色調、光の質、フィルムルックかクリーンなCGか。参照画像を3枚ほど用意すると指示が安定します。
- ナレーションの有無:ナレーションありなら尺は音声で決まります。先に台本を書き、文字数を尺に合わせます。
- 登場人物の設定:年齢、服装、髪型、持ち物。テキストで定義し、参照画像とセットで管理します。
- カメラの基本方針:固定多めか、手持ち風か、ドローン風の移動か。作品全体で統一すると素人っぽさが減ります。
- 納品形式:解像度、フレームレート、コーデック、字幕の有無、ファイル名の規則。
| 項目 | 決めること | 後工程への影響 |
|---|---|---|
| アスペクト比 | 9:16 / 16:9 / 1:1 | 構図とテロップ位置 |
| 1カットの尺 | 1〜3秒中心か、5秒以上か | 生成の難易度と編集リズム |
| 光の方向 | 逆光、順光、サイド光 | 人物の印象と一貫性 |
| 色温度 | 暖色寄り、寒色寄り | シーン間のつながり |
| 音の設計 | 環境音あり、音楽のみ | 編集の手間と没入感 |
この段階で絵コンテを簡単な棒人間でもよいので描いておくと、生成時の指示が具体的になります。「人物が歩く」ではなく「左から右へ歩き、途中で立ち止まって振り返る」と書けば、必要なカット数も見えてきます。
台本とショットリストは別々に管理するのがおすすめです。台本は時間軸の設計図、ショットリストは素材の発注書です。台本の一文が複数カットに分かれることも、複数の文が1カットに収まることもあります。両者を混ぜると、生成の進捗が見えにくくなります。
プリプロダクションで時間をかけるほど、生成の試行回数は減ります。逆に言えば、生成の試行回数が減らないときは、設計が足りていないサインです。
モデルとツールの選び方:判断基準を整理する
一口に動画生成といっても、用途ごとに適したモデルの種類が異なります。
| 種類 | 入力 | 向いている用途 |
|---|---|---|
| テキスト→動画 | 文章のみ | 風景、抽象表現、雰囲気カット |
| 画像→動画 | 1枚の画像と指示 | キャラクター固定、商品カット |
| 動画→動画 | 既存映像と指示 | スタイル変換、色調の統一 |
| モーション制御 | 参照動画と人物画像 | 決まった動きの再現 |
| リップシンク | 顔画像と音声 | トーク、ナレーション主体の映像 |
| アップスケール | 生成済み素材 | 最終品質への引き上げ |
選定の判断軸は7つです。第一に一貫性。同じ人物や場所が複数カットに登場するなら、参照画像を扱えるモデルが有利です。第二に動きの自然さ。特に手、髪、布、水の動きは差が出ます。第三にカメラ制御。パン、チルト、ズーム、ドリーを指示できるかどうかで表現力が変わります。第四に解像度と生成できる尺。長尺を一度に生成できるモデルは便利ですが、破綻も大きくなりがちです。第五に生成速度。試行回数を稼げるかどうかは品質に直結します。第六にライセンスと商用利用の条件。案件で使うなら利用規約と学習データの扱いを確認します。第七に素材管理。生成履歴、プロンプト、参照画像をまとめて保存できる環境かどうかは、後の再利用で効いてきます。
おすすめの運用は、単一のモデルに依存しないことです。構図の検証は速いモデル、本番カットは高品質なモデル、人物のアップは参照画像に強いモデル、というように工程ごとに使い分けます。切り替えの手間は、1つのモデルで粘る手間より小さくなることが多いです。
ツールを増やしすぎるのも考えものです。同時に扱うモデルは3つまでに絞り、それぞれの得意分野を短いメモにまとめておきます。「速いが手が崩れる」「動きは滑らかだが色が転ぶ」といった特徴を記録しておけば、選定の迷いが減ります。
プロンプト設計:映像を意図通りに操る
基本の型
プロンプトは「被写体 → 動作 → 環境 → カメラ → 照明 → スタイル → 制約」の順で組み立てると安定します。
若い女性が白いコートを着て雪の街道を歩く / 両手はポケット / 足元から湯気
環境:夕暮れの商店街、淡い雪、遠景に山並み
カメラ:ゆっくり前進するトラッキング、目線の高さ、35mm相当
照明:逆光の柔らかい光、輪郭にリムライト
スタイル:落ち着いた色調、フィルムグレイン弱め、浅い被写界深度
制約:顔の向きは変えない、背景の文字は映さない
日本語で書いてもうまくいかない場合は、同じ内容を英語に直して試します。モデルによって得意な言語が異なるため、両方をテンプレートとして保存しておくと切り替えが速くなります。
カメラワークの語彙を揃える
曖昧な言葉は再現性を下げます。チーム内で語彙を固定しましょう。
| 意図 | 使う言葉 | 補足 |
|---|---|---|
| 静かに見せる | 固定、三脚、微動のみ | 人物の表情が主役 |
| 追いかける | トラッキング、並走 | 速度の指定を添える |
| 広がりを見せる | クレーンアップ、引き | 止まる位置を指定 |
| 緊張を作る | 手持ち、肩乗せ、微細な揺れ | 揺れは弱めに指定 |
| 物を見せる | インサート、俯瞰、寄り | 尺は短く |
ネガティブ指定と制約
「何をしないか」を書くことも重要です。ただし、否定形はかえってその要素を呼び込むことがあります。望まない要素は、肯定形の代替案に置き換えるほうが確実です。たとえば「文字を出さない」ではなく「背景は無地の壁」と指定します。「暗くしない」ではなく「明るい昼光」と書きます。
制約は3つまでに絞ります。制約が多すぎるプロンプトは、モデルにとって矛盾した指示になり、平均的な無難な映像に落ち着きます。
差分テストで再現性を上げる
同じプロンプトを複数回実行し、どの要素がブレるかを観察します。ブレる要素はプロンプトから削り、参照画像で固定します。1回の実行で判断せず、最低3回は試して傾向を見るのが現実的です。当たったプロンプトは必ずテキストファイルに保存し、改善した版と並べて残します。
保存の単位は「カット」ではなく「目的」にします。「雪の街道を歩く人物」という目的に対して、複数のプロンプト案と結果を並べると、再利用しやすくなります。
ショット設計とカメラワークで物語を組み立てる
ショットリストは、番号、内容、尺、カメラ、場所、登場人物、優先度の7列で作ると実用的です。優先度はA(必須)、B(あると良い)、C(差し替え可能)の3段階にします。生成がうまくいかないカットは、BやCに置き換えるか、別の表現に逃がす判断ができます。
カットのつなぎ方には基本の型があります。会話や動作は、同じ方向から撮ったカットをつなぐと自然に見えます。逆に、人物の位置関係を説明したいときは、引きのカットを一度挟みます。AI生成ではカットごとに構図がばらつくため、つなぎの前後で視線の方向と人物の位置を揃えることが特に重要です。
尺の設計も編集前提で考えるべきです。1カット1〜2秒の短いカットを連ねると軽快な印象になり、3〜5秒のカットを並べると落ち着いた印象になります。生成した素材が長くても、編集で切り詰めれば問題ありません。逆に短い素材は伸ばせないため、生成時は少し長め(3〜5秒)に作っておくのが安全です。
トランジションは最小限にします。AI生成の映像は光や色がカットごとに揺れるため、派手なトランジションは違和感を増幅させます。基本はカットつなぎ、色が大きく変わる場合だけ短いホワイトやブラックを挟む程度で十分です。
Bロール(補助カット)を多めに用意しておくと、編集の自由度が上がります。人物の手元、風景、小物、空、水面など、物語に直接関係しないカットを10本ほど余分に作っておくと、尺の調整や間の埋め合わせに使えます。
キャラクターとスタイルの一貫性を保つ方法
一貫性は、AI動画制作で最も難しい課題です。対策は「参照で固定する」「言葉で定義する」「検証する」の3段構えになります。
参照で固定する場合、キャラクターごとに次の画像を用意します。正面のバストアップ、斜め45度、横顔、全身、表情違い2種。これらをまとめてキャラクターシートと呼び、ファイル名に人物名とアングルを含めます。生成時は同じ人物のカットで同じ参照画像を使い回します。
言葉で定義する場合は、変更しない要素と変更する要素を分けて書きます。変更しない要素は髪型、瞳の色、服装の素材、年齢感、体格。変更する要素は表情、ポーズ、背景、光。テンプレートとして先に固定部分を書き、可変部分だけを差し替える運用にすると、記述の揺れが減ります。
スタイルの一貫性は、色と光で作ります。シーンごとに主要な色を3色までに絞り、光の方向を統一します。昼のシーンは逆光、夜のシーンは街灯のサイド光、といったルールを決めておけば、カットが変わっても同じ作品に見えます。
検証の方法は単純です。採用候補のカットを横並びに並べ、サムネイル状態で見ます。同じ人物に見えるか、同じ時間帯に見えるかを確認します。違和感があれば、そのカットだけを再生成します。1カットずつ判定するのではなく、並べて判定するほうが差異に気づけます。
小道具やロゴなど、細部の一貫性は後工程で補正する前提でも構いません。編集ソフトで色を合わせたり、固定のグラフィックを重ねたりするほうが、生成をやり直すより速い場合が多いです。
音声・字幕・編集:素材を作品へ仕上げる工程
生成した素材は、そのままでは作品になりません。編集工程で次の順に整えます。
- 選別:各カットの採用テイクを決め、フォルダを分けます。ファイル名はカット番号とテイク番号を含めます。
- 粗編集:絵コンテの順に並べ、尺を確認します。この段階では色も音も整えません。
- リズム調整:間延びする箇所を詰め、テンポを作ります。
- 音声:ナレーション、環境音、効果音、音楽の順に重ねます。
- 字幕:テロップの位置と行数を統一します。
- カラー:全カットに同じ色調を適用し、シーン間の差を縮めます。
- 書き出し:解像度、フレームレート、ビットレートを納品形式に合わせます。
音声は映像の印象を大きく左右します。特に環境音は、AI生成映像の不自然さを隠す効果があります。街の雑踏、風、室内の空調音などを薄く敷くだけで、映像の説得力が上がります。
リップシンクを使う場合、先に音声を確定させます。音声を後から差し替えると口の動きがずれるため、ナレーションやセリフは編集の早い段階で固めます。
字幕は読みやすさを優先します。1行の文字数は全角で15〜20文字、同時表示は2行まで、表示時間は最低1秒とします。縦型動画では画面下から3分の1を避けると、UIに隠れにくくなります。
高解像度化は最後に行います。編集の途中でアップスケールすると、修正のたびに処理時間がかかります。カット構成が固まり、色調整が終わった段階でまとめて処理するのが効率的です。
品質管理チェックリストとよくある失敗
書き出し前のチェック項目を固定しておくと、確認漏れが減ります。
- 冒頭3秒で内容が伝わるか。
- カットのつなぎで視線や位置が飛んでいないか。
- 人物の手、指、髪、耳などの破綻が残っていないか。
- 背景の文字やロゴが意図せず映っていないか。
- 音声の音量が一定か。急に大きくなる箇所がないか。
- 字幕の誤字、表記ゆれ、改行位置が揃っているか。
- 色調がシーン間で揃っているか。
- 納品形式とファイル名が指定どおりか。
よくある失敗と対策を整理します。
| 失敗 | 原因 | 対策 |
|---|---|---|
| 人物が別人に見える | 参照不足、記述の揺れ | キャラクターシートを固定 |
| 動きが不自然 | 動作指示が多すぎる | 動作は1カット1つに絞る |
| 色がカットごとに違う | 照明指定がない | 光の方向を全カットで統一 |
| 尺が足りない | 生成素材が短い | 生成は長め、編集で詰める |
| 全部のカットが平凡 | 制約が多すぎる | 制約は3つまでに減らす |
| 編集で破綻に気づく | 選別が甘い | サムネイル並べで確認 |
特に多いのが、生成段階で妥協したカットを編集で無理に使ってしまうケースです。破綻が目立つカットは、思い切って別の表現に置き換えたほうが最終的な品質は上がります。
チーム制作と反復改善の運用ルール
複数人で制作する場合、ルールを決めておかないと素材が散らかります。まずファイル名の規則を統一します。案件名、カット番号、テイク番号、状態(仮、採用、却下)を含める形式が扱いやすいです。
次に、プロンプトと参照画像をカット単位で保存します。誰がどの指示で生成したかが分かれば、同じ結果を再現できます。これは属人化を防ぐ最も簡単な方法です。
レビューは2段階に分けます。第1段階は粗編集版で構成と尺を確認し、第2段階で色と音を確認します。1回のレビューで全部を見ようとすると、細部の指摘に時間を取られ、構成の問題が後回しになります。
低解像度のプレビューを共有する習慣も有効です。大容量ファイルを毎回共有すると確認が滞ります。判断は粗い映像で十分にできます。
改善の記録は、失敗の記録のほうが価値があります。「このプロンプトでは手が崩れる」「この参照画像では髪色が変わる」といった情報を蓄積すると、チーム全体の試行回数が減ります。
権利と同意の管理も運用の一部です。実在の人物を模した生成、第三者の著作物に似た表現、ブランドに似た意匠は避けます。素材の出所と利用条件を記録し、案件ごとに確認できる状態にしておきます。
よくある質問
生成した映像が思ったより短いのですが
生成できる尺には上限があることが多いため、長めに作って編集で詰めるのが基本です。1カット3〜5秒を目安に生成し、使う部分だけを切り出します。足りない場合は、同じ構図で追加生成してつなぐよりも、別アングルのカットを挟んだほうが自然に仕上がります。
人物の顔が毎回変わってしまいます
参照画像を増やし、同一人物のカットでは同じ参照を使い回します。正面、斜め、横顔、全身、表情違いを用意し、変更しない要素をテンプレートとして固定します。それでも揺れる場合は、顔のアップを減らし、引きのカットや手元のカットで構成する方法もあります。
どのモデルを最初に試せばよいですか
速く生成できるモデルから始めるのがおすすめです。構図と動きの方向性を短時間で確認し、採用が決まったカットだけを高品質なモデルに回します。最初から高品質なモデルで試行錯誤すると、待ち時間で判断が鈍ります。
プロンプトは日本語と英語のどちらで書くべきですか
両方を試して、結果が安定するほうを採用します。テンプレートを二重に持っておくと、モデルを切り替えたときも対応できます。意味を変えずに翻訳するのではなく、同じ意図を別の言葉で書くつもりで作ります。
生成の試行回数はどのくらいが目安ですか
1カットあたり3〜5回を目安にします。それを超えても改善しない場合は、プロンプトの調整ではなく、構図やカットの設計を見直すサインです。表現を変えたほうが早く解決します。
音声はいつ作ればよいですか
ナレーションやセリフがある場合は、生成より先に作ります。音声の長さが尺を決めるため、後から作るとカットを全部調整することになります。BGMと環境音は編集の後半で構いません。
スマートフォンだけで制作できますか
短尺の作品であれば可能です。ただし、カット数が増えるとファイル管理が難しくなるため、クラウドストレージと簡単な表計算での進行管理は用意したほうが安全です。
まとめ:再現性のあるワークフローを作る
AI動画制作で成果を分けるのは、モデルの性能差よりも工程の設計です。企画で目的を固め、設計でカットを決め、生成は短尺で速く回し、選別で絞り、編集で音と色を整える。この順序を守るだけで、手戻りの回数は大きく減ります。
最初から大きな作品を狙う必要はありません。15秒、6カットの短い作品を1本、決められた手順で完成させてみてください。その過程で、自分の環境でどこがボトルネックになるかが見えてきます。生成が遅いのか、指示が曖昧なのか、編集で迷うのか。原因が分かれば、改善すべき点は自然に絞られます。
記録を残すことも忘れないでください。使ったプロンプト、参照画像、却下した理由。これらは次回の制作時間を直接短くします。ワークフローは一度作って終わりではなく、案件ごとに少しずつ更新していくものです。小さな改善を積み重ねることが、結果として最も速い上達の道になります。



