AI動画制作の全体像:アイデアを映像に変える6つの工程
生成AIを使った動画制作は、ボタンひとつで完成する魔法ではありません。実際の現場では「企画」「設計」「生成」「選別」「編集」「仕上げ」という6つの工程を、行き来しながら進める制作パイプラインとして捉えると、格段にコントロールしやすくなります。AIは「どう作るか」を高速化してくれますが、「何を作るべきか」を決めるのは人間の役割です。ここを曖昧にしたまま生成を始めると、どれだけ高性能なモデルを使っても、素材の山だけが残って作品が完成しないという事態に陥ります。
各工程の役割は次のとおりです。
- 企画:届けたい相手、尺、配信先、トーン、ゴールを言葉にする
- 設計:ショットリスト、簡単な絵コンテ、プロンプト、参照画像を用意する
- 生成:ショット単位で映像を作り、1カットにつき複数案を出す
- 選別:使えるテイクを選び、失敗の傾向を記録する
- 編集:カットをつなぎ、テンポとリズムを組み立てる
- 仕上げ:音声、BGM、色調整、テロップ、書き出し設定を整える
重要なのは、これを一方通行で進めないことです。生成結果を見て企画に戻る、編集してみて追加ショットが必要だと気づく、といった往復が日常的に発生します。だからこそ、工程ごとに「後から直せる形」でデータを残しておくことが、結果的に最も速い制作につながります。
生成AIが変えたのは「撮影の前後」である
従来の映像制作では、撮影そのものが最大のコストでした。ロケの手配、機材、出演者、照明、そして撮り直しの時間。生成AIが圧縮したのは、この撮影工程と、その前後の試行錯誤です。アイデアをその日のうちに映像として確認できるようになったことで、企画会議の質が変わります。頭の中のイメージを言葉で説明するのではなく、実際のカットを見せながら「こうしたい」と話せるようになるからです。
ただし、撮影が不要になったわけではありません。AI生成は「撮影では得られない画」を安価に作る手段であり、実写の質感や偶然性が欲しい場面では依然として撮影が強い領域です。ハイブリッド前提で考えると、判断を誤りにくくなります。
最初に決める3つの数字
制作を始める前に、次の3つを数字で決めておくと迷子になりません。
- 完成尺:15秒、30秒、60秒、3分など。尺が決まれば必要なカット数が逆算できる
- カット数:1カット平均2〜3秒として計算するのが実務的
- 反復回数:1カットにつき何案まで試すか。ここを決めないと無限に生成し続けてしまう
たとえば30秒のショート動画なら、平均2秒で約15カット。1カット3案試すとして45回の生成が必要、という見積もりになります。この見積もりがあるだけで、作業時間と予算の感覚が一気に具体的になります。
企画と設計:プロンプトより先に決めるべきこと
生成の品質を左右するのは、モデルの性能よりも「入力の設計」です。同じモデルでも、設計の質によって出力は別物になります。ここでは生成に入る前に固めておきたい要素を整理します。
ログラインと尺の設計
まず書くべきはログラインです。「誰が、どこで、何をして、どうなるか」を1文にまとめます。たとえば「閉店間際の喫茶店で、店主が常連客のために最後の一杯を淹れる」といった具合です。この1文があると、各ショットが物語に貢献しているかを判断できるようになります。
尺は配信先から逆算します。縦型ショートなら最初の2秒で掴まないと離脱されるため、情報の密度を上げる必要があります。横型の長尺なら、カットの長さを伸ばし、余白で感情を作る設計が向いています。
ショットリストとカメラワークの言語化
ショットリストは表形式で作るのが扱いやすいです。列は「カット番号」「内容」「ショットサイズ」「カメラワーク」「尺」「音」「備考」の7つで十分です。カメラワークは曖昧な形容詞ではなく、次のような具体的な動きで書きます。
- 固定(三脚)、わずかな手ぶれ
- パン(左右)、ティルト(上下)
- ドリーイン/ドリーアウト(前後の移動)
- オービット(被写体の周囲を回る)
- クレーンアップ/ダウン
- 手持ち風の追従
「かっこよく動かす」ではなく「ゆっくり右へパン」と書く。これだけで生成結果のばらつきが減ります。
プロンプトを構造化する5つの要素
映像生成のプロンプトは、思いつきの文章ではなく構造で書きます。基本の5要素は次のとおりです。
- 被写体:誰が、何が。年齢、服装、表情、素材感
- 動作:何をしているか。動詞で具体的に
- 環境:場所、時間帯、天候、周囲の要素
- カメラ:ショットサイズ、レンズ感、動き、アングル
- 光と空気:光源の種類、色温度、粒子感、フィルムルック
例として「薄暗い喫茶店、湯気の立つカップを両手で持つ中年の店主、ゆっくりと顔を上げる、ミディアムクローズアップ、35mm相当、ゆるやかなドリーイン、窓から差し込む夕方の逆光、フィルムグレイン」といった形になります。要素を並べる順番は固定し、毎回同じ順序で書くと、結果の差分が読み取りやすくなります。
ネガティブ指定と除外条件
「崩れた手」「不要なテロップ」「余計な人物の増殖」など、避けたい要素は事前に決めておきます。モデルによってはネガティブプロンプト欄がある場合も、ない場合もありますが、プロンプト本文に「人物は一人だけ」「文字は入れない」と明記するだけでも効果があります。
生成モデルの選び方:品質・速度・一貫性の見極め方
現在の映像生成ツールは、大きく3つのタイプに分かれます。実写寄りのリアリズムを得意とするもの、アニメやイラスト調に強いもの、そして速度と反復に向いた軽量なものです。どれが優れているかではなく、用途で選ぶのが正解です。
実写寄りか、イラスト寄りか
実写寄りの用途では、肌の質感、レンズの収差、光の回り込みといった物理的な整合性が評価軸になります。一方、アニメ調では線の安定性、塗りの一貫性、キャラクターの顔立ちの再現性が重要です。同じ「高品質」でも中身が違うため、テストは必ず自分の用途で行います。
尺・解像度・カメラ制御の制約
ツールごとに、一度に生成できる尺、対応解像度、カメラ制御の細かさが異なります。選定時に確認すべきは次の4点です。
- 1回の生成で何秒まで出せるか(数秒か、10秒以上か)
- カメラワークを数値やUIで指定できるか、プロンプト任せか
- 参照画像を何枚まで受け付けるか
- 縦型・横型・正方形のどのアスペクト比に対応するか
編集でつなぐ前提なら、短い尺でも問題ありません。むしろ短いカットを複数生成して選ぶほうが、破綻のリスクを下げられます。
予算と反復回数のバランス
生成には従量制のコストがかかる場合が多く、反復回数がそのまま費用に反映されます。ここで有効なのは「粗い検証は安い設定で、決定版だけ高い設定で」という二段構えです。低解像度・短尺で構図と動きを確認し、当たりが出たら高品質設定で同じプロンプトを再生成します。
判断の目安として、次の基準を用意しておくと迷いません。
- 構図が7割合っていれば、そのカットは「採用候補」として進める
- 動きが破綻していても、構図が良ければ別カットの参照として残す
- 3案出して全滅したら、プロンプトではなく設計(ショットリスト)を見直す
3案全滅は、モデルの問題ではなく指示の問題であることがほとんどです。
実践ワークフロー:ショット単位で作る
ここからは実際の手順です。ポイントは「静止画で固めてから動かす」という順序を守ること。いきなり動画を生成するより、はるかに歩留まりが上がります。
手順1:キーフレームを作る
最初のカットの「一番見せたい瞬間」を静止画として生成します。ここで構図、光、衣装、表情を確定させます。静止画なら修正が速く、破綻も少ないため、試行錯誤はこの段階に集中させます。気に入った1枚ができるまで、構図を変えながら10〜20枚出すのは珍しくありません。
手順2:画像から動画へ
確定したキーフレームを入力にして動画化します。このとき、動きの指示は最小限にします。「ゆっくり前進」「わずかに目を動かす」程度にとどめ、欲張って複数の動きを重ねると破綻します。1カット1モーションが原則です。
手順3:参照画像でキャラクターを固定する
同じ人物を複数カットに登場させる場合、参照画像の使い方が鍵になります。顔のアップ、正面のバストアップ、全身の3枚を用意し、各カットの生成時に一貫して参照させます。衣装や髪型が変わるカットでは、変更点だけをプロンプトに書き足し、それ以外の記述は前のカットからコピーして使い回します。
手順4:マルチショットの一貫性を保つ
一貫性が崩れる原因は、たいてい「背景の詳細」と「光の方向」のズレです。対策として、作品全体で共有する固定文(スタイル記述)を作ります。
- 光源の方向:画面左から、逆光気味、など
- 色温度:暖色寄り、寒色寄り、ニュートラル
- レンズ感:35mm相当、85mm相当、広角
- 質感:フィルムグレイン、クリーンデジタル、粒子なし
この4行をすべてのプロンプトの末尾に貼るだけで、カット間のつながりが改善します。地味ですが効果は絶大です。
手順5:テイク管理と命名
生成したファイルは必ず規則的に命名します。「作品名_カット番号_テイク番号_採用可否」の形式が扱いやすいです。採用しなかったテイクも消さずに残しておくと、後から「あの動きが使いたい」となったときに救われます。
編集と音:バラバラの素材を一本の作品にする
生成されたカットは、それ単体では作品ではありません。編集で初めて意味が生まれます。ここでの作業は、AIの出力を「素材」として扱い、人間の意図で組み直すことです。
カットのリズム
ショート動画では、最初の3秒で視聴を決めると言われます。冒頭は最も強い画を置き、テンポを速めに。中盤で一度テンポを落として情報を伝え、終盤で再び上げる、という緩急の設計が基本です。
カットの長さは、内容ではなく感情で決めます。驚きの瞬間は0.5秒、余韻を残したい場面は4秒。秒数に正解はありませんが、隣り合うカットの長さが同じにならないよう意識すると、単調さを避けられます。
音声合成とBGM
ナレーションを入れる場合、AI音声合成を使えば収録なしで完結します。ただし、抑揚のない読み上げは一気に安っぽく聞こえます。対策は次の3つです。
- 文を短く区切り、句点ごとに間を入れる
- 強調したい語の前後にポーズを置く
- 同じ話者を作品内で統一し、途中で声を変えない
BGMは著作権的に扱いやすい素材を選び、ナレーションがある場合は2〜3dB下げて被せます。効果音は「動きに合わせて置く」のが基本で、カットの切り替わり、ドアの開閉、足音など、画の動きと音を同期させると没入感が上がります。
色調整と書き出し
生成カットは、カットごとに色温度やコントラストが微妙に異なります。編集の最後に、全カットへ共通のカラー調整を軽くかけ、統一感を出します。やりすぎると不自然になるため、彩度は控えめに、コントラストで立体感を出すのが安全です。
書き出し設定は配信先に合わせます。縦型SNSなら1080×1920、フレームレートは素材に合わせて24または30fps、ビットレートは高めに設定します。ここでケチると、苦労して作った画質が台無しになります。
品質管理チェックリスト:よくある失敗と直し方
AI生成映像には、繰り返し現れる典型的な失敗パターンがあります。事前に知っておけば、修正の初動が速くなります。
| 症状 | 主な原因 | 対策 |
|---|---|---|
| 手や指が崩れる | 動きの指示が多すぎる | 動作を1つに絞り、手を画面の主役にしない |
| 顔が毎カット変わる | 参照画像が不足 | 顔・バスト・全身の3枚を参照させる |
| 画面がちらつく | フレーム間の一貫性不足 | 生成尺を短くし、編集でつなぐ |
| 背景の小物が増殖 | 環境記述が曖昧 | 背景要素を列挙し、数を明記する |
| 文字が崩れる | テキスト生成の限界 | 文字は編集ソフトで後載せする |
| 動きが速すぎる | モーション指示が強い | 「ゆっくり」「わずかに」に言い換える |
修正の優先順位
すべてを直そうとすると時間が溶けます。優先順位は「視聴者が気づくかどうか」です。顔の崩れ、テンポの破綻、音のズレは致命的ですが、背景の些細な不自然さは多くの場合、視聴者は気にしません。完璧を目指すより、作品として成立させることを優先します。
レビューの観点を固定する
複数人で確認する場合、観点を固定しないと意見が噛み合いません。確認項目は「画の一貫性」「テンポ」「音のバランス」「情報の伝達」「冒頭3秒の強さ」の5つに絞ります。これで議論が感覚論に陥るのを防げます。
チーム制作と自動化:規模を拡げるための運用設計
個人制作なら気にならないことも、複数人で進めると一気に問題になります。ここでは、制作を継続的に回すための運用の型を紹介します。
命名規則とバージョン管理
ファイル名は全員が同じ規則でつけます。加えて、どのプロンプトで生成したかを記録する「プロンプト台帳」を用意します。表計算ソフトで構いません。列は「カット番号」「プロンプト」「使用モデル」「設定」「結果の評価」の5つです。これがあると、後から同じ画を作り直せます。
役割分担の設計
分業する場合、次の3つの役割に分けると衝突が減ります。
- 設計担当:ショットリストとプロンプトを書く
- 生成担当:設定を詰めてテイクを出す
- 編集担当:つなぎと音、色を仕上げる
設計と生成を同じ人が持つと、ショットリストの誤りに気づきにくくなります。逆に、編集担当を最初から会議に入れておくと、後戻りが減ります。
テンプレート化のすすめ
繰り返し使う要素はテンプレートにします。スタイル固定文、ショットリストの雛形、書き出し設定、テロップのデザインルール。これらを資産化しておくと、2本目以降の制作時間が大幅に短縮されます。最初の1本に時間がかかるのは投資です。
ジャンル別レシピ:目的から逆算する
同じツールでも、ジャンルによって設計は変わります。代表的な4パターンを整理します。
SNSショート
冒頭2秒で結論か強い画を見せる。カットは1〜2秒中心。テロップは大きく、画面の上部または中央に固定。縦型1080×1920。音はBGMを主役にし、ナレーションは補助に回します。
商品紹介
被写体を1つに絞り、固定カメラとゆっくりしたオービットで見せる。質感が命なので、光は柔らかく、反射を活かします。尺は15〜30秒、カットは4〜6。手元のアップを必ず1カット入れると説得力が増します。
アニメ風カット
線の安定を優先し、生成尺を短くします。キャラクターの設定画を参照画像として用意し、表情差分を別カットで作ります。背景は静止画に近い扱いにし、動かすのは人物と髪、そして光のエフェクトに限定すると破綻しにくくなります。
ドキュメンタリー風
手ぶれ風の動き、自然光、フィルムグレインを共通スタイルにします。完璧な画より「その場にいた感」が価値になるため、多少のノイズは味として残します。ナレーション主体で、カットは3〜5秒と長めに取ります。
よくある質問
Q. 生成したカットが思った画になりません。まず何を見直すべきですか。
プロンプトの前にショットリストを疑ってください。ショットサイズやカメラワークが曖昧なまま生成すると、結果も曖昧になります。「ミディアムショット」「ゆっくりドリーイン」のように、選択肢が限られる言葉で書き直すと改善します。
Q. 同じ人物を何カットも登場させると別人になります。
参照画像の枚数と種類を増やしてください。顔のアップ、正面のバストアップ、全身の3枚が基本です。加えて、髪型や服装の記述を毎回同じ文面でコピーし、言い換えないことが重要です。
Q. 1カットの尺はどのくらいが適切ですか。
編集でつなぐ前提なら、生成は短めに作り、使う部分だけを切り出すのが安全です。長い尺を一度に生成すると、後半で崩れる確率が上がります。結果として、短い生成を複数回すほうが効率的です。
Q. 文字やロゴを映像内に入れたいのですが。
映像生成モデルに文字を描かせるのは現実的ではありません。テロップやロゴは編集ソフトで後から載せるのが標準的なやり方です。動きに合わせてわずかにスケールを変えると、馴染みが良くなります。
Q. 音声はAIで作れますか。
作れます。ただし、文を短く区切り、句点で間を取ることが品質の鍵です。長い一文を一度に読ませると、抑揚が平坦になります。また、作品内で話者を統一しないと、聞き手が違和感を覚えます。
Q. どこまで作り込めば公開してよいですか。
基準は「視聴者が離脱するかどうか」です。顔の崩れ、音のズレ、冒頭の弱さは修正必須。背景の些細な不自然さや1フレームのノイズは、多くの場合問題になりません。完璧より完成を優先し、次の作品で改善するほうが結果的に上達します。
次の一歩:小さく試して、記録して、反復する
AI動画制作で最も差がつくのは、ツールの知識量ではなく、反復の質です。1本目から大作を狙うのではなく、15秒の短い作品を1本作り、工程ごとに気づきを記録してください。どのプロンプトが効いたか、どのカットで破綻したか、どこに時間がかかったか。この記録が、2本目以降の速度になります。
最初に取り組むべきは、次の3つです。
- 15秒・5カットの短編を1本完成させる
- 共通スタイル固定文を4行作る
- プロンプト台帳に結果を残す
この3つを実行すると、次に同じ作業をするときの迷いが激減します。生成AIは日々更新されますが、企画から仕上げまでの工程と、記録して改善する姿勢は変わりません。ツールが変わっても通用する型を、最初の1本で身につけてしまいましょう。


