AI動画制作の全体像:従来フローと何が変わるのか
動画制作に生成AIを組み込むと、企画から書き出しまでの流れが一本道ではなく、「設計して、生成して、選んで、仕上げる」というループに変わります。撮影で押さえる素材の数は減り、そのぶん「どのカットを生成し、どれを残すか」という判断の比重が大きくなります。作業が楽になるというより、仕事の種類が入れ替わると考えたほうが実態に近いでしょう。
もう一つの重要な前提は、AIは完成品を出す道具ではなく、素材を大量に出す道具だという点です。10本生成して1本使えれば上出来、という前提で工程を組むと、時間の見積もりも精神的な負荷も現実的に収まります。逆に「1回の生成で決め切る」前提でスケジュールを引くと、ほぼ確実に後半で破綻します。
この記事では、思いつきで生成を始めて迷子にならないために、上流の設計から下流の書き出しまでを順番に分解します。読み終えたときには、自分の案件に当てはめられるチェックリストとして使える状態を目指します。
従来フローとAIフローの比較
従来の映像制作は、企画、絵コンテ、ロケハン、キャスティング、撮影、編集、整音という順番で進みます。撮影日が動かないため、その前後の工程は締切から逆算して詰められます。
AIを組み込んだ場合は、企画、絵コンテ、参照素材の準備、生成、選別、編集、音声、書き出しという並びになります。撮影が消える代わりに、「参照素材の準備」と「選別」という工程が新しく入るのがポイントです。
| 工程 | 従来 | AI活用時 |
|---|---|---|
| 素材作り | 撮影 | 生成と選別 |
| 待ち時間 | 撮影日・現像 | 生成待ち・再生成 |
| やり直し | 再撮影(高コスト) | 再生成(低コスト・多数回) |
| 品質の決め手 | 撮影技術・照明 | 参照素材・設計・編集 |
この表が示すのは、失敗のコストが下がる代わりに、判断の回数が増えるという構造です。だからこそ、判断基準を先に決めておくことが効きます。「この条件を満たさなければ即ボツ」という線を引いておくと、選別が速くなります。
AIが得意な工程と苦手な工程
得意なのは、Bロール、背景、風景、抽象的なイメージカット、商品の世界観カット、短尺のバリエーション展開、多言語版の作り分けです。同じ内容で縦横比や尺違いを量産する用途とも相性が良いです。
苦手なのは、長回しでの一貫性、手や指の細かい動き、複数人物の接触、正確な文字の表示、細かいブランド規定の再現です。これらは編集で分解するか、実写やデザインツールと組み合わせる前提で設計したほうが安全です。苦手分野を無理に押し切ると、確認と修正に時間が溶けます。
ステップ1:企画と目的の設計
生成を始める前に決めるべきことは、意外なほど多くありません。ただし、決めずに走り出すと後戻りが大きい項目ばかりです。特に「誰に」「何を」「どのくらいの尺で」の三つは、後のすべての工程に影響します。
誰に何を伝えるかを一文で決める
企画の出発点は、「この動画は誰の、どんな疑問や欲求に答えるのか」を一文で書くことです。一文にできない企画は、カット割りにも落とせません。
たとえば「在宅で働く30代の編集者に、外付けマイクの設定の簡単さを伝える」のように、対象と便益をセットで書きます。ここが曖昧なまま生成を始めると、映像は綺麗でも伝わらないものになります。
尺とプラットフォームを先に固定する
次に尺を固定します。15秒、30秒、60秒、3分では、必要なカット数も情報量もまったく変わります。
縦型の短尺は1カット1.5秒から3秒、横型の解説動画は3秒から6秒が目安です。プラットフォームごとに推奨の縦横比と尺が異なるので、最初に配信先を決めてからカット数を逆算します。後から縦横比を変えると、構図の作り直しが発生します。
企画シートに書くべき項目
実務では、次の項目を一枚のシートにまとめると後工程が安定します。
- 目的と成功の定義(視聴完了、問い合わせ、認知など)
- 対象視聴者とその前提知識
- 配信先と縦横比、尺
- トーン(親しみ、専門的、静か、勢いがある)
- 必須で入れる要素(ロゴ、商品、指定の言い回し)
- 避ける表現(競合に似た演出、過度な断定)
- 納品形式とファイル名の規則
この一枚があると、生成中に迷ったときの判断軸になります。
ステップ2:絵コンテとショットリストを作る
絵コンテは上手に描く必要はありません。棒人間と矢印で十分です。大切なのは、カットごとに「何を見せて、何を伝えるか」が一行で書かれていることです。
カット割りの基本
基本の型は、導入で状況を示し、展開で詳細を見せ、結びで行動を促すという三幕構成です。30秒の動画なら、導入8秒、展開16秒、結び6秒といった配分が扱いやすいです。
各カットには役割を持たせます。状況説明、感情の誘導、証拠の提示、比較、結論。役割のないカットは削る候補です。
ショットリストの書き方
ショットリストは、番号、尺、内容、カメラ、ライティング、生成方法の列で作ります。生成方法の列には「テキストから生成」「画像から生成」「実写」「グラフィック」のどれを使うかを書きます。
この列を埋めておくと、どのカットが難所かが一目でわかります。人物の接触や長い動きが含まれるカットは、事前に代替案を用意しておくと安心です。
尺の配分とリズム設計
尺の合計は、想定より1割から2割長く設計しておきます。編集で詰めることはできても、伸ばすことは難しいからです。
また、同じ長さのカットが続くと単調になります。短いカットを挟んでテンポを作り、要所で長めのカットを置いて呼吸を作る。この緩急をショットリストの段階で意識しておくと、編集が速くなります。
ステップ3:プロンプト設計の型をつくる
生成の品質は、モデルの性能よりも入力の構造で決まる部分が大きいです。毎回ゼロから文章を書くのではなく、自分の型を持つのが効率的です。
プロンプトの基本構造
基本は、被写体、動作、構図、カメラ、光、色調、質感の順で並べます。たとえば「白いカップを両手で持つ人物、湯気が立ち上る、寄りの構図、ゆっくりした押しの動き、窓からの柔らかい自然光、落ち着いた暖色、浅い被写界深度」といった具合です。
日本語で書いて精度が出ない場合は、英語に置き換えると安定することがあります。ただし、固有名詞や造語は誤解釈されやすいので、一般名詞に言い換えるのが安全です。
動きとカメラワークの指定
動画生成では「何が動くか」と「カメラがどう動くか」を分けて書きます。この二つを混ぜると、意図しない揺れや歪みが出やすくなります。
動きの指定は控えめにするのがコツです。歩く、振り返る、手を上げる程度に留め、走る、跳ぶ、回転するといった大きな動きは、カットを分けて表現したほうが破綻が少なくなります。
ネガティブ指定とアスペクト比
除外したい要素は、ネガティブ指定や除外リストで伝えます。文字の崩れ、余分な指、ロゴの混入、過度な露出などが代表的です。
アスペクト比は生成前に確定させます。縦型で作った構図を横型に流用すると、被写体が切れたり余白が不自然になったりします。配信先が複数ある場合は、最初から両方の構図を別カットとして設計しておくのが結果的に速いです。
ステップ4:モデルとツールの選び方
ツールは増え続けていますが、用途で絞れば選択肢はそれほど多くありません。大切なのは「どの機能が欲しいか」ではなく「どの制約なら受け入れられるか」で選ぶことです。
テキストto動画・画像to動画・動画to動画の使い分け
テキストから生成する方式は、絵コンテ段階の検討や抽象的なイメージカットに向きます。手軽ですが、構図の再現性は低めです。
画像から生成する方式は、構図とトーンを固定したいときに強いです。キャラクターや商品の見た目をそろえたい案件では、こちらを主軸にすると安定します。動画から生成する方式は、既存素材のスタイル変換や動きの流用に向きます。
実務では、画像から生成する方式を主軸にし、足りないカットだけテキストから生成で補う形が組みやすいです。
選定チェックリスト
導入前に確認したい項目をまとめます。
- 生成できる最大尺と分解能
- 指定できる縦横比の種類
- 参照画像を複数使えるか
- 同じ構図を再現するための固定手段があるか
- 出力形式と扱えるファイルサイズ
- 生成にかかる待ち時間の目安
- 利用規約と商用利用の条件
- 学習データや出力物の取り扱い
このうち、運用で最も差が出るのは「同じ構図を再現する手段」と「商用利用の条件」です。前者は品質の安定に、後者は公開可否に直結します。
権利と商用利用の確認
生成物を公開・納品する場合は、利用規約の確認を工程に組み込みます。特に、入力した参照素材の権利、生成物の利用範囲、クライアントへの再許諾の可否は確認が必要です。
人物の肖像、商標、既存キャラクターに似た出力は、意図しなくても発生します。公開前のレビュー項目として、権利チェックを独立した工程にしておくと見落としが減ります。
ステップ5:一貫性を保つ技術
シリーズ物や複数カットの動画で最も評価を分けるのが、一貫性です。人物の顔、服装、照明の方向、色調が毎カットで変わると、視聴者は無意識に違和感を覚えます。
参照画像とキャラクターシート
まず、主要な人物や商品の参照画像を用意します。正面、斜め、横、後ろの四方向と、表情違いがあると安定します。これをキャラクターシートとしてまとめ、全カットの生成で共通して使います。
参照画像は解像度よりも「情報の明快さ」が重要です。背景がごちゃついた写真より、余白のあるシンプルな写真のほうが再現度が上がります。
固定すべき変数と揺らす変数
一貫性を保つには、変えてはいけない変数と、意図的に変える変数を分けます。
固定するのは、人物の特徴、服装、主要な色、光の方向、レンズ感です。揺らすのは、構図、距離、アングル、動きの大きさです。この切り分けをしておくと、変化をつけながらも世界観が崩れません。
生成側に固定用の数値や参照指定がある場合は、カットごとに記録しておきます。記録がないと、後から追加撮影ならぬ追加生成ができなくなります。
世界観をそろえるカメラ言語
カメラの扱いをそろえることも一貫性の一部です。同じ動画の中で、押しの動きと引きの動きが乱雑に混ざると落ち着きが失われます。
たとえば、導入は静かな固定、展開はゆっくりした押し、結びはわずかな引き、というルールを決めます。カメラの高さや被写体との距離にも目安を設けると、カットをまたいだときのつながりが良くなります。
ステップ6:生成素材の選別と編集
生成段階では、判断をせずに量を出します。判断は選別の工程にまとめたほうが、結果的に速く正確になります。
テイク管理と命名規則
命名規則は最初に決めます。シーン番号、カット番号、テイク番号、状態を組み合わせた形式が扱いやすいです。フォルダもシーン単位で分けておくと、編集ソフトへの取り込みが整理されます。
選別では、使う、保留、使わないの三つに分けます。保留を作るのがポイントで、二択にすると迷いが長引きます。
つなぎとテンポ
編集では、動きの方向と勢いを意識してつなぎます。前のカットで右に動いたら、次のカットも右方向の動きで受けると自然につながります。
カットの頭と尻は思い切って削ります。生成素材は前後が不安定なことが多く、余分を切るだけで印象が変わります。
カラーとルックの統一
最後に、全体の色調をそろえます。カットごとに生成条件が違うため、色温度やコントラストにばらつきが出ます。調整レイヤーで統一感を出す、ルックを一点に寄せる、といった処理を全体にかけます。
グレインや軽いぼかしを全体に足すと、生成特有のつるっとした質感がなじみやすくなります。
ステップ7:音声・字幕・BGMの仕上げ
映像が整っても、音で印象は大きく変わります。ここを後回しにすると、全体の完成度が頭打ちになります。
ナレーション生成と話速
合成音声を使う場合は、まず話速と間を調整します。一定の速度で読ませると機械的に聞こえるため、文の区切りで間を入れ、強調したい語の前後をわずかに詰めます。
専門用語や固有名詞は、読み方を事前に確認します。誤読は最も目立つ瑕疵です。
字幕の可読性
字幕は、一画面あたりの文字数を抑え、行数は二行までにします。読み切れない字幕は、内容が良くても離脱の原因になります。
自動生成した字幕は必ず人が確認します。同音異義語の誤変換、句読点の欠落、話者と字幕のずれは頻出します。
ミックスの目安
音量の目安としては、ナレーションを基準にし、BGMはその下に潜らせます。効果音は情報を補う位置にだけ置き、多用しません。
全体を通して一度無音で見ると、映像だけで伝わらない箇所が見つかります。そこは音に頼らず、字幕やカットで補強します。
書き出しと配信の最適化
仕上げの設定は、配信先と視聴環境で決まります。高解像度であれば良いというものではなく、環境に合わせた最適化が再生品質を左右します。
解像度・ビットレート・縦横比
縦型は1080×1920、横型は1920×1080を基準にし、ビットレートはプラットフォームの推奨範囲の中央値あたりから調整します。上げすぎても再圧縮で失われるため、過剰な設定は意味が薄くなります。
音声は明瞭さを優先し、書き出し後に一度再生して確認します。映像だけを見て音を確認しない、という落とし穴はよくあります。
冒頭とサムネイル
最初の数秒で離脱が決まります。冒頭は結論か強い映像から入り、前置きは後ろに回します。
サムネイルは、映像の一時停止画面をそのまま使わず、意図して作ります。文字は小さくしすぎず、要素は二つまでに絞ると視線が集まります。
よくある失敗とFAQ
最後に、実務で繰り返し起きる失敗と、その対処をまとめます。
失敗パターンと対処
一つ目は、動きが不自然になるケースです。対処は、動きの指定を小さくし、カットを分割することです。
二つ目は、人物が崩れるケースです。対処は、参照画像を増やし、全身より上半身の構図に寄せることです。
三つ目は、尺が足りないケースです。対処は、想定尺を長めに設計し、汎用のBロールを多めに用意しておくことです。
四つ目は、権利確認の漏れです。対処は、公開前チェックを工程として明文化することです。
五つ目は、テイク管理の混乱です。対処は、命名規則とフォルダ構成を先に固めることです。
仕組み化のためのチェックリスト
毎回の案件で同じ手順を踏めるように、次の項目をテンプレート化しておくと再現性が上がります。
- 企画シートと成功の定義
- ショットリストとカット尺の目安
- プロンプトの型と除外指定のテンプレート
- 参照画像セットと固定する変数の記録
- 選別の基準と命名規則
- 音声と字幕の確認手順
- 書き出し設定と公開前チェック
テンプレートは一度作れば、次の案件で迷う時間が大きく減ります。
よくある質問
Q. どの工程からAIを使うべきですか。
A. 最初はBロールや背景など、失敗しても全体に影響しにくいカットから始めるのが安全です。慣れたら人物カット、最後に長い尺のシーンへ広げます。
Q. 生成した映像はそのまま使えますか。
A. 単体では粗が出ることが多いため、選別と編集を前提に考えます。短く切って組み合わせるだけで見違えることがよくあります。
Q. 一貫性が保てないときはどうしますか。
A. 参照画像を整理し、固定する変数を絞り、カット数を減らして一つの構図に集中します。要素を減らすことが最短の改善策です。
Q. 実写と組み合わせてもよいですか。
A. むしろ推奨です。人物の手元や商品そのものは実写、背景やイメージカットは生成、という分担にすると破綻が減ります。
Q. チームで作業する場合の注意点はありますか。
A. 命名規則、参照画像の置き場所、プロンプトの型を共有することが最優先です。属人化すると、担当が変わった瞬間に品質が崩れます。
以上のように、AI動画制作は魔法ではなく工程です。設計を丁寧にし、生成を量で捉え、選別と編集で質を引き上げる。この順番を守るだけで、短い制作時間でも安定した成果につながります。


