AI動画生成が変えたのは「撮影」ではなく意思決定の順番
AI動画生成の話題は、ついモデル単体の性能比較に集まりがちだ。どのモデルが最も写実的か、どのモデルが最も長い尺を破綻なく生成できるか。しかし、実際に納品まで到達する現場で成果を分けているのは、モデルの優劣よりも工程の設計と受け渡しのルールである。生成はパイプラインの一部にすぎず、その前後にある企画、素材管理、選別、編集、音声、書き出しの品質が最終的なアウトプットを決める。
生成の成功率は、入力の設計品質に強く依存する。曖昧な指示は曖昧な結果を生み、矛盾した指示は破綻を生む。だから最初にやるべき作業は高性能なツールを探すことではなく、作りたい映像を「生成できる単位」に分解し、各工程のインプットとアウトプットを定義することだ。ここを整えるだけで、同じモデルを使っても手戻りの回数が大きく変わる。
生成AIが得意な領域と苦手な領域
得意なのは、バリエーション出し、映像化の初速、実写では撮影が難しい画(ファンタジー、近未来、危険な場所、存在しない建築物)、そして企画段階のラフ検証である。企画書に貼るキービジュアルや15秒のテスト映像を数分で用意できる価値は大きい。意思決定のスピードが上がることで、方向性の誤りを早い段階で潰せる。
一方で苦手な領域もはっきりしている。複数カットにまたがる同一人物の完全な一致、指先や小物を使った繊細な動作、画面内の文字描画、長回しの連続性、物理的に厳密な衝突や流体表現などだ。これらは「できない」と決めつける必要はないが、「そのまま出たら儲けもの」程度の期待値で臨み、破綻したら編集や後処理でカバーする前提で設計するのが現実的である。
「生成で作る」部分と「編集で作る」部分を分ける
もっとも多い失敗は、1本の動画を1つの長いプロンプトで完結させようとすることだ。実務では、カット単位で生成し、編集でつなぐ。カットは短いほど破綻が少なく、やり直しのコストも低い。したがって「このカットは生成で作る」「このカットは写真のケンバーンズで作る」「ここはモーショングラフィックスで作る」という役割分担を、絵コンテの段階で決めておく。撮影不要の工程と、撮影したほうが速い工程を混ぜるハイブリッド構成は、品質と納期の両立に効く。
制作前に固めるゴールと制約
ワークフローを組み立てる前に、動かせない条件を先に確定させる。ここが曖昧なまま生成に入ると、後工程で作り直しが発生する。特にアスペクト比と尺は、生成モデルのプロンプト設計にも編集のテンポにも直結するため、最初に決める。
先に決める7項目
1つ目は尺。15秒、30秒、60秒、3分では必要なカット数がまったく違う。2つ目はアスペクト比。縦型9:16、横型16:9、正方形1:1のどれを主軸にするか。3つ目は配信先。SNSのフィード、ストーリーズ、動画サイト、社内プレゼン、店頭サイネージでは、想定視聴環境が異なる。4つ目は縦横展開の有無。1本作って3種類に展開するなら、撮影時点から余白を意識する必要がある。
5つ目は音声の扱い。ナレーションを合成音声で作るのか、収録するのか、字幕だけで済ませるのか。6つ目はトーン&マナー。色調、レンズ感、テンポ、被写体の年齢層、NG表現。7つ目は納品形式とコーデック。解像度、フレームレート、ビットレート、ファイル名規則まで決めておくと、受け渡しの事故が減る。
参照素材とトーン&マナーの言語化
「かっこいい感じ」は指示ではない。参照動画を3本、参照写真を10枚、色見本を5色、避けたい表現を3つ、というように数量を決めて集める。参照素材は、モデルに渡す画像リファレンスとしても再利用できるため、単なるムード共有で終わらせず、権利がクリアなものを選ぶ。
トーン&マナーは文章でも残す。「朝の逆光」「浅い被写界深度」「手持ち風のわずかな揺れ」「彩度は低め」「肌はやや暖色」など、形容詞ではなく撮影用語に翻訳しておくと、プロンプトにも編集にもそのまま流用できる。
権利・ライセンス・公開範囲の確認
生成物の商用利用可否、利用するモデルやサービスの規約、参照画像の著作権、実在人物や商標の扱い。これらは制作の最後ではなく最初に確認する。あとから公開できないと分かると、作業時間がまるごと無駄になる。クライアントワークでは、生成物の権利归属と二次利用の範囲を書面で合意しておくのが安全だ。
パイプライン全体像:8つの工程
ここからは具体的な工程を順にたどる。大切なのは、各工程に「完了条件」を設けること。完了条件がないまま次へ進むと、後工程で前提が崩れる。
- 目的とゴールの定義(誰に、何を、どう感じてほしいか)
- 脚本とビート設計(情報の順番と感情の山場)
- 絵コンテとショットリスト(カット単位への分解)
- リファレンス準備(人物・場所・小物の基準画像)
- 生成(モデル選定、プロンプト設計、パラメータ調整)
- 選別と品質チェック(採用テイクの確定)
- 編集・音声・仕上げ(つなぎ、BGM、色調整、アップスケール)
- 書き出しと展開(縦横変換、多言語化、再利用)
各工程のインプットとアウトプットを定義する
たとえば工程3のインプットは脚本とトーン&マナー、アウトプットはショットリストとラフ画。工程5のインプットはショットリストとリファレンス画像、アウトプットは採用候補のクリップ群。この対応表を1枚のドキュメントにしておくと、担当者が変わっても進行が止まらない。
ファイル命名とバージョン管理
生成AIの制作は、素材が爆発的に増える。プロジェクト名_カット番号_テイク番号_日付 のような規則を最初に決める。さらに、プロンプトとパラメータをテキストファイルか表計算ソフトで必ず記録する。同じ画を再現したいとき、プロンプトが残っていなければ最初からやり直しになる。
工程1〜2:企画・脚本・絵コンテを生成可能な単位に分解する
脚本は、読み物としての完成度よりも「カットに割れるか」が重要になる。1文が1カットに対応するように書くと、後の工程が驚くほどスムーズになる。
ログラインからビートシートへ
まずログラインを1文で書く。次に、その1文を5〜8個のビートに分解する。各ビートには「視聴者が得る情報」と「感情の変化」をメモする。この段階で生成AIにラフ画像を作らせて方向性を確認すると、手戻りが小さくなる。ただし、ラフはあくまで方向確認用と割り切り、そのまま本番素材に流用しないこと。解像度や一貫性が足りず、後で必ず作り直しになる。
1カット1アクションの原則
1つのカットに複数の動作を詰め込むと、生成は途端に破綻しやすくなる。「人物が歩きながら振り返り、扉を開けて中に入る」ではなく、「歩く」「振り返る」「扉に手をかける」の3カットに分ける。カット数は増えるが、成功率と修正のしやすさは段違いに向上する。編集でテンポを整えれば、見え方はむしろ自然になる。
ショットリストの標準項目
カット番号、尺(秒)、内容、カメラワーク(固定、パン、ドリー、手持ち)、被写体、背景、参照画像ファイル、ライティング、備考(破綻しやすい点)。この8〜10項目を表にしておく。とくに「尺」と「カメラワーク」を先に決めておくと、プロンプト生成が機械的に行えるようになる。
キャラクターシートとロケーションシートの作り方
同一人物を複数カットに登場させるなら、正面・斜め45度・横顔・全身の4枚を基準画像として用意する。服装、髪型、年齢、体型、特徴的な小物まで固定する。背景も同様に、同じ場所を複数アングルから見た基準画像を用意しておくと、カット間の違和感が激減する。
モデル選定の判断基準
モデルは「最新かどうか」ではなく「今回の要件に合うか」で選ぶ。同じプロンプトでも、モデルによって動きの質、色の傾向、得意な被写体が異なる。
4つの評価軸
1つ目はプロンプト追従性。書いた内容がどこまで反映されるか。2つ目は動きの自然さ。関節の動き、重心、髪や布の揺れ。3つ目は一貫性。フレーム間で顔や服装が崩れないか。4つ目は解像度と生成可能な尺。長尺を一発で狙うより、短尺を高品質で出して編集でつなぐほうが安定する。
実写系・アニメ系・スタイライズドの使い分け
実写系は商品紹介や人物インタビュー風の演出に向くが、肌や手の破綻が目立ちやすい。アニメ系は破綻が様式として許容されやすく、連続性の要求が緩い。スタイライズド(イラスト調、3D調、レトロ調)は、破綻を味として吸収できるため、短い尺のSNS動画と相性がよい。プロジェクト内で系統を混ぜると統一感が失われるので、原則として1本につき1系統に絞る。
速度とコストのトレードオフ
高品質なモデルは、生成時間が長く、利用料も高くなる傾向がある。実務では、全カットを最高品質で回すのではなく、ラフ段階は軽いモデル、本番のみ重いモデルという二段構えが効率的だ。また、1カットにつき3〜5テイクを生成する前提で予算を組み立てると、選別で困らない。
プロンプト設計と一貫性の作り方
プロンプトは、感覚的に書くより構造化して書くほうが再現性が高い。
5層構造で組み立てる
被写体(誰が、何が)、動作(何をするか)、カメラ(位置、動き、レンズ感)、照明(時間帯、光源の方向、色温度)、スタイル(ジャンル、フィルム調、色調)の5層に分けて記述する。各層を箇条書きで書き出し、最後に1本の文章へまとめると、抜け漏れが減る。
ネガティブ指定とシード管理
避けたい要素(文字の混入、余分な指、顔の歪み、過度な彩度、ロゴ)はあらかじめ指定しておく。また、同じ構図を維持したい場合はシード値を固定し、変更する要素を1つずつ動かす。一度に複数の要素を変えると、どの変更が結果に効いたのか分からなくなる。
一貫性を保つための3つの方法
1つ目は参照画像の活用。同じ人物の基準画像を毎回入力する。2つ目はプロンプトの固定。カットごとに変えるのは動作とカメラだけにし、人物記述はコピーして使う。3つ目は後処理での統一。色調整やグレイン、わずかなぼかしを全カットに同じ設定で適用すると、生成由来の微妙な差異が目立たなくなる。
生成素材の選別と品質チェック
生成した素材を全部見ようとすると時間が足りない。選別は「捨てる基準」を先に決めて機械的に進める。
テイク管理のルール
冒頭1秒で破綻しているものは即座に除外する。次に、カットの目的(情報を伝える、感情を動かす)を満たしているかを見る。最後に、前後のカットとつながるか(色、動きの方向、視線の向き)を確認する。採用テイクには印をつけ、予備テイクを1本だけ残し、残りは削除する。素材を溜め込むほど、編集段階の判断が遅くなる。
破綻パターン別の修正手順
指や手の崩れは、手を使わない構図に変えるか、短い尺に切って編集で隠す。顔の崩れは、参照画像を追加してカットを分割する。背景の溶けは、被写体とカメラの距離を指定し直す。文字の混入は、文字を後から合成する前提にしてプロンプトから排除する。色のちらつきは、編集ソフトでカラー補正をかけて統一する。カメラの不要な揺れは、手ぶれ補正かスタビライズで軽減する。どれも「生成し直す」より「工程を分ける」ほうが速いことが多い。
編集・音声・仕上げ・書き出し
生成素材はあくまで素材であり、編集で初めて映像になる。ここでの丁寧さが、最終的な印象を大きく左右する。
つなぎとテンポ
カットの切り替えは、動きの途中で切ると自然につながる。歩行の一歩の途中、振り返りの最中などだ。冒頭3秒で結論か強い画を見せ、中盤で理由や具体例、終盤で行動を促す構成が基本になる。テンポはBGMのビートに合わせると整えやすい。
音声設計
ナレーションは、字幕より情報量を増やせるが、テンポを支配する。合成音声を使う場合も、句読点の位置とポーズ指定で印象が変わる。BGMは映像の邪魔をしない帯域を選び、効果音でカットの切り替えを補強する。無音区間を1箇所入れると、全体が引き締まる。
アップスケールとグレーディング
低解像度で生成した素材は、編集前にアップスケールしておく。フレーム補間は動きの滑らかさを上げるが、やりすぎると不自然になるため、必要なカットだけに適用する。グレーディングは全カット共通のプリセットを当て、最後に全体のコントラストと彩度を微調整する。
縦横展開と多言語化
横型で作った映像を縦型に展開する場合は、被写体の位置をカットごとに調整する必要がある。字幕のセーフエリアを意識し、重要な情報を画面中央に寄せておくと変換が楽になる。多言語化は、字幕の差し替えとナレーションの再生成で対応する。同じ映像で複数言語を展開できる点は、生成AIを使う大きな利点だ。
よくある失敗パターンと対策
- ツールを次々に乗り換える:1本の作品を最後まで完成させてから比較する。
- プロンプトを毎回ゼロから書く:テンプレート化し、変化させる要素だけを編集する。
- カットを長くしすぎる:3〜5秒を基本単位とし、必要な場合だけ伸ばす。
- 素材を全部保持する:採用と予備以外は削除し、記録だけを残す。
- 音声を後回しにする:尺とテンポが決まる工程なので、早い段階で設計する。
- 権利確認を最後にする:公開直前に使えない素材が判明すると、全部が無駄になる。
- 完成度を最初から狙う:まず通しで粗い版を作り、改善を重ねる。
FAQ
AI動画生成はどこから始めればよいですか
一番小さい単位から始めるのが現実的だ。15秒、3カット、ナレーションなしの短い映像を作り、企画から書き出しまでの流れを一度通す。工程の詰まりどころが見えるので、次にどこを改善すべきかが明確になる。
1本の動画はどのくらいのカット数が目安ですか
15秒なら4〜6カット、30秒なら8〜12カット、60秒なら15〜20カットが目安になる。ただし、情報量より視聴体験を優先し、間延びするくらいならカット数を減らして1カットを丁寧に見せるほうが良い結果になる。
キャラクターの一貫性はどう保てばよいですか
基準画像を用意し、人物の記述を固定し、変更するのは動作とカメラだけにする。それでも崩れる場合は、カットを短くするか、顔が映らない構図に切り替える。後処理で色と粒子を統一するのも効果的だ。
生成した素材はそのまま使えますか
そのまま使えることもあるが、前提として「素材」と考えるほうがよい。解像度、色、長さ、音の有無を揃える処理を挟むことで、作品としての完成度が大きく変わる。
実写と生成AIはどちらを選ぶべきですか
伝える情報の正確さが最優先なら実写、想像上の世界や撮影困難な画が必要なら生成AIが向く。両者を混ぜる構成も有効で、人物の表情など重要な部分だけ実写にする判断はよく取られる。
チームで制作するときの注意点は
ファイル命名規則、プロンプトの記録方法、レビューのタイミングを先に決めて共有する。工程ごとの完了条件を明文化しておけば、担当者が入れ替わっても品質が保たれる。
まとめ:工程を設計した人が、AI動画を使いこなす
AI動画生成の品質は、モデルの性能だけで決まらない。目的の定義、カットへの分解、リファレンスの準備、プロンプトの構造化、選別の基準、編集と音声の設計。これらを1本のパイプラインとして組み立てた人が、結果として速く、安定して、再利用可能な映像を生み出せる。
まずは短い1本を通しで完成させ、どこで止まったかを記録する。その記録こそが、次の作品で最も価値のある資産になる。



