AI動画制作の全体像:工程を分解して考える
AI動画制作の品質は、使うモデルの性能だけで決まるわけではない。むしろ成果を大きく左右するのは、企画から書き出しまでの工程をどれだけ明確に分解し、各工程の合格条件を決めているかである。生成モデルが数か月単位で入れ替わる環境では、特定のツールの操作手順を覚えることよりも、ツールが変わっても再利用できる工程設計を持つことのほうが長く価値を持つ。
多くの人がつまずくのは「とりあえずプロンプトを書いて生成する」という順序で始めてしまうことだ。この進め方だと、出てきた映像が企画意図とずれていることに編集段階で気づき、最初からやり直すことになる。手戻りのコストは工程が進むほど大きくなるため、上流の工程ほど時間をかけて合意を作る価値がある。
本記事では、AI動画制作を6つの工程に分け、それぞれの目的、判断基準、よくある失敗、そして改善の手順を整理する。商用の広告素材、製品解説、SNS向けショート、社内トレーニング動画など、用途が変わっても骨格は共通して使える。
6つの工程と合格条件
- 企画とコンセプト設計:誰に、何を、どの尺で届けるかを一文で定義する。合格条件は「関係者全員が同じ一文を説明できること」。
- スクリプトと絵コンテ:言葉と絵の両方で流れを確定する。合格条件は「各カットの目的が説明できること」。
- モデルと構成の選定:シーンごとに最適な生成方式を決める。合格条件は「テスト生成で再現性が確認できたこと」。
- プロンプトと撮影指示の設計:カメラワーク、光、被写体の動きを言語化する。合格条件は「狙った構図が3回中2回以上出ること」。
- 編集・音声・字幕の統合:テンポと情報の順序を整える。合格条件は「無音で見ても内容が伝わること」。
- 品質管理と書き出し:表現、権利、技術仕様を確認する。合格条件は「配信先の仕様チェックリストを満たすこと」。
この分解の利点は、問題が起きたときにどの工程に戻ればよいかが即座に判断できる点にある。映像が不自然なら工程4、テンポが悪ければ工程5、話が伝わらないなら工程1か2へ戻る。闇雲にプロンプトを書き換え続ける作業から離れられる。
反復回数をあらかじめ見積もる
AI動画は一度で完成しない。シーンごとに複数回の試行が必要になるのが前提だ。そこで制作計画を立てる時点で、「1シーンあたり平均何回の試行を見込むか」を決めておく。経験的には、人物の表情が絡むシーンは試行回数が増え、風景や物撮りは少なく済む傾向がある。
見積もりを共有しておくと、進行中の遅延が「想定内」か「異常」かを判断できる。これは制作全体のスケジュール管理において非常に重要な要素になる。
工程1:企画とコンセプト設計
企画工程の目的は、アイデアを魅力的にすることではなく、判断基準を固定することにある。基準がなければ、生成結果を見たときに「なんとなく違う」という曖昧な評価しかできず、修正の方向性も定まらない。
目的を一文で書く
最初に書くべきは次の形式の一文だ。
この動画は【対象者】が【課題】を【どのように解決できるか】を【尺】で伝える。
たとえば「この動画は新規導入を検討している中小企業の担当者が、既存ツールの移行手順を把握できるようにする15秒の説明動画」といった具合である。この一文があるだけで、カットの取捨選択が格段に速くなる。
トーンと参照イメージを言語化する
「かっこよく」という指示は制作では機能しない。代わりに、次の4項目を言葉で指定する。
- 光:自然光の朝、逆光のシルエット、スタジオの均一な照明など
- 色:彩度を抑えた寒色、暖色中心、単色アクセントなど
- カメラ:固定、手持ち風、ゆっくりしたスライド、ドローン風の俯瞰など
- 質感:フィルム粒子、クリーンなCG、ドキュメンタリー風など
この4項目を箇条書きで共有しておくと、生成結果に対するフィードバックが「色が違う」「カメラが速すぎる」といった具体的な言葉になり、修正が一発で決まりやすくなる。
尺と配信先を先に固定する
縦型のショートか、横型の解説動画かで、構図の作り方が根本的に変わる。縦型では人物の全身を入れると情報が潰れるため、上半身や手元のアップが中心になる。横型では引きの画で空間を見せられる。
さらに冒頭の3秒で何を見せるかを決めておく。ここが曖昧なまま制作を進めると、完成後に冒頭だけを撮り直すことになり、編集のテンポも崩れる。
工程2:スクリプトと絵コンテの作り方
スクリプトは音声として読む原稿であり、絵コンテは映像として見る設計図だ。この2つを同時に作ると、どちらも中途半端になりやすい。まず原稿を書き切り、その後にカットに割る順序を推奨する。
ナレーション原稿のリズム設計
読み上げ原稿は、1文を短く保つことが最重要である。長い修飾節が続くと、音声合成でも肉声でも聞き取りにくくなる。目安として、1文は40字以内、1段落は3文以内に収める。
また、映像が説明する部分とナレーションが説明する部分を分ける。同じ内容を両方で言うと冗長になる。たとえば手順の映像を流している間は、ナレーションでは「なぜその手順が必要か」を語る。これで情報密度が上がる。
絵コンテは「動き」を書く
AI動画の絵コンテで最も重要なのは、静止した構図ではなく「何がどう動くか」を書くことだ。1カットにつき次の3点をメモする。
- 被写体の動き(歩く、振り返る、手を伸ばすなど)
- カメラの動き(固定、寄る、引く、横に流れるなど)
- 尺(秒数)
この3点が書かれていれば、プロンプト設計の工程で迷う時間が大幅に減る。逆にここが空欄のまま生成に入ると、結果を見ながら構想を練ることになり、試行回数が倍以上に膨らむ。
カット数を絞る
AI生成では、1カットあたりの情報量が増えるほど破綻のリスクが上がる。15秒の動画なら4〜6カット、30秒なら8〜12カットが現実的な目安だ。カットを増やすほど1カットの尺が短くなり、生成の失敗が目立ちにくくなるという利点もある。
工程3:映像生成モデルの選定基準
モデル選定は、知名度ではなく用途との相性で決める。同じプロンプトでも、モデルによって得意な表現がはっきり異なる。
比較すべき5つの軸
- 入力の種類:テキストのみか、参照画像を起点にできるか。既存の商品写真やキャラクター設定を活かすなら画像起点が有利。
- 動きの安定性:人物の手足や髪、背景の細部が破綻しにくいか。
- カメラ制御:寄り引き、パン、旋回などを指示できるか。
- 尺の上限:1回の生成で得られるクリップ長。長尺は接続部分のなめらかさも確認する。
- 一貫性:同一人物・同一空間を複数カットで維持できるか。
試作で判断する手順
カタログスペックを読むだけで決めず、必ず同じ条件で比較試作を行う。手順は次の通りだ。
- 本番で使う予定の代表カットを3つ選ぶ(人物アップ、引きの風景、物のクローズアップ)。
- 各モデルで同じプロンプトを3回ずつ生成する。
- 破綻の種類(指、文字、背景の消失、動きの速さ)を記録する。
- 修正にかかった試行回数を数える。
この記録を残しておくと、次の案件でモデルを選ぶ時間が数分で済む。モデルは更新が頻繁なため、半年ごとに再評価する前提で運用するとよい。
ハイブリッド構成を前提にする
現実的には、1つのモデルですべてのカットを賄うより、シーンごとに使い分けるほうが品質が上がる。人物の会話はリップシンクに強いモデル、風景は描写力の高いモデル、商品カットは画像起点のモデルといった具合だ。
ただし、モデルを増やすと色味や質感の統一が難しくなる。編集工程でカラー調整のプリセットを用意し、全カットに同じ処理をかけることで統一感を担保する。
工程4:プロンプト設計とカメラ言語
プロンプト設計は、映像の文法を言葉に翻訳する作業である。勘や語彙力に頼るのではなく、項目を埋めていく形式にすると再現性が上がる。
ショット指示の基本構文
次の順序で書くと、要素の抜け漏れが減る。
- 被写体:誰が、何が、どんな状態で
- 動作:何をしているか
- 構図:アップ、ミディアム、ロング、俯瞰
- カメラ:固定、ゆっくり寄る、横に流れる、追従
- 光:時間帯、光源の方向、強さ
- 質感と雰囲気:粒子感、色温度、空気感
例として「中年の女性が木製の机に向かって手書きのメモを取っている。ミディアムショット。カメラはゆっくり右へスライド。窓から差し込む朝の自然光。彩度を抑えた落ち着いた質感」といった形になる。
動きの速度を必ず指定する
AI生成で最も多い失敗は、動きが速すぎることだ。人間が指定しない場合、モデルは短いクリップに情報を詰め込もうとして動作を加速させる傾向がある。"slowly"(ゆっくり)、"gently"(穏やかに)、"subtle"(控えめに)といった速度の指定を必ず加える。
同様に、カメラの移動距離も指定する。"slow pan to the right" のように方向と速度をセットで書く。
失敗パターン別の修正手順
- 手足や指が崩れる:構図を引きにする、手を画面外に出す、動作を単純化する。
- 背景が溶ける:背景の要素を減らし、被写体との距離を明示する。
- 意図しない文字が浮かぶ:文字が入る余地のある構図を避け、看板や画面を画面外に追い出す。
- カットごとに顔が変わる:参照画像を固定し、髪型・服装・照明条件をすべてのカットで同じ文言にする。
- 色味がバラつく:プロンプトに色温度を明記し、編集で統一する。
修正は一度に1要素だけ変えるのが原則だ。複数要素を同時に変えると、どの変更が効いたのか分からなくなり、再現できなくなる。
プロンプトの資産化
うまくいったプロンプトは、テキストファイルや表計算に保存しておく。案件名、用途、モデル名、プロンプト本文、生成回数、評価を記録する。この蓄積が、チームの品質を底上げする最も確実な方法になる。
工程5:編集・音声・字幕の統合
生成したクリップは素材であり、編集で初めて伝わる映像になる。編集工程では、テンポ、情報の順序、音の3点を整える。
カット割りのテンポ
冒頭は短く、中盤で情報を出し、終盤で余韻を作るのが基本のリズムだ。具体的には、最初の2〜3カットは1〜2秒、説明パートは2〜4秒、締めは3秒程度にすると視聴が途切れにくい。
同じ画角が続くと単調になるため、アップと引きを交互に配置する。ただし、AI生成では急な画角変更で被写体の見た目が変わりやすいため、切り替えには短いカットを挟んで視線をリセットする。
音声とBGMの設計
音声は、ナレーション、環境音、効果音、BGMの4層で考える。
- ナレーション:主情報。常に最も聞き取りやすくする。
- 環境音:映像の説得力を上げる。街、室内、自然など空間の情報を補う。
- 効果音:視線を誘導する。切り替えや注目点に置く。
- BGM:感情の方向を決める。ナレーションの帯域を避けて音量を下げる。
音声合成を使う場合、句読点の位置で間が変わる。読点を増やしすぎると不自然に間延びするため、原稿の段階で読み上げを想定した記号の使い方を統一する。
字幕とテロップ
字幕は音声の代替ではなく、理解を助ける設計として扱う。1行は全角15〜20字程度に収め、2行までにする。表示時間は最低1.5秒を確保する。
縦型動画では画面の上下に安全領域を設け、UIに隠れない位置に配置する。テロップの書体は2種類までに絞り、色は背景とのコントラストを確保する。
工程6:品質管理とレビュー
書き出し前の確認を仕組み化しておくと、公開後の手戻りが激減する。
テクニカルチェックリスト
- 解像度とアスペクト比が配信先の仕様に合っているか
- フレームレートが統一されているか
- 音声のピークが歪んでいないか
- 冒頭と末尾に不要な空白フレームがないか
- ファイル名が命名規則に従っているか
表現と権利のチェック
AI生成物には、実在の人物やブランドに似た要素が意図せず含まれることがある。人物、ロゴ、建造物、楽曲の4点を確認する。特に、参照画像に第三者の著作物を使っていないかを記録として残しておく。
レビューの分業
レビューは1人で行うと見落としが出る。次の3役に分けると効果的だ。
- 構成レビュー:話の流れと尺のバランスを見る
- 技術レビュー:映像と音声の破綻、仕様を確認する
- 表現レビュー:誤解を招く表現、権利リスクを確認する
それぞれの観点で別の人が見ることで、問題の種類ごとに発見率が上がる。
用途別ワークフロー:広告・解説・SNSショート
用途によって工程の重心は変わる。
広告・プロモーション
冒頭3秒の訴求が最優先になる。企画工程に最も時間をかけ、カット数は少なく、編集でテンポを上げる。モデル選定では質感の統一を重視し、色調整のプリセットを先に作る。
製品解説・チュートリアル
情報の正確さが優先される。スクリプト工程に時間をかけ、画面録画や実写素材とAI生成カットを混在させる。AI生成は概念説明や背景の補完に絞ると破綻が目立たない。
SNSショート
縦型、字幕前提、無音視聴を想定する。1カット1メッセージを徹底し、テロップで完結する構成にする。生成よりも編集の速度が成果を左右するため、テンプレート化を進める。
よくある失敗と回避策
最初から完璧を狙う:AI生成は確率の上に成り立つ。3回試して2回成功すれば合格と基準を決め、残りは編集で補う。
プロンプトを長くしすぎる:要素を詰め込みすぎると、モデルが優先順位を誤る。1カット1メッセージを守る。
工程を飛ばして生成に入る:絵コンテなしで生成を始めると、試行回数が跳ね上がる。30分の設計が数時間の節約になる。
素材を整理しない:生成物のファイル名が乱雑だと、編集で使うカットを探すだけで時間が消える。案件名、シーン番号、テイク番号を含む命名規則を最初に決める。
音声を後回しにする:尺は音声で決まる。先にナレーションの長さを確定してから映像を合わせると、調整が一気に楽になる。
モデルの更新で崩れる:同じプロンプトでも結果は変わる。重要な案件では、採用したモデル名と生成日を記録し、再現条件を残す。
レビューを最後にまとめて行う:工程ごとに短い確認を挟むほうが、最終段階での修正が小さく済む。
FAQ:AI動画制作の実務的な疑問
どのくらいの学習期間が必要か
操作の習得よりも、工程の理解が先である。1本の短い動画を企画から書き出しまで通しで作れば、全体の流れは把握できる。その後、シーン別のプロンプト設計を反復して精度を上げていく。
実写素材とAI生成はどう使い分けるか
人物の説得力が重要な場面、製品の正確な形状を見せる場面は実写が有利だ。概念の説明、空間の広がり、非現実的な情景はAI生成が有利である。両者を混ぜる場合は、色温度と粒子感を揃えることで違和感を減らせる。
チームで制作するときの分担は
企画とスクリプト、生成とプロンプト設計、編集と音声、品質管理の4つに分けると連携しやすい。生成担当と編集担当を分ける場合、ファイル命名規則と素材の受け渡し場所を先に決めておくことが前提になる。
生成にかかる時間の目安は
クリップ長、解像度、試行回数によって大きく変動する。計画を立てる際は、1カットあたりの生成時間に試行回数を掛けた値を工程全体の見積もりに含める。待ち時間は他のカットの設計や編集の下準備に充てると効率がよい。
品質が安定しないときはどこに戻るべきか
まず工程4のプロンプト設計を見直す。それでも改善しない場合は工程3のモデル選定、つまり入力方式や得意分野の相性に問題がある可能性が高い。話が伝わらない場合は工程1か2に戻る。
長尺の動画はどう作るか
1本の長いクリップを狙うより、短いカットを多数生成して編集で接続するほうが現実的である。接続部では、前後で動きの方向と速度を揃えると自然につながる。ナレーションを先に完成させ、その上にカットを配置していく順序が最も破綻しにくい。
学びを資産化するには
プロンプト、採用モデル、生成日、評価を1つの記録にまとめる。案件ごとに振り返りを行い、うまくいった構文と失敗パターンを更新していく。この記録が、属人的な勘をチームの共有知に変える最も確実な方法である。
AI動画制作は、才能よりも工程の設計で差がつく。企画で判断基準を固定し、絵コンテで動きを言語化し、モデルとプロンプトを検証可能な形で運用し、編集と品質管理で仕上げる。この流れを一度自分の手で通せば、あとは案件ごとに精度を上げていくだけだ。ツールが入れ替わっても、この骨格はそのまま使い続けられる。



