マーケティング動画のAI自動生成が向くケース・向かないケース
動画広告の本数を増やしたい。しかし撮影のたびにスタジオ、出演者、撮影監督、編集者を手配するのは現実的ではない。こうした場面で、AIによる動画生成は現実的な選択肢になる。ただし「すべての動画をAIに置き換える」という発想は失敗のもとだ。最初に決めるべきは、どの工程をAIに任せ、どこに人の判断を残すかである。
判断を誤らないために、目的と制約を先に言語化しておこう。AI生成が得意なのは、反復、バリエーション、抽象表現、そして撮影が難しい情景だ。逆に、実在の人物の証言、規制の厳しい表現、細部の正確性が問われる映像は、人と実写の領域である。
AI自動生成が力を発揮する条件
- 同じメッセージを複数のバリエーションで検証したい
- 6〜30秒の短尺動画を毎週更新したい
- 商品のコンセプトや抽象的な価値を視覚化したい
- 多言語・多地域向けに同じ構成を展開したい
- 実写撮影が難しい環境(海中、宇宙、近未来、大規模施設)を描きたい
- 企画段階の絵コンテを素早く映像化し、関係者の合意を得たい
人が主導すべき条件
- 実在の顧客や経営者の証言を扱う
- 医療、金融、法律など表現規制が厳しい領域
- ブランドの旗艦映像として質感や演技力が問われる
- 商品そのものの正確な形状・機能・使用手順を伝える
- 店舗やスタッフの日常をそのまま見せたい
| 判断軸 | AI自動生成が向く | 実写・人力が向く |
|---|---|---|
| 制作本数 | 月10本以上の量産 | 年数本の旗艦コンテンツ |
| 更新頻度 | 週次で差し替え | 半年単位で据え置き |
| 被写体 | CG、イラスト、抽象概念 | 実在の人物、実物の商品 |
| 表現規制 | 自由度が高い | 正確性の証明が必須 |
| 予算配分 | テストと改善に寄せる | 撮影と演出に寄せる |
実際の現場はどちらか一方ではない。「AIで素材と選択肢を作り、人が選び、整える」ハイブリッド運用が最も現実的だ。ここからは、そのハイブリッド運用を前提に、企画から配信までの流れを段階ごとに整理する。
AI動画制作パイプラインの全体像
AIで動画を作る作業は、ボタンを押せば完成する魔法ではない。7つのフェーズに分け、それぞれの入出力と担当を決めることで、品質が安定し、引き継ぎも楽になる。
| フェーズ | 主なアウトプット | 目安時間(15〜30秒の1本) | 主担当 |
|---|---|---|---|
| 1. 企画 | 目的、KPI、単一メッセージ | 30〜60分 | マーケター |
| 2. 構成・脚本 | カット表、セリフ、字幕案 | 60〜120分 | ディレクター |
| 3. 映像生成 | 各カットの映像素材 | 60〜180分 | プロンプト設計者 |
| 4. 音声 | ナレーション、効果音 | 30〜60分 | 音声担当 |
| 5. 編集 | 完成尺のマスター | 60〜120分 | 編集者 |
| 6. 品質チェック | 修正版、承認記録 | 30〜60分 | チーム全体 |
| 7. 配信・検証 | 配信設定、レポート | 週次運用 | 分析担当 |
最も手戻りが起きやすいのは、フェーズ2と3の境目だ。脚本の段階で「各カットで映像的に何が起きるか」を言葉にしておくと、生成の試行回数が大きく減る。
役割分担の考え方
小規模チームなら、企画と分析を1人、脚本と編集を1人、生成を1人が担当する形で回る。大切なのは、プロンプトを書く人が最終的な映像の責任者になるのではなく、あくまで「演出意図を決める人」が上流にいることだ。AI生成は指示の粒度にそのまま結果が比例するため、曖昧な発注は曖昧な映像になる。
1本あたりのコスト感覚
コストは「生成回数×単価」だけで決まらない。修正にかかる人件費、待ち時間、権利確認の工数まで含めて考える。目安として、ラフ生成を10回、本番生成を3〜5回、修正を2回程度に収める設計にすると、収支が読みやすくなる。
企画フェーズ:コンセプトを最短で固める
1本につき1メッセージ
複数の訴求を1本に詰め込むと、AI生成でも実写でも焦点がぼやける。「安い」「速い」「安全」を同時に伝えようとすると、視聴者には何も残らない。1本で伝えることは1つに絞り、残りは別のバリエーションに分ける。これはABテストの設計とも相性がよい。
ブリーフの標準フォーマット
企画のたびにゼロから考えるのを避けるため、定型フォーマットを用意する。
目的:
KPI:
ターゲット:
単一のメッセージ:
視聴後の感情:
トーン:
尺:
アスペクト比:
必須要素:
禁止要素:
このフォーマットを埋めるだけで、映像生成に必要な情報の8割が揃う。特に「視聴後の感情」は、映像のトーンやテンポを決める重要な手がかりになる。
AIを企画の壁打ちに使う
企画段階では、AIをアイデアの量産に使うのが効率的だ。「共働き世帯に向けて、時短調理器具の15秒動画の切り口を20案」といった依頼を投げ、出てきた案を人間が選別する。そのまま使うのではなく、意外な組み合わせを拾い、自社の顧客理解で補正するのがコツである。
KPIを先に決める
再生数だけを見ていると、改善の方向が定まらない。短尺動画では、3秒視聴率、完視聴率、クリック率、コンバージョン率を目的別に選ぶ。認知目的なら3秒視聴率と再生回数、獲得目的ならクリック率とコンバージョン率が主指標になる。
構成・脚本・プロンプト設計
15秒と30秒の骨格
短尺動画は、時間配分がそのまま成果を左右する。
| 秒数(15秒) | 役割 | 内容の例 |
|---|---|---|
| 0〜3秒 | フック | 意外な映像、問いかけ、数字 |
| 3〜8秒 | 課題 | 視聴者が共感する困りごと |
| 8〜13秒 | 解決 | 商品やサービスの提示 |
| 13〜15秒 | 行動 | 次の一歩を明確に |
30秒の場合は、課題と解決の間に「証拠」や「比較」を挟む。使い方のデモ、ビフォーアフター、第三者の声などが入る。
カット表の作り方
映像生成に進む前に、カット単位で表を作る。
| カット | 尺 | 被写体 | 動作 | カメラ | セリフ・字幕 |
|---|---|---|---|---|---|
| 1 | 2秒 | 人物の手元 | 鍋をかき混ぜる | 寄り、手ぶれなし | 「帰宅は19時」 |
| 2 | 3秒 | キッチン全景 | 湯気が立つ | ゆっくり前進 | 「支度に40分」 |
| 3 | 4秒 | 商品 | 蓋を開ける | マクロ、浅い深度 | 「火入れは3分」 |
この表があると、生成すべき素材の数と尺が確定し、無駄な試行が減る。
プロンプトの基本構造
プロンプトは、次の順序で組み立てると安定する。
[被写体] + [動作] + [カメラワーク] + [照明] + [スタイル] + [アスペクト比] + [除外要素]
悪い例は「おしゃれなキッチンの動画」のように抽象的すぎる指示だ。良い例は「白いタイルのキッチンで、人物が片手で鍋をかき混ぜる。カメラはゆっくり前進、右手前から。朝の自然光、柔らかい影。9:16の縦型。人物の顔は映さない」のように、映像で確認できる要素だけで書く。
動詞で書く
生成モデルは名詞より動詞に反応しやすい。「美しい」「高級感」といった評価語は、結果がばらつく。代わりに「ゆっくり歩く」「窓を開ける」「湯気が立つ」のように、観察できる動作で指定する。
除外要素を明示する
不要な要素は必ず書く。ロゴ、余計な人物、文字、指の本数の乱れ、過度な被写界深度など、頻出する崩れを先回りして指定しておくと、修正の手戻りが減る。
映像生成モデルの選定基準
用途別にモデルを分ける
一口にAI動画生成といっても、役割は分かれている。テキストから映像を作るモデル、静止画を動かすモデル、人物の口の動きを合わせるモデル、動きを転写するモデル、解像度を上げるモデル、フレームを補間するモデル。1つのモデルで全部を賄おうとすると、どこかで品質が落ちる。
| 基準 | 確認する内容 |
|---|---|
| 一貫性 | 同じ人物・同じ空間を複数カットで再現できるか |
| 制御性 | カメラワークや動きの強さを指定できるか |
| 尺 | 1回の生成で何秒まで出せるか |
| 解像度 | 配信先の要求を満たすか |
| 音声対応 | リップシンクや効果音を同時に扱えるか |
| 権利条件 | 商用利用や二次利用の扱いは明確か |
| 速度 | 反復試行に耐える応答時間か |
選定の順序
最初にすべての基準を満たすモデルを探すのではなく、工程ごとに最適なものを組み合わせる。企画のラフは速さ優先、本番は一貫性優先、仕上げは解像度優先。この順序で道具を替えると、無駄な高品質生成を繰り返さずに済む。
失敗しやすい選定ミス
- デモ映像の見栄えだけでモデルを決める
- 自社の被写体(人物・商品)で試さずに本番に入る
- 尺や解像度の制約を後から知る
- 商用条件を確認せずに配信してしまう
導入前には、必ず自社の題材で3本のテスト生成を行う。テストの観点は、再現性、崩れの頻度、修正のしやすさの3つで十分だ。
一貫性の設計:キャラクター・シーン・トーンを崩さない
キャラクターシートを作る
同じ人物を複数のカットに登場させるなら、先に設定を文書化する。年齢、髪型、髪色、体型、服装、アクセサリー、表情の傾向。これをキャラクターシートと呼び、プロンプトの先頭に毎回同じ文言で貼り付ける。参照画像は3〜5枚用意し、正面、斜め、横、全身をそろえると安定する。
スタイルを外部化する
色、レンズ、照明、フィルム感といったスタイル要素も、文章として固定する。「屋外は午前の自然光、屋内は暖色の間接照明」「レンズは35mm相当、被写界深度は浅め」「彩度は控えめ、コントラストは中庸」。この定義をチームで共有すれば、担当が変わってもトーンがぶれない。
崩れのサインに気づく
- カットごとに顔の輪郭が変わる
- 衣装の色や柄が変わる
- 光源の方向が逆になる
- 背景の小物の位置が移動する
これらが出たら、参照画像の追加、シード値の固定、スタイル記述の統一を試す。同時に複数の条件を変えると原因が分からなくなるので、一度に1つだけ変える。
シーン一貫性のための空間設計
同じ部屋を複数カットで使うなら、間取りと主要な家具の配置を文章で決めておく。「窓は左、テーブルは中央、椅子は2脚」といった程度の情報でも、生成結果のばらつきは減る。
音声・字幕・BGMの自動化
ナレーション設計
音声合成は、声質そのものより「話速」と「間」で印象が決まる。短尺では1秒あたり4〜5文字が聞き取りやすい目安だ。文末を上げすぎず、体言止めを混ぜると落ち着いた印象になる。強調したい語の前には0.2秒の間を入れる。
声の一貫性
シリーズ展開する場合は、同じ話者を固定する。担当者やキャンペーンごとに声が変わると、ブランドの記憶が積み上がらない。多言語展開では、翻訳した文をそのまま読ませず、尺に合わせて言い回しを調整する。直訳は音声では冗長になりやすい。
字幕の自動生成と校正
自動字幕は下書きとして使い、必ず人が確認する。固有名詞、型番、社名、地名は誤変換が多い。あらかじめ誤変換リストを作り、置換ルールとして登録しておくと校正が速い。字幕は1行あたり全角13〜16文字、最大2行を目安にすると、スマートフォンでも読みやすい。
BGMと効果音
楽曲は利用条件を必ず確認する。動画の尺とBGMの尺が合わない場合は、フェードやループで処理するより、尺に合う曲を選び直すほうが自然だ。効果音は「切り替え」「強調」「完了」の3種類だけに絞ると、うるさくならない。
ミックスの目安
ナレーションを主役にし、BGMはその下に敷く。モバイルの内蔵スピーカーで確認し、ナレーションの音量を基準にBGMを-18〜-12dB程度下げる。最後にスマートフォン実機で必ず聴く。
編集・レビュー・修正ループ
テンポを整える
生成した素材は、多くの場合そのままでは長い。2〜3秒でカットを切り替え、無音区間を削る。冒頭の1秒で視聴が決まるため、最初のカットは最も情報量の多いものにする。
レビューの観点を固定する
レビューが属人的になると、毎回違う指摘が出て修正が終わらない。次の4観点で順に確認する。
- メッセージは1つに絞られているか
- 3秒以内に引きがあるか
- 音声と字幕が一致しているか
- 権利・規制上の問題はないか
版管理の命名規則
案件名_配信先_アスペクト比_バージョン_日付
このように統一しておくと、修正版の取り違えを防げる。ファイル名だけでなく、どのカットにどのプロンプトを使ったかも記録しておくと、後の横展開が速い。
修正の優先順位
すべての指摘を一度に直そうとすると、新しい崩れが生まれる。優先順位は、メッセージの伝達、音声の明瞭さ、映像の一貫性、細部の質感の順に下げる。
配信と改善サイクル
配信先ごとの仕様を先に決める
同じ素材でも、縦型、横型、正方形で構図は変わる。縦型では被写体を中央に置き、上下に余白を作る。横型では左右の情報量を増やす。生成の段階でアスペクト比を決めておけば、後からのトリミングで構図を壊さずに済む。
ABテストの設計
一度に変える要素は1つにする。冒頭のカット、テロップの文言、ナレーションの性別、BGMの有無。複数を同時に変えると、何が効いたか分からない。1つの動画につき3〜5パターンを用意し、同じ予算と期間で比較する。
記録と再利用
結果は表に残す。「どのメッセージが、どの映像表現で、どの数値だったか」を蓄積すると、勝ちパターンが資産になる。うまくいった構成はテンプレート化し、次の案件の出発点にする。
改善の周期
週次で配信し、月次で振り返る運用が現実的だ。週次では数値の確認と小さな差し替え、月次では構成そのものの見直しを行う。この2層のリズムを分けておくと、目先の数値に振り回されにくい。
よくある失敗とFAQ
よくある失敗
プロンプトが抽象的すぎる。 「おしゃれ」「高級」といった評価語は結果がばらつく。動作とライティングで指定する。
尺を長く取りすぎる。 短尺では15秒が上限の目安。伝えたいことを削る勇気が成果につながる。
音声を後回しにする。 音声の質は視聴維持率に直結する。映像と同じくらいの工数を割く。
一貫性の確認を最後にまとめて行う。 カットごとに都度確認したほうが、修正コストは小さく済む。
権利確認を配信直前にやる。 素材、楽曲、話者の利用条件は最初に確認する。
数値を記録しない。 記録がないと、成功の再現も失敗の回避もできない。
FAQ
Q. どのくらいの予算と期間で始められるか。
A. まずは既存の1本を題材に、映像生成のみを置き換える小さな実験から始めるのが安全だ。ツールの費用より、試行と修正にかかる人の時間のほうが大きい。
Q. 実写とAIの混在は可能か。
A. 可能だが、質感の差が目立つ。実写に寄せるなら、生成側の色温度と粒状感を実写に合わせ、カットの切り替えを短くする。完全な一致を目指すより、意図的な対比として設計するほうがうまくいく。
Q. 人物の顔の崩れが直らない。
A. 顔を大きく映すカットを減らす、手元や後ろ姿で見せる、参照画像を増やす。この3つで多くの問題は回避できる。
Q. 多言語展開のコツは。
A. 字幕と音声を分けて管理する。映像は共通、音声と言語別字幕だけを差し替える設計にすると、翻訳の手戻りが減る。
Q. どの指標を最初に見るべきか。
A. 配信先にもよるが、まずは3秒視聴率。冒頭で離脱されているなら、映像の質を上げるより前に、最初の1秒を変える。
Q. チームに必要なスキルは。
A. 映像の構成力を最も重視したい。プロンプトの技術は数週間で習得できるが、何を1本に絞るかという判断は経験に依存する。
Q. 生成した素材の管理はどうするか。
A. カット単位でファイル名を統一し、使用したプロンプトとモデル名を記録する。後から同じ表現を再現できることが、継続運用の鍵になる。
Q. 効果が出るまでの目安は。
A. 最初の数本は学習コストが先行する。パイプラインが固まってからが本番で、そこから数値が安定し始める。週次で回し、月次で構成を見直すリズムを崩さないことが、結果として最も近道になる。



