AI動画生成が「単発の実験」で終わる理由
テキストから数秒の映像を出すだけなら、現在のモデルは誰でも驚かせてくれる。しかし、実際に納品できる形——広告、商品紹介、解説、ショートドラマ、採用動画——になると成功率は一気に下がる。理由は単純だ。生成モデルは「1ショットの美しさ」を競うが、動画は「ショット間の連続性」と「情報の順序」で評価される。1本の動画は、最低でも10〜30のショット、ナレーション、BGM、テロップ、書き出し設定という別々の工程が噛み合って初めて成立する。
うまくいかない原因の多くはモデルの性能ではない。ワークフローの設計である。プロンプトを1回だけ書いて出てきた映像をそのまま並べると、キャラクターの顔が毎カットで変わり、色温度がばらつき、カメラの向きが矛盾し、視聴者は数秒で離脱する。逆に、地味な見た目のモデルでも、工程を分割して管理すれば驚くほど安定した成果物になる。
この記事では、AI動画生成を「思いつきの実験」から「再現性のある制作ライン」に変えるための実践手順を、企画から書き出しまで通しで解説する。特定のツールに依存しない形で書いているので、利用中のサービスが変わっても考え方はそのまま使える。
ワークフロー全体像:6つの工程を一枚の地図にする
まず制作ラインを6工程に分解する。この地図があるだけで、どこで詰まっているのかが一目で分かるようになる。
- 設計:企画、台本、絵コンテ、ショットリスト
- 素材準備:参照画像、ロゴ、フォント、BGM候補、テンプレート
- 生成:ショット単位のクリップ生成(1ショットにつき3〜5テイク)
- 選別:テイク比較、ベストテイク抽出、必要なら再生成
- 組み立て:編集、音声、テロップ、モーショングラフィックス
- 仕上げと配信:カラー調整、書き出し、サムネイル、公開設定
重要なのは、工程3と工程4を分離することだ。生成と選別を同時にやろうとすると、「もっと良いのが出るはず」と無限に回し続けて時間が溶ける。1ショットにつき上限テイク数を先に決め、上限に達したら必ず選別に進む。
もうひとつの原則は「壊れたショットは直さない、作り直す」である。生成AIの出力は編集で無理に修正すると不自然さが残りやすい。1カット2〜4秒なら、再生成したほうが速く、結果も良い。
さらに、工程ごとにレビュー担当を決めておくと品質が安定する。台本のレビュー、ショットの選別、音声の確認、最終チェックを別の人が見るだけで、自分では気づけない違和感——視線の不一致、テロップの誤字、音量差——が大幅に減る。
プリプロダクション:目的・尺・配信先を先に固定する
生成を始める前に、変更コストが高い項目を確定させる。ここを曖昧にしたまま生成に入ると、後工程で作り直しが発生する。
目的を1文で書く
「誰に、何を、どう感じてもらい、次に何をしてほしいか」を1文にまとめる。例:海外向けECの新商品を、機能ではなく生活シーンの変化として伝え、商品ページへの遷移を増やす。この1文があると、ショットの取捨選択が速くなる。
尺とアスペクト比を決める
縦動画と横動画では構図の設計が根本的に違う。縦は被写体を中央に寄せ、上下にテロップとUIの余白を確保する。横は左右の情報量を活かせるが、縦より被写体が小さくなる。
| 配信先の型 | 推奨比率 | 目安の尺 | 設計の要点 |
|---|---|---|---|
| 縦型ショート | 9:16 | 15〜45秒 | 1カット2〜3秒、冒頭1秒で結論 |
| フィード広告 | 1:1 / 4:5 | 15〜30秒 | 音なし前提、字幕必須 |
| 通常動画 | 16:9 | 1〜10分 | 章立て、Bロール多用 |
| プレゼン資料動画 | 16:9 | 3〜8分 | 図解とテロップ中心 |
| サイネージ | 9:16 / 16:9 | 10〜20秒 | 無音ループ、文字大きめ |
ショットリストを作る
台本をそのまま生成に入れない。必ずショット単位に割る。1ショットは「1つの動作、1つのカメラ、1つの光」に絞るのがコツだ。欲張って複数の動作を1クリップに入れると、モデルは必ずどこかで破綻する。
ショットリストには次を書く。
- ショット番号と尺(例:S03 / 3秒)
- 構図(ワイド、ミディアム、クローズアップ)
- 被写体と動作
- カメラの動き(固定、パン、プッシュイン、オービット)
- 光と時間帯
- ナレーションまたはテロップの内容
この表があると、生成時に迷う時間がほぼゼロになる。
素材を先に揃える
参照画像(人物、商品、ロゴ)、使用フォント、BGM候補、効果音、カラーパレットを事前にフォルダ分けする。生成を始めてから素材を探すと、トーンが混ざって全体が散らかる。
モデル選定の判断基準:品質・速度・制御性のトレードオフ
モデルは「一番すごいもの」を選ぶのではなく、用途に合わせて使い分ける。判断すべき軸は次の8つだ。
1. 再現したい表現の種類
- 実写風の人物・生活シーン:人物の自然な動きと肌の質感に強いモデル
- アニメ・イラスト調:線の安定性とスタイル忠実度に強いモデル
- 3D・プロダクトCG:形状の正確さと反射表現に強いモデル
- 図解・インフォグラフィック:生成よりAfter Effects系の方が速く正確
- 顔のトーキング:リップシンク精度と首の動きの自然さで選ぶ
2. クリップの最大尺
多くのモデルは5秒前後、長いもので10〜20秒。ショットリストの尺と合わないと、無理な分割が発生してつながりが悪くなる。長尺を1本で狙うより、短いクリップを設計通りに並べるほうが最終品質は高い。
3. 参照画像・一貫性のサポート
人物や商品の同一性を保つには、参照画像を複数枚受け付けるか、シードを固定できるかが決定的に重要になる。ここが弱いモデルは、長尺のストーリーには向かない。
4. カメラ制御の粒度
「プッシュイン」「オービット」「ドリー」といった語彙にどれだけ忠実か。カメラ制御が弱いモデルは、編集でごまかすしかなくなる。
5. 解像度とアップスケール耐性
720pで生成して1080pや4Kに拡張する流れが現実的。アップスケールしたとき破綻が少ないモデルを選ぶ。
6. 速度
1ショット30秒で出るか、5分かかるかで、試行回数が変わる。試行回数はそのまま品質に直結する。プレビューは低解像度、本番だけ高解像度という二段構えが有効だ。
7. 音声の同時生成
効果音や環境音を同時に出せるモデルは、後工程の手間を減らす。ただし音の同期精度はまだ粗いことが多いので、最終的には別レイヤーで整える前提で考える。
8. 商用利用条件
業務用途では、生成物の商用利用可否、学習データに関する表記、入力素材の取り扱いを必ず確認する。ここを曖昧にしたまま進めると、公開直前に全部やり直しになる。
ハイブリッド運用が現実解
1本の動画を単一モデルで作る必要はない。人物カットは人物に強いモデル、商品カットは形状に強いモデル、テロップは編集ソフト、背景は静止画生成という分担が普通になっている。むしろ、同じモデルで全部やろうとするほうが不自然さが目立つ。
プロンプト設計:被写体・動作・カメラ・光・スタイルの5要素
プロンプトは雰囲気を書くものではなく、仕様を書くものだ。次の5要素を順番に埋めると再現性が上がる。
- 被写体:誰が、何が、どんな見た目で(年齢層、服装、素材感)
- 動作:何をするか(1つだけ)、動作の速度
- カメラ:構図、アングル、レンズ感、動き
- 光:時間帯、光源の方向、色温度、コントラスト
- スタイル:実写/アニメ/フィルム調、色味、質感
テンプレート例
「40代の女性が白いシャツで木製の机に向かう。左手でノートを開き、右手でペンを取る。ミディアムショット、やや俯角、50mm相当、ゆっくりしたプッシュイン。午前の窓光が左から入り、柔らかい影。落ち着いた実写調、自然な色味、粒子感は控えめ」
この形なら、要素を1つずつ差し替えてバリエーションを量産できる。逆に、要素を全部同時に変えると、何が効いたのか分からなくなる。
否定条件も仕様として書く
「文字を入れない」「ロゴを出さない」「余計な人物を入れない」「カメラを速く動かさない」など、避けたい要素を明示する。特にテロップは生成に任せず、編集で載せたほうが読みやすく、修正も簡単だ。
言語の扱い
日本語で書いて意図が通るモデルも増えたが、動作やカメラ用語は英語のほうが精度が高いことが多い。日本語で構成を書き、カメラと光のキーワードだけ英語を併記するスタイルが実務的だ。
シードと参照の固定
同じ人物を複数ショットで使うなら、シード値を記録し、参照画像を3枚(正面、斜め、表情違い)用意する。服装・髪型・アクセサリーの記述は全ショットで一字一句同じにする。ここを「気分で書き換える」のが、一貫性が崩れる最大の原因である。
ショット生成と一貫性:キャラクター・色・カメラをつなぐ技術
生成の現場で最も時間を食うのが一貫性の維持だ。次の順番で対処すると効率が良い。
キャラクターの一貫性
- 参照画像は正面だけでなく、斜め45度と横顔を用意する
- 生成順は「基準ショット」を最初に決め、それを参照にして残りを作る
- アップに耐える顔を基準にする(引きの絵から作ると顔が曖昧になる)
- 年齢・体型・髪型の記述をテンプレート化して使い回す
色の一貫性
ショットごとに色温度が変わると、素人っぽさが最も強く出る。照明条件を「同じ時間帯・同じ光源位置」に揃え、編集で全カットに共通のLUTを当てて統一する。屋外と屋内を混ぜるなら、屋内も窓光を同じ方向から入れる。
カメラの一貫性
視線のルール(イマジナリーライン)を守る。人物Aが右を向くカットの次は、相手が左を向くカットにする。これを破ると、会話シーンが急に分かりにくくなる。加えて、カメラの動きは「1ショット1動作」に絞る。パンとプッシュインを同時に指示すると、たいてい破綻する。
クリップの長さとつなぎ
1カット2〜4秒を基本にすると、生成の成功率が上がり、編集の自由度も増える。つなぎは次の3つを使い分ける。
- マッチカット:似た構図でつなぐ(動作の連続性を演出)
- カットオンアクション:動作の途中で切る(テンポが出る)
- ジャンプカット:同構図で時間を飛ばす(説明動画で有効)
アップスケールとフレーム補間
生成した素材は解像度が足りないことが多い。アップスケールツールで1080pまたは4Kに引き上げ、必要ならノイズ除去を軽くかける。フレーム補間は諸刃の剣で、24fpsのシネマティックな素材を60fpsにすると不自然なぬるっとした動きになる。補間は「遅い動きのカット」だけに限定する。また、動きが速すぎて破綻する場合は、スローモーション指定で生成してから編集で速度を上げると自然に仕上がる。
音声・BGM・字幕:見た目より音で差がつく
視聴者は映像の粗さには寛容だが、音の悪さには即座に離脱する。AI動画で最も投資対効果が高いのは音まわりだ。
ナレーション
音声合成を使う場合、読み上げ速度は1.0〜1.1倍、文の間は0.2〜0.4秒空ける。句読点の位置を調整するだけで自然さが大きく変わる。固有名詞や数字は読み間違えやすいので、事前に読みを確認し、必要ならその部分だけ別テイクに分ける。
BGMと効果音
BGMは動画のテンポを決める。冒頭1秒でリズムが入ると離脱率が下がる。音量はナレーションを邪魔しない位置に敷き、盛り上げたい瞬間だけ持ち上げる。効果音は3〜5個に絞る。多いほど安っぽく聞こえる。
音量の目安
- ナレーション:ピークが概ね -6dB 前後
- BGM:ナレーションより -18〜-20dB 程度下
- 統合ラウドネス:配信先の基準に合わせる(動画投稿サイトは概ね -14 LUFS、音声主体の配信は -16 LUFS 前後)
- 書き出し音声:48kHz / AAC 256〜320kbps
字幕
縦動画は音を出せない視聴が多いため、字幕は必須と考えたほうがよい。1行あたり15〜20文字、表示は2〜3秒、画面下から少し上げてUIと重ならない位置に置く。読み上げと字幕のタイミングを数フレームずらすと、口の動きと合って見える。
編集とポストプロダクション:AI素材を作品に変える工程
生成素材はあくまで素材だ。ここで「作品」に近づける。
カットのリズム
つないだ後に一度通しで見て、ダレる箇所を削る。目安として、情報提示パートは1カット2〜3秒、感情を乗せるパートは4〜6秒。AI素材は長く見せると粗が目立つので、短く切って畳みかけるほうが強い。
カラー調整
全カットに同じLUTを当ててから、ショット単位で露出とホワイトバランスを微調整する。肌の色がカットごとに違うと一気に安っぽくなるので、顔だけを基準に合わせる。
テロップとモーショングラフィックス
文字は生成に任せず、編集ソフトで載せる。フォントは1本の動画につき2種類まで。見出しと本文でウェイトを分け、登場アニメーションは0.2〜0.3秒で統一する。図解や矢印は生成より既存のテンプレートのほうが速く、正確で、修正も効く。
よくある不自然さの修正
- 手や指の崩れ:該当カットを短く切るか、手が写らない構図に差し替える
- 一瞬のモーフィング:その0.3秒を切り落とす、または別テイクに差し替える
- 背景の歪み:被写体にモーションブラーを軽くかけ、視線を被写体に集める
- 文字化けのようなノイズ:暗い背景に置き換えるか、覆いをかける
書き出し設定
| 用途 | 解像度 | ビットレート目安 | コーデック |
|---|---|---|---|
| 縦型ショート | 1080x1920 | 8〜12 Mbps | H.264 |
| 通常動画 | 1920x1080 | 8〜12 Mbps | H.264 / H.265 |
| 高品質配信 | 3840x2160 | 35〜45 Mbps | H.265 / AV1 |
音声は48kHz、AAC 256〜320kbpsに統一。フレームレートは素材と合わせ、24fps素材を無理に60fpsで書き出すとカクつきの原因になる。HDRは配信先が対応していない限り避け、SDRで安定させる。縦動画は上下にセーフエリアを取り、UIやテロップに被らないようにする。
よくある失敗とトラブルシューティング
キャラクターの顔が毎回変わる
参照画像の枚数不足、シード未固定、プロンプトの記述ゆれが原因。3点セットで対処する。参照画像を3枚に増やす、シードを記録して固定する、人物記述をコピー&ペーストで完全一致させる。
動きが速すぎて不自然
速い動作は破綻しやすい。スローモーションで生成し、編集で速度を戻す。あるいは動作を1つに絞り、フレーム数を増やす。
生成コストと時間が読めない
解像度と尺を下げたプレビュー生成を先に行い、構図が確定したカットだけ本番生成する。並列で回せるサービスなら、優先度の高いカットから順に処理する。上限テイク数を決めておくことも重要だ。
商用利用が不安
利用規約を確認し、入力素材(顔写真、ロゴ、既存キャラクター)の権利を整理する。実在人物に似た人物、実在ブランドに似たロゴ、既存楽曲に似たBGMは避ける。声についても、本人の許諾なしに特定個人の声を模倣しない。
なんとなく安っぽい
原因の多くは音とテンポ。BGMを入れ、冒頭1秒を締め、テロップのフォントを2種類に絞る。これだけで印象は大きく変わる。
FAQ
Q1. 1本の動画を作るのに何ショット必要か
15秒の縦動画なら6〜10ショット、60秒なら15〜25ショットが目安。1ショット2〜4秒で設計し、テロップだけのカットを混ぜると制作が軽くなる。
Q2. どのモデルを最初に試すべきか
用途で決める。人物を自然に動かしたいなら人物描写に強いモデル、スタイルを固定したいなら参照画像対応が強いモデル、図解中心なら生成を使わず編集ソフトで作る。まず1カットだけ試して、手と顔の破綻率を確認するのが早い。
Q3. 生成素材だけで1本作れるか
可能だが、推奨しない。テロップ、図解、商品の寄り、ロゴの静止画など、生成に頼らないカットを3割ほど混ぜると、全体の説得力が上がり制作時間も短くなる。
Q4. 日本語プロンプトと英語プロンプトどちらが良いか
構成や物語は日本語で整理し、カメラ・光・質感のキーワードは英語を併記するのが実務的。モデルごとに得意な表現が違うため、同じ指示を両言語で試して結果を比較する価値はある。
Q5. 音声はどう作るか
音声合成でナレーションを作り、必要なら録音した本人の声と混ぜる。読み上げ速度と間を調整し、BGMと効果音を別レイヤーで重ねる。音量は配信先の基準に合わせて最終確認する。
Q6. 一貫性を保つ最短手順は
基準ショットを1つ作り、それを参照画像として残りを生成する。シードを固定し、人物と照明の記述をテンプレート化し、全カットに共通LUTを当てる。この3点で大半のばらつきは消える。
Q7. どこまで自動化すべきか
企画、台本、ショットリスト、テイク選別、最終カラー調整は人が関与したほうが品質が上がる。逆に、下書きナレーション、字幕の初稿、低解像度プレビュー、フォーマット変換は自動化に向く。
Q8. 品質を上げる最短の一手は
尺を短くすること。30秒の動画を45秒に伸ばすより、30秒を22秒に圧縮するほうが、体感品質は必ず上がる。不要なカットを削る作業は、新しいモデルを試すより効果が大きい。
まとめ:工程を分けた人が勝つ
AI動画生成の成果は、モデルの新しさではなく工程設計で決まる。目的と尺を先に固定し、ショットリストを作り、モデルを用途で使い分け、参照画像とシードで一貫性を守り、音と編集で仕上げ、配信先に合わせて書き出す。この流れを型として持っておけば、使うツールが入れ替わっても同じ品質で作り続けられる。
最初から完璧を狙う必要はない。まず15秒の縦動画を1本、6ショットで作ってみること。制作ラインを1周すると、どこに自分のボトルネックがあるかがはっきり見えてくる。そして2本目からは、そのボトルネックだけを改善すればよい。

