AI動画制作の全体像とパイプライン設計
生成AIを使った動画制作は、もはや「面白いデモを作る遊び」ではありません。広告、教育、社内研修、SNS運用、プロダクト紹介など、実際の業務で使えるクオリティに到達しています。ただし、モデルに適当なプロンプトを投げれば完成品が出てくるわけではなく、映像制作の基本工程をAIの特性に合わせて再設計する必要があります。
従来の映像制作は、企画・脚本・絵コンテ・撮影・編集・仕上げという流れでした。AI制作でも骨格は同じです。変わるのは「撮影」の部分が「生成」に置き換わり、その前後に反復ループが入るという点です。具体的には、次の7工程を意識すると破綻しにくくなります。
- 目的と配信先の定義
- 脚本とショットリストの作成
- キーフレーム(静止画)の生成と選定
- 動画クリップへの変換
- 音声・音楽・効果音の生成
- 編集と仕上げ
- 品質チェックと納品
この工程で最も重要なのは、3と4を分離することです。いきなり動画を生成すると、構図もキャラクターもライティングも同時にぶれ、どこを直せばよいか分からなくなります。まず静止画で「絵」を確定させ、その絵を動かすという順序を守るだけで、やり直しの回数は大幅に減ります。
もう一つの原則は、工程ごとに「確定事項」と「検討事項」を分けることです。たとえばキャラクターの顔と衣装が確定していれば、後続のカットはすべてその参照画像を基準にできます。逆に、各カットで毎回ゼロからプロンプトを書くと、数カット目で別人のような顔になり、修正コストが雪だるま式に増えていきます。
企画・脚本・ショットリストの作り方
AIツールの性能を比較する前に、何を作るかを決める作業のほうが成果に影響します。ここが曖昧なまま生成を始めると、素材は大量に出来るのに編集でつながりません。
ログラインと尺の設計
最初に決めるのは、尺と配信先です。15秒の縦型ショート、30秒の横型CM、3分の解説動画では、必要なカット数も情報密度もまったく違います。目安として、1カットあたり2〜4秒で計算すると、30秒なら8〜12カット、3分なら40〜60カットになります。AI生成は1カットずつ作り込むため、カット数がそのまま工数になります。最初は10カット以内の短い尺から始めるのが現実的です。
ログラインは一文で書きます。「新製品の朝の使用シーンを通じて、時短効果を伝える」といった形です。この一文があると、不要なカットを削る判断ができます。
ショットリストの書き方
ショットリストは表形式で管理するのが扱いやすいです。列は次のようにします。
- カット番号
- 秒数
- 画面内容(何が映るか)
- カメラワーク(固定、パン、ドリーインなど)
- ライティング(逆光、柔らかい室内光など)
- 参照画像の有無
- 音声・セリフ
- ステータス(未着手、生成済み、採用)
この表を先に埋めておくと、生成作業は「表を上から潰していく作業」に変わります。創作的な迷いが減り、抜け漏れも防げます。
絵コンテをAIで作る場合の注意
絵コンテ自体をAIで生成するのも有効ですが、絵コンテの目的は「見栄え」ではなく「関係者との合意」です。ラフな線でも意図が伝われば十分なので、凝った絵を作るよりもカット割りの検証に時間を使うほうが費用対効果は高くなります。
生成モデルの選び方:判断基準と比較の視点
現在の動画生成は、単一のモデルで全カットをまかなうより、カットごとに適したモデルを選ぶ時代です。ここでは「どれが優れているか」ではなく「どう選ぶか」という基準を整理します。
判断基準1:映像のトーン
フォトリアル、シネマティック、アニメ調、3Dレンダリング風、ストップモーション風など、目指すトーンによって得意なモデルは異なります。実写風の人物を扱うなら肌の質感と顔の安定性、アニメ調なら線の太さと動きの滑らかさを確認します。同じプロンプトを複数モデルに投げて比較する「同一条件テスト」を最初に一度やっておくと、以後の選択が速くなります。
判断基準2:動きの再現性
動画生成で最も差が出るのが、動きの自然さです。特に次の3点をチェックします。
- 人物の手足が破綻しないか(指、関節、歩行)
- カメラワークの指示に従うか(ドリー、パン、オービット)
- 背景と被写体の境界がちらつかないか(テンポラルな安定性)
短いテストクリップを3本ほど作れば、そのモデルの癖が把握できます。
判断基準3:制御のしやすさ
参照画像を複数渡せるか、開始フレームと終了フレームを指定できるか、カメラワークを数値やキーワードで制御できるか。制御点が多いモデルほど、カット間の連続性を保ちやすくなります。逆に制御点が少ないモデルは、1カット完結のカット(風景、物撮り、抽象表現)に向いています。
判断基準4:解像度と尺の上限
書き出し解像度と生成できる秒数には上限があります。縦型のSNS用途と、大きなスクリーンでの上映では要求が違います。最後にアップスケールする前提であっても、元の解像度が低すぎると破綻が目立つため、最初から目標解像度の7割以上で生成できるモデルを選ぶと安全です。
判断基準5:試行回数あたりのコスト感覚
料金体系そのものより、「1本の採用テイクを取るまでに何回試行が必要か」で考えると比較しやすくなります。10回試して1本使えるモデルと、3回で決まるモデルでは、体感コストが3倍以上違います。料金表の数字だけで判断せず、実際の採用率をメモしておく習慣をつけましょう。
プロンプト設計の実践
プロンプトは「呪文」ではなく「仕様書」です。書くべき要素を固定しておくと、結果が安定します。
基本の6要素
- 被写体(誰が、何が)
- 動作(何をしているか)
- 環境(どこで、天候、時間帯)
- ライティング(光の方向と質)
- カメラ(距離、角度、レンズ感、動き)
- スタイル(フィルム調、色味、質感)
この順番で書くと、要素の抜けに気づきやすくなります。特にライティングとカメラは省略されがちですが、映像の印象を最も左右する部分です。
構図を言語化する語彙
「いい感じに」は禁句です。代わりに次のような語彙を使います。
- クローズアップ、ミディアムショット、ロングショット
- ローアングル、ハイアングル、アイレベル
- 浅い被写界深度、深い被写界深度
- 三分割構図、シンメトリー、リーディングライン
- 前景のボケ、背景の圧縮効果
これらを組み合わせると、意図した絵に近づきます。
カメラワークの指定
動画生成ではカメラワークが結果を大きく変えます。「ゆっくり前進(ドリーイン)」「左から右へのパン」「被写体の周囲を回るオービット」「固定(スタティック)」など、動きを一つに絞るのがコツです。複数の動きを同時に指定すると、モデルはどちらかを犠牲にします。
ネガティブ指定の使い方
避けたい要素は明示します。指の本数異常、余分な手足、文字化けした看板のテキスト、過度な彩度、顔の歪みなどが代表的です。ただしネガティブ指定を増やしすぎると、全体的に無難で退屈な絵になる傾向があります。本当に困った要素だけを3〜5個に絞るのが実用的です。
プロンプトのバージョン管理
採用したプロンプトは必ず保存します。テキストファイルでも表計算でも構いませんが、「どのプロンプトがどのカットに使われたか」が追える状態にしておくと、後からの再生成や部分差し替えが容易になります。
一貫性を守る:キャラクター・美術・ライティング
AI動画制作で最も多くの人がつまずくのが一貫性です。カットごとに顔が変わる、衣装の色が変わる、室内の明るさが急に変わる。これを防ぐには技術と運用の両面から手を打ちます。
キャラクターシートを作る
最初に、主人公の正面・斜め45度・横顔・全身の4枚を生成し、採用版を確定させます。これをキャラクターシートとして保存し、以降のすべてのカットで参照画像として使います。衣装違いが必要な場合は、同じ顔のまま衣装だけ変えたバリエーションをシートに追加します。
参照画像の使い方
参照画像を複数渡せるモデルでは、顔の参照と衣装の参照を分けて渡すと安定します。1枚に両方を詰め込むと、モデルがどちらの特徴を優先すべきか判断できず、平均的な顔になりがちです。
また参照画像は、なるべく撮影条件を揃えます。正面の柔らかい光で撮った顔と、強い逆光の顔を混ぜると、生成結果も中途半端になります。
シード値とスタイル固定
同じ構図のバリエーションを出したいときは、シード値を固定したままプロンプトの一部だけを変えます。これにより「同じ世界の別カット」を作りやすくなります。逆に、シードを毎回変えると、たとえ同じプロンプトでも画風が揺れます。
ライティングとカラーの統一
カット間の連続性は、色温度とコントラストで決まります。次のようなルールを事前に決めておくと、編集時の負担が減ります。
- 昼の屋外シーンは色温度を統一する
- 屋内は窓光を基準にし、光源の方向を揃える
- 夜のシーンは彩度を落とし、影を青系に寄せる
- 全カットで同じルック(フィルムグレイン、LUT的な色味)を適用する
マルチイメージ合成の考え方
複数の参照画像を組み合わせて1カットを作る手法は、キャラクター・衣装・背景・小道具をそれぞれ別に用意できるため強力です。ただし優先順位が曖昧だと破綻します。「顔は画像A、衣装は画像B、背景は画像C」と明示し、それぞれの役割をプロンプト内で説明するのがコツです。
実践ワークフロー:30秒プロモ動画を最後まで作る
具体例として、30秒の商品紹介動画を作る手順を追います。
ステップ1:要件を固める
配信先は縦型SNS、ターゲットは20〜30代、トーンは明るく清潔感、ナレーションあり、字幕あり。ここまで決めたら、尺は30秒、カット数は10本と仮決めします。
ステップ2:ショットリストを作る
- カット1:朝の窓辺、光が差し込む(3秒)
- カット2:主人公が伸びをする(3秒)
- カット3:商品を手に取るクローズアップ(2秒)
- カット4:商品を使う手元(3秒)
- カット5:表情のアップ、満足感(3秒)
- カット6:外出シーン、歩行(3秒)
- カット7:カフェで使用(3秒)
- カット8:产品のディテール(3秒)
- カット9:夕方の帰宅、リラックス(3秒)
- カット10:ロゴと商品の静止(4秒)
ステップ3:キーフレームを生成する
各カットの代表的な1枚を静止画で生成します。ここで構図とライティングを確定させます。10枚のうち採用できるのは半分程度と考え、多めに生成します。
ステップ4:クリップ化する
採用したキーフレームを動画生成モデルに渡し、2〜4秒のクリップにします。カメラワークは1カット1動作に絞ります。生成結果を確認し、破綻が大きいものはキーフレームに戻って作り直します。
ステップ5:テイクを選ぶ
各カット3〜5本の候補を出し、動きの自然さ、顔の安定、背景のちらつきの3点で採点します。満点のカットを揃えるのではなく、つながりが自然になる組み合わせを選ぶのがポイントです。
ステップ6:音声を作る
ナレーション原稿を書き、音声合成で読み上げを作ります。読みの速さは本編の尺に合わせ、1分あたり250〜300文字程度を目安に調整します。
ステップ7:編集する
タイムラインにカットを並べ、テンポを確認します。SNS向けなら最初の2秒で引き込む構成が有効です。BGM、効果音、字幕を載せ、最後にカラーを軽く整えます。
ステップ8:書き出しと確認
配信先の規定に合わせて解像度、フレームレート、ビットレートを設定します。スマートフォンの小さい画面で必ず一度確認し、字幕の可読性をチェックします。
音声・音楽・字幕の統合
映像の品質が同じでも、音次第で印象は大きく変わります。
ナレーションと音声合成
音声合成は、話速・抑揚・間の3点を調整します。特に「間」は重要で、AI音声は間が詰まりがちです。文と文の間に0.3〜0.5秒の無音を入れるだけで、聞き取りやすさが向上します。
リップシンク
人物が話すカットでは、口の動きと音声を合わせる処理を入れます。ただし完璧な同期を目指すと工数が増えるため、顔のアップを避け、横顔や手元のカットに音声を載せるという演出上の回避策も有効です。
BGMと効果音
BGMは動画の感情を決めます。テンポの速い曲は情報量の多い映像と相性がよく、遅い曲は情緒的なカットに向きます。効果音は画面の動作に同期させると、生成映像のわずかな不自然さを隠せます。ドアの開閉、足音、衣擦れなど、目立たない音が没入感を支えます。
字幕の設計
字幕は1行あたり全角15〜20文字程度に収めます。縦型動画では画面下部の安全領域を避け、UIと重ならない位置に配置します。話している内容をそのまま書き起こすのではなく、意味のまとまりで改行することが読みやすさの鍵です。
編集・仕上げ・書き出し
生成したクリップは、そのままでは粗さが残ります。編集工程で品質を底上げします。
つなぎの技術
カット間のつなぎは、視聴者の視線を意識します。前のカットで人物が画面右にいるなら、次のカットでも右に置くと視線移動が減り、滑らかに感じます。逆に意図的に視線をジャンプさせたい場合は、アクションの途中で切る「マッチカット」を使います。
映像の補正
- アップスケール:解像度を引き上げ、細部を補正する
- フレーム補間:フレームレートを上げ、動きを滑らかにする
- 手ぶれ補正:生成特有の微小な揺れを抑える
- ノイズ除去:暗部のざらつきを軽減する
これらはやりすぎると不自然になるため、必ず元映像と見比べながら調整します。
カラーグレーディング
カットごとに色温度がばらついている場合は、まずホワイトバランスを揃え、その後に全体のルックを適用します。個別カットを派手にいじるより、全体に同じ調整をかけるほうが統一感が出ます。
書き出し設定
SNS向けの縦型は1080×1920、横型は1920×1080が基本です。フレームレートは24fpsで映画的な質感、30fpsで標準的な配信、60fpsでスポーツやゲーム的な滑らかさになります。ビットレートは高めに設定し、再圧縮に耐える余裕を持たせます。
よくある失敗とトラブルシューティング
顔が毎回変わる
原因は参照画像の不足か、参照の優先順位が曖昧なことです。キャラクターシートを1枚に統合し、全カットで同じ画像を参照するようにします。
手や指が崩れる
手は現行モデルでも苦手分野です。対策は3つあります。手を画面から外す構図にする、手袋や小物で隠す、手元だけ別カットとして生成して合成する。実務では「映さない」判断が最もコスト効率が良いことが多いです。
動きが不自然に速い、または遅い
生成時のモーション量の指定を見直します。また、編集で速度を90〜110%程度に微調整するだけでも印象が変わります。
画面がちらつく
フレーム間の一貫性が弱い場合に起こります。生成秒数を短くし、安定したテイクを選び、編集でフレーム補間やノイズ除去を軽くかけます。
テキストが文字化けする
看板やラベルの文字をAIに生成させるのは避け、編集ソフトで後から合成するのが確実です。どうしても映像内に文字が必要な場合は、単純な形状の英数字に限定します。
カットがつながらない
ショットリストの段階で、前後カットの位置関係と視線方向を決めておきます。編集で問題に気づいた時点で戻ると、手戻りが大きくなります。
全体が単調に見える
カットのサイズ(寄りと引き)とアングルが同じになっていないか確認します。3カットごとに画面サイズを変えるだけで、リズムが生まれます。
運用・権利・倫理とFAQ
チームで回すための運用ルール
複数人で制作する場合は、次のルールを決めておくと混乱が减ります。
- 命名規則:プロジェクト名_カット番号_バージョン
- 採用判定:誰が最終決定するかを1人に決める
- 素材管理:生成物はクラウドに集約し、ローカル散在を防ぐ
- プロンプト管理:採用プロンプトを共有ドキュメントに記録する
権利と倫理のチェックリスト
- 実在の人物に似た顔を生成していないか
- 商標やロゴが意図せず映り込んでいないか
- 学習元の権利関係が不明な素材を参照画像にしていないか
- 音声合成で実在人物の声を模倣していないか
- 生成したことを開示する必要がある媒体かどうか
これらは公開前に必ず確認します。特に広告用途では、表現の正確性が信頼に直結します。
よくある質問
Q. どのモデルから始めればよいですか。
まずは無料または低コストで試せるものを2つ選び、同じプロンプトで比較してください。得意分野がはっきり分かれます。その後、自分の用途に合うほうを主軸にします。
Q. 1本の動画にどのくらい時間がかかりますか。
30秒の動画で、慣れれば半日から1日程度が現実的なラインです。内訳は、企画とショットリストに2割、キーフレーム生成に3割、動画生成とテイク選定に3割、編集と仕上げに2割という配分が目安になります。
Q. 静止画から動画にするのと、テキストから直接動画を作るのはどちらが良いですか。
制御したい要素が多いほど、静止画を経由するほうが有利です。逆に、抽象的な映像や背景素材など、正確な構図が不要な場合はテキストから直接生成するほうが速いです。
Q. 生成した映像がどうしても不自然です。
生成モデルを変える前に、カットの尺を短くしてみてください。2秒のクリップは4秒のクリップより破綻が少なく、編集でつなげば十分に見られます。
Q. 縦型と横型の両方が必要です。
最初から横型で作り、縦型は編集でクロップする方法が効率的です。ただし重要な被写体が画面の端にあると切れてしまうため、撮影(生成)時点で中央に主要素を置く構図を選びます。
Q. クオリティを上げる最短ルートは。
音、字幕、テンポの3点を改善することです。映像の生成品質を1段上げるより、この3点を整えるほうが視聴者の体感品質は大きく向上します。
まとめ
AI動画制作の成否を分けるのは、モデルの性能差よりも工程設計です。企画とショットリストで方向を定め、静止画で絵を確定し、動画化してテイクを選び、音と編集で仕上げる。この流れを繰り返し回すことで、属人的な勘に頼らず安定したアウトプットが得られます。まずは10カット、30秒の小さな作品を最後まで完成させてみてください。最後まで作り切る経験が、次の作品の品質を最も大きく引き上げます。



