AI動画生成が制作現場の前提をどう変えたか
かつて動画制作は、企画・撮影・照明・出演者・編集という分業を前提に組み立てられていた。機材を揃え、場所を押さえ、人を集め、撮り直しのたびに同じ条件を再現する。この工程の重さが、そのまま「本数を作れない理由」になっていた。生成AIがこの前提を持ち上げたのは、撮影そのものを不要にしたからではない。試作と反復のコスト構造を変えたからである。
最初の変化は、アイデアの検証速度だ。以前ならコンテを描き、絵コンテを共有し、ようやくテスト撮影にたどり着く。今は同じ日のうちに動く画を作り、5案を並べて比較できる。意思決定の場に「動いているもの」を持ち込めるかどうかは、制作の質に直結する。
二つ目の変化は、量産と品質の両立である。同じキャラクター、同じ画風、同じ照明設計を、複数のカットで再現できるようになった。これはシリーズ物や広告の横展開、教育コンテンツの分割配信などで決定的に効く。
三つ目の変化は、逆説的だがネガティブなものだ。一貫性の維持が最大の技術課題として浮上した。生成は魅力的な1枚を出すのは得意だが、同じ人物を10カットにわたって同一に保つのは苦手だった。ここを設計で埋められるかどうかが、素人仕事とプロ仕事の分かれ目になる。
まず共有しておくべき前提がある。生成は「一発で決める」ものではなく「多数出して選ぶ」ものだ。この考え方を受け入れていないチームでは、必ず「なぜこんなに時間がかかるのか」という摩擦が起きる。逆に、選別を前提にしたワークフローを組んでおけば、作業は驚くほど安定する。
本記事で扱う流れは次の通りだ。企画、設計、素材準備、生成、選別、編集、音声、仕上げ、改善。この9工程を順に分解し、各段階で何を判断すべきかを具体的に示していく。
一貫性を決める3つの要素を分解する
「なんとなく雰囲気が違う」という指摘は、たいてい3つの層のどれかが崩れている。層ごとに分けて管理すると、修正箇所が特定できる。
キャラクターの同一性
顔立ち、髪型と髪色、年齢感、体型、衣装、小物、アクセサリー。これらは文章で指定するだけでは足りない。参照画像を用意し、それを全カットで使い回すのが原則だ。文章は補助輪であり、主役は画像である。
特に効くのは、正面・斜め45度・横顔の3方向と、表情違い(無表情、笑顔、驚き)を揃えること。参照セットが充実しているほど、モデルは別角度のカットでも破綻しにくくなる。
画風の固定
写真調、アニメ調、3DCG調、水彩、レトロフィルム。同じ作品内で画風が混ざると、視聴者は理由を説明できないまま違和感を覚える。画風を固定するには、参照画像のタッチを揃えることに加え、照明と粒子感を言葉で固定するのが有効だ。「柔らかい拡散光」「弱いフィルムグレイン」「浅い被写界深度」といった記述をテンプレート化して使い回す。
カメラと画面言語の統一
レンズの焦点距離、カメラの高さ、動きの速度、色温度、コントラスト。ここが揃っていないと、キャラクターが同一でも「別々の作品の寄せ集め」に見えてしまう。
実務では、作品ごとに「カメラ憲章」を1枚のメモにまとめるのがおすすめだ。例えば「基本は35mm相当、人物の感情カットのみ85mm相当」「横移動は秒速1メートル以下」「日中は5600K前後、夜は3200K前後」といった具合である。このメモがあるだけで、担当者が変わっても仕上がりが揃う。
生成前の設計:台本とアセットの整え方
生成を始める前に決めておくべきことがある。ここを飛ばすと、後工程で必ず手戻りが発生する。
コンティニュイティ台本を書く
普通の台本は台詞とト書きで書かれるが、生成AI向けにはもう一段の情報が要る。カット番号、尺、画面サイズ、被写体の動作、カメラの動き、照明、背景、前カットとの連続性。これを表形式で並べたものがコンティニュイティ台本だ。
ポイントは、1カット1アクションに絞ること。1つのカットに「歩きながら振り返って扉を開ける」ような複合動作を入れると、生成の失敗率が跳ね上がる。動作を分割し、カット数で解決するほうが結果的に速い。
キャラクターシートとロケーションボード
キャラクターシートは、参照画像と設定テキストをセットにした資料である。衣装違い、年齢違いも用意しておくと、シリーズ展開で使い回せる。
ロケーションボードは背景の資料だ。同じ部屋を別カットで使うなら、光源の位置と色を固定した参照画像を用意する。背景が毎回変わると、視聴者は「同じ場所」だと認識してくれない。
カラースクリプトで感情の起伏を設計する
映像全体の色の流れを先に決めておく。序盤は彩度を抑えた寒色、中盤で暖色が差し込む、終盤はコントラストを上げる。この設計があると、カットごとの生成結果を選ぶときの判断軸が生まれる。「きれいだから採用」ではなく「この場面にふさわしいから採用」という基準で選べるようになる。
モデル選定の判断基準
生成モデルは日々入れ替わる。特定の名前を覚えるより、選び方の基準を持つほうが長く使える。
何を優先するかで分類する
実写調の人物再現を重視するなら、肌の質感と照明の再現度を確認する。アニメ調なら、線の安定性と塗りのムラの少なさを見る。3DCG調なら、パースの破綻と影の整合性がチェックポイントになる。
動きの面では、カメラワークの再現度と被写体の動作の自然さは別物だ。カメラが滑らかに動いても人物が不自然に滑る、ということがよくある。両方を別々に評価する。
選定チェックリスト
| 観点 | 確認すること | 見極め方 |
|---|---|---|
| 参照画像の追従性 | 顔・衣装・小物が保たれるか | 同じ参照で3カット生成して比較 |
| プロンプト追従性 | 指定した動作・カメラが再現されるか | 動作指示のみ変えて差分を見る |
| 時間的安定性 | 途中で色や形が変わらないか | 長めの尺で生成し、中盤を確認 |
| 解像度と縦横比 | 配信先の仕様に合うか | 縦型・横型・正方形で試す |
| テキスト描画 | 看板やUIの文字が崩れないか | 文字入りカットを意図的に生成 |
| ライセンスと商用条件 | 利用範囲が用途に合うか | 規約を必ず原文で確認 |
単一モデルに固執しない
1つのモデルで全カットを賄おうとすると、どこかで妥協が生まれる。人物カットはA、風景はB、動きの激しいシーンはC、というように得意分野で分担するほうが最終品質は高くなる。
ただし混ぜると画風が割れるリスクがある。対策は、後工程のグレーディングでトーンを寄せることと、共通の参照画像を使うことの2点だ。
キーフレームと参照画像で同一性を固定する
一貫性の要はここにある。文章の工夫より、画像の設計のほうが効く。
参照画像は「作る」もの
参照画像は手持ちの写真を探すより、生成して整えるほうが速いことが多い。まず単体のポートレートを生成し、不要な要素を消し、背景を単色に整える。これを3方向ぶん作る。
重要なのは、参照画像の照明と、本編で使いたい照明を近づけておくことだ。参照が強い逆光で、本編が柔らかい正面光だと、顔の印象が別物になる。
マルチイメージ参照の使い方
複数の参照画像を同時に与えられるモデルでは、役割を分けて渡すと効果的だ。1枚目を顔の基準、2枚目を衣装の基準、3枚目を画風の基準、というように割り当てる。何も指定せずに放り込むと、モデルが勝手に混ぜて平均的な顔になる。
キーフレーム補間で動きを制御する
始点と終点の画像を指定できる機能は、動きの予測不能さを大幅に減らす。歩行なら「左足が前の姿勢」と「右足が前の姿勢」を用意して補間させる。爆発や波の動きなど、軌道が読みにくい現象にも有効だ。
シードとパラメータを記録する
気に入った結果が出たら、その設定を必ず記録する。シード値、参照画像の組み合わせ、プロンプト、比率、尺。この記録がないと、続きのカットで同じ雰囲気を再現できない。表計算でもメモでもいいが、カット番号とセットで残す習慣をつけたい。
プロンプト設計の実践テクニック
プロンプトは長ければ良いわけではない。順序と階層が大事だ。
5層構造で書く
1層目は被写体。誰が、何を着て、どこにいるか。2層目は動作。何をするか、どのくらいの速度で。3層目はカメラ。位置、動き、レンズ感。4層目は照明。光源の種類、方向、色温度。5層目は画風。タッチ、粒子感、色調。
この順で書くと、モデルが混乱しにくい。逆に、画風の記述を冒頭に置くと、被写体の再現度が落ちることがある。
動作量は数値と比喩で絞る
「ゆっくり歩く」「急に振り返る」といった副詞は、モデルによって解釈が大きく違う。可能なら、歩幅や秒数で示す。あるいは「静止画に近い動き」と「スポーツ中継のような速い動き」のどちらに寄せたいかを明示する。
動作が大きすぎると、顔が歪み、手が崩れる確率が上がる。迷ったら動作を小さくし、カット数でテンポを作るほうが安全だ。
ネガティブ指定は最小限に
除外指定は便利だが、盛りすぎると他の要素まで削られて画面が痩せる。「余分な指」「テキスト」「ロゴ」程度に留め、あとは参照画像とキーフレームで制御する。
言語の使い分け
英語のプロンプトが効きやすいモデルもあれば、日本語のニュアンスをそのまま理解するモデルもある。判断基準は「自分の語彙で意図を正確に書けるか」だ。翻訳で意味がずれるくらいなら、ネイティブの言葉で書いたほうが結果は良い。
実務では、日本語で書いた指示をそのまま使い、うまくいかない要素だけ英語の語彙に置き換える、というハイブリッドが扱いやすい。
ショットをつなぐ編集ワークフロー
生成した素材は、そのまま並べても映像にならない。編集で呼吸を作る。
テイク管理と命名規則
生成物は放っておくと瞬く間に膨らむ。作品名_カット番号_テイク番号_メモ のように命名を統一し、採用・保留・没をフォルダで分ける。地味だが、ここを怠ると終盤で必ず時間を失う。
カットの長さとリズム
生成した素材は、思ったより短く切ったほうが生きる。1カット2〜3秒を基本に置き、感情の山場だけ長くする。逆に、長回し風のカットは生成の破綻が目立ちやすいので、短く割ってつなぐほうが安全だ。
つなぎ目では、前カットの終わりの動きと次カットの始まりの動きを合わせる。動きの方向が揃っているだけで、視聴者の目は自然に流れる。
つなぎの処理
ハードカットを基本にし、場面転換だけディゾルブやワイプを使う。つなぎ効果を多用すると、生成の粗が隠れるどころか、逆に目立つことが多い。
グレーディングでトーンを揃える
複数のモデルや複数の日付で生成した素材は、色温度とコントラストがばらつく。編集ソフトのカラー調整で、全カットに共通のトーンを載せる。シャドウの色を統一し、ハイライトを軽く転ばせるだけで、見違えるほど一本の作品らしくなる。
音声・字幕・サムネイルまで含めた仕上げ
映像の印象は、実は音で大きく決まる。
ナレーションとリップシンク
台詞があるカットは、音声を先に作り、それに合わせて口の動きを生成すると破綻が少ない。逆順にすると、口の形と音がずれて強い違和感が出る。
ナレーション主体の構成なら、リップシンクを避けるカット割り(後ろ姿、手元、風景)を混ぜると安定する。
BGMと効果音
BGMは冒頭から最大音量で始めず、最初の10秒は控えめにして、主題が見えたところで上げる。効果音は足音、衣擦れ、扉、環境音の4種を最低限入れると、生成映像の「のっぺり感」が消える。
字幕
縦型動画では字幕が必須に近い。読みやすさを優先し、1行あたり全角12〜15文字を目安にする。話速に合わせて表示時間を調整し、句読点で改行する。
サムネイル
サムネイルは動画本体の1カットを使うより、専用に生成したほうが効果が高い。顔を大きくし、文字は3〜5語に絞り、背景とのコントラストを強くする。
よくある失敗とトラブルシューティング
失敗はパターン化している。原因を知っていれば大半は回避できる。
顔がカットごとに変わる
最大の原因は参照画像の不足と照明条件の変化だ。3方向の参照を用意し、照明の記述をテンプレート化する。それでも揺れる場合は、カットを寄りから引きに変え、顔の占有率を下げる。
手や指が崩れる
手は現状でもっとも失敗しやすい部位だ。対策は3つ。手を画面外に出す、手袋やポケットで隠す、手元だけ別カットとして切り出す。どうしても必要なら、手のアップを1カットで生成し、そこだけ差し込む。
文字が崩れる
看板やスマートフォン画面の文字は、生成に任せると高確率で崩れる。文字は後から合成するのが原則だ。背景だけを生成し、編集ソフトで文字を載せる。
動きが速すぎる/遅すぎる
尺に対する動作量の見積もりがずれている。生成時に動作を小さく指定し、編集で速度を調整する。速度変更は音声のピッチに影響するため、音声を先に決めておく。
色がカットごとに浮く
モデルや生成タイミングの違いが原因だ。カラースクリプトを先に決め、編集で全カットに同じトーンを適用する。白平衡を合わせるだけでも大きく改善する。
ループしているように見える
短い尺で同じ動きを繰り返すと発生する。カットを分け、動きの方向を変える。あるいは背景に緩やかな変化(雲、光、通行人)を加えると回避できる。
チーム運用とレビューの回し方
個人制作なら不要だが、複数人で回す場合は工程の設計が品質を左右する。
役割分担
設計担当(台本・参照画像)、生成担当(モデル選定・プロンプト)、編集担当(つなぎ・色・音)の3役に分けると、責任範囲が明確になる。小規模なら兼務で構わないが、最終判断者を一人に決めることは譲れない。
レビューの単位
完成品だけを見せると、修正指示が抽象的になりがちだ。カット単位のラフ段階で一度確認し、色と音を載せた段階でもう一度確認する。2回の関門を設けると、終盤の大規模な手戻りが減る。
記録と再利用
採用したプロンプト、参照画像、設定値は資産として残す。次の案件で同じキャラクターや同じ画風が必要になったとき、ゼロから作り直す必要がなくなる。
権利と確認事項
参照画像に実在の人物や第三者の著作物を使わないこと。生成物の商用利用条件はモデルごとに異なるため、案件着手前に必ず原文の規約を確認する。音楽やフォントも同様に、利用範囲を事前に整理しておく。
よくある質問
一貫性を保つには、最終的に何が一番効きますか
参照画像の質と数である。文章の工夫は二次的な要素だ。3方向の顔、衣装違い、表情違いを揃えるだけで、失敗率は体感で大きく下がる。
何カットくらいからワークフローを整えるべきですか
10カットを超えたあたりが目安だ。それ以下なら場当たりでも回るが、超えると参照の管理と命名規則がないと破綻する。
生成に何回も挑戦するのは無駄ですか
無駄ではない。1回で決めようとするほうが結果的に遅い。採用率はおおむね数分の1程度と考え、選別の時間を工程に組み込んでおく。
実写風とアニメ風、どちらから始めるべきですか
目的次第だが、初心者はアニメ調のほうが破綻が目立ちにくい。実写調は肌や髪の微妙な不自然さが目立つため、参照画像の質に敏感になる。
音声はどのタイミングで作りますか
台詞やナレーションがあるなら、映像より先に作る。尺が確定するため、カット割りがぶれにくくなる。
どのくらいの尺を目標にすればいいですか
まず15秒を1本作りきることを勧める。15秒で一貫性を保てれば、60秒、3分と伸ばせる。逆に、最初から長尺を狙うと、どこで崩れたのか特定できなくなる。
生成結果が毎回変わってしまうのは仕様ですか
多くのモデルは確率的に生成するため、同じ入力でも結果は完全には一致しない。だからこそ、設定の記録と参照画像の固定が重要になる。
編集でどこまで補正すべきですか
色と音は積極的に補正してよい。一方、形の破綻を編集で直すのは現実的でない。破綻したカットは潔く作り直すほうが速い。
まとめ:設計が品質を決める
AI動画生成の品質は、生成ボタンを押す前の工程でほとんど決まる。誰が登場し、どんな画風で、どんな光で、どの順番で見せるのか。これを資料として固めておけば、生成は作業になり、判断は設計に集中できる。
逆に、設計を飛ばして生成から始めると、結果は毎回ばらつき、修正は場当たりになり、なぜ良くなったのかもわからなくなる。
最初に取り組むべきは、15秒の短い作品を、参照画像とコンティニュイティ台本つきで最後まで作りきることだ。音と字幕まで載せて一度完成させると、自分のワークフローの中でどこが弱点かが見えてくる。そこを直すだけで、次の作品の品質は一段上がる。ツールは入れ替わっても、この設計の考え方は当分通用する。



