世界観が崩れる本当の理由を先に理解する
AIで動画を作り始めた人が最初にぶつかる壁は、モデルの性能ではありません。「ショット間のズレ」です。1本目のカットは完璧に見える。しかし2本目、3本目と作るうちに主人公の髪型が変わり、衣装の色が変わり、背景の時代感がずれていく。この現象はしばしばキャラクター・ドリフトと呼ばれ、単発の生成品質がどれだけ高くても作品全体の説得力を失わせます。
原因は大きく三つに分けられます。
- 参照の効き方が一定でない。動画生成モデルは入力画像を「参考」として扱う強度がモデルごとに異なり、同じ画像を渡してもショットによって似たり離れたりします。
- 言葉のわずかな差が画を動かす。テキスト指示の一言が照明の向き、レンズの圧縮感、色温度を大きく変えてしまいます。
- 工程が分断されると誤差が累積する。生成を何度も回すたびに、乱数シード、リサイズ、圧縮の違いが少しずつ積み重なります。
つまり世界観の統一とは、優れたモデルを一つ選ぶ問題ではなく、参照情報・記述情報・工程の三つを固定する問題です。参照画像を増やして固める。言葉の語彙を辞書化して固定する。工程をテンプレート化して再現可能にする。この三層を整えたとき、初めてシリーズ全体の画がそろいます。
以下の章では、画像から動画を生成する基本工程を押さえたうえで、マルチイメージフュージョンの考え方、アートディレクションの自動化、ショット設計、ツール選定の判断基準、そして失敗時の切り分けまでを順に整理します。
画像から動画生成の基本工程を分解する
画像から動画を生成する処理は、内部的には「入力画像の特徴抽出」「時間方向の遷移予測」「フレームの復元」という流れで進みます。制作者の側から見ると、この流れは次の五つの作業に言い換えられます。
- 参照画像を選ぶ
- 参照画像を前処理する
- 動きとカメラを言葉で指定する
- 尺とフレームレートを決める
- 生成結果を評価して差分だけを修正する
このうち最も軽視されがちで、最も結果を左右するのが最初の二つです。
参照画像の選定:きれいな一枚より情報量のある一枚
参照画像は「最も美しい写真」を選べばよいわけではありません。動画生成にとって重要なのは、輪郭の明瞭さ、被写体の占有率、背景の分離しやすさです。逆光で顔が潰れている写真、被写体が画面の端に寄っている写真、細かい模様が密集した服を着ている写真は、いずれも再現が不安定になります。
選定の実務的な基準は次のとおりです。
- 顔または主要被写体が画面の高さの40〜60パーセントを占めている
- 目、鼻、口の輪郭が判別できる解像度がある
- 主光源の方向が読み取れる
- 背景が極端に複雑でない、または意図的に単純化できる
- 衣装の模様が細かすぎない
複数ショットを作る予定なら、最初に「設定資料集」を作る感覚で参照画像を整理します。正面、斜め45度、横顔、全身、バストアップ。この5種類があれば、ほとんどのショットに対応できます。
前処理:地味だが効果が大きい工程
前処理を省くと、後工程のすべてが不安定になります。最低限やっておきたいのは以下です。
- 長辺を1024〜2048ピクセルに統一する
- 被写体を中央に寄せ、余白の量をそろえる
- 極端な色かぶりを補正する
- 背景をぼかす、または単色に置き換えて被写体を分離する
- 同じキャラクターの画像群で肌の明度とホワイトバランスをそろえる
特に最後の項目が重要です。同じ人物でも、晴天の屋外で撮った写真と室内の蛍光灯下の写真では色温度が大きく違います。これをそろえずに参照させると、生成結果の肌色がショットごとに揺れます。「参照画像の色をそろえる」だけで一貫性の体感はかなり改善します。
プロンプト設計:動き・カメラ・時間を分けて書く
プロンプトは一つの文章にまとめず、役割ごとに分けて書くほうが再現性が上がります。
| 項目 | 書く内容 | 例 |
|---|---|---|
| 被写体の動作 | 主語と動詞を明確に | 女性がゆっくり振り返る |
| カメラ | 動きとスピード | ゆっくりとしたドリーイン |
| 時間設計 | 尺と変化のタイミング | 3秒で振り返りを完了 |
| 環境 | 光と天候 | 夕方の逆光、弱い風 |
| 質感 | フィルム感、粒子 | 微細な粒子、浅い被写界深度 |
避けたいのは、同じ意味の言葉を重ねることです。「美しい、幻想的、ドラマチック、映画的」と並べても、モデルにとってはすべて曖昧な形容詞です。それよりも「夕方の低い太陽光が左から当たる」のように、物理的に解釈できる記述のほうが効きます。
尺とフレームレートの設計
生成できる尺には上限があります。長い尺を一度に作ろうとすると、後半で動きが破綻しやすくなります。実務では次のように使い分けると安定します。
- 2〜4秒:表情の変化、視線の動き、髪の揺れ
- 5〜8秒:歩行、振り返り、簡単な手の動作
- 8秒以上:カメラ移動を伴うショット、または複数ショットに分割
フレームレートは最終的な書き出しと揃えるのが基本です。24フレームで撮る予定の作品を30フレームで生成し、後から変換すると、動きの質感が微妙に変わります。
マルチイメージフュージョンの仕組みと実践
マルチイメージフュージョンとは、複数の参照画像を一つの生成に同時に効かせる考え方です。単一の参照画像では「顔は似ているが服が違う」「服は合っているが背景が違う」という状態になりがちです。複数の参照を役割分担させると、この問題を分解して解決できます。
役割分担という発想
参照画像は、次のように役割を決めて渡します。
- アイデンティティ参照:顔立ち、髪型、体格
- 衣装参照:服、小物、素材感
- スタイル参照:色調、フィルム感、ライティングの傾向
- 環境参照:背景、建物、地形、時代感
すべての参照を一つの生成に同時に投入するのではなく、ショットの目的に応じて重みを変えます。バストアップの会話シーンならアイデンティティ参照を強く、スタイル参照を中程度に。ロングショットなら環境参照を強く、アイデンティティ参照は弱めに。この配分設計が、シリーズ全体の統一感を決めます。
キャラクター一貫性を支える三層モデル
一貫性は一つの技術で担保されるものではありません。次の三層で考えると整理しやすくなります。
- 形状の一貫性:顔、髪、体型。参照画像と、必要なら顔領域だけを切り出した補助参照で固定します。
- 色彩の一貫性:肌、衣装、背景の色。カラーパレットを数値で決めておき、生成後に自動補正をかけます。
- 質感の一貫性:粒子、シャープネス、被写界深度、レンズ歪み。スタイル参照画像と、書き出し時の共通プリセットで固定します。
この三層のうち、多くの人が最初に崩すのが三番目です。顔は合っているのに、あるショットだけ妙にシャープでビデオカメラ的になる。これはモデルを変えたわけでもプロンプトを変えたわけでもなく、出力設定の違いだけで起こります。書き出しプリセットを最初に決めて、全ショットで同じ処理を通すことが重要です。
スタイルと環境を固定する手順
具体的な手順は次のようになります。
- 作品の基準となる「マスターフレーム」を1枚選ぶ。これは最も理想に近い一枚で、実写でも生成画像でも構いません。
- マスターフレームから色調を抽出し、主要5色のパレットを作る。
- パレットを数値として記録し、生成後のグレーディングで全ショットに適用する。
- スタイル参照として、質感の近い画像を2〜3枚用意する。
- 各ショットの生成時に、アイデンティティ参照とスタイル参照を分けて投入する。
- 書き出し前に、全ショットを並べて色と粒子の差を目視確認する。
この手順を踏むと、後から「なぜか合わない」と感じたときに、どこを直せばよいかが特定できます。
複雑なシーンへの拡張
人物が複数登場するシーン、乗り物が動くシーン、群衆がいるシーンでは、参照の数が増えて管理が難しくなります。この場合は次の順序で組み立てます。
- まず背景だけを生成して固定する
- 次に主要人物を単独で生成し、動きを確認する
- 最後に合成する
一度にすべてを生成しようとすると、どこが崩れたのかを切り分けられなくなります。工程を分けることは遠回りのようで、結果的に最短になります。
アートディレクションを仕組み化する
一貫性は才能ではなく、記録と再利用で作られます。個人制作でも、次のような「作品バイブル」を一枚の文書にまとめておくと、作業が驚くほど安定します。
作品バイブルに書くべき項目
- 世界観の要約(3行以内)
- 時代、場所、天候の前提
- 主要キャラクターの外見的特徴(髪、目、体格、傷やアクセサリー)
- 衣装の色と素材
- 光源の基本設定(時刻、方向、強さ)
- レンズ感と被写界深度の方針
- カラーパレットの数値
- 禁止事項(使わない色、避ける構図)
「禁止事項」を書くのが意外に効きます。AIは指示がないと平均的な画を出そうとします。蛍光色を避ける、強い青みを避ける、といった制約を明文化しておくと、外れ値が減ります。
ショットリストと参照の対応表
ショット番号、内容、使用する参照画像、想定尺、カメラワークを表にします。
| ショット | 内容 | 主参照 | 副参照 | 尺 |
|---|---|---|---|---|
| 1 | 主人公が窓辺で振り返る | 顔・正面 | スタイルA | 3秒 |
| 2 | 廊下を歩く後ろ姿 | 全身・背面 | 環境A | 4秒 |
| 3 | 卓上で手紙を読む | バストアップ | スタイルA | 5秒 |
| 4 | 窓の外の街並み | 環境A | スタイルA | 4秒 |
この表があると、生成順を入れ替えても同じ結果を再現できます。
命名規則を決める
ファイル名は後回しにされがちですが、制作量が増えるほど効いてきます。例えば次のようにします。
char_a_face_front_v03.pngchar_a_body_full_v02.pngstyle_night_warm_v01.pngenv_corridor_a_v04.pngshot003_take02.mp4
版番号を必ず入れるのがポイントです。参照画像を差し替えたときに、どのショットが古い参照を使っているかを追跡できます。
ショット設計と編集パイプライン
生成したクリップは、そのまま並べても作品になりません。つなぎ方の設計が世界観の印象を大きく左右します。
つなぎの設計
- 同じ色調のショットを隣接させる
- 動きの方向をそろえる(左から右へ流れる動きを連続させる)
- 視線の向きで次のショットへ誘導する
- ショットの尺を3秒、4秒、5秒と緩やかに変化させ、単調さを避ける
- 場面転換では、あえて色温度を変えて区切りを作る
一貫性は「すべて同じにする」ことではありません。同一場面の中では統一し、場面が変わるときには意図的に変化させる。この緩急が、統一感と退屈さの違いを生みます。
音声と効果音の重要性
画が完全にそろっていても、音がショットごとにバラバラだと途端に素人っぽくなります。次の点を統一してください。
- 環境音のベース(風、室内の空調、街のざわめき)を全ショットで連続させる
- 同じキャラクターの声は、同じ話者・同じ距離感で録るか生成する
- 効果音の音量基準を決める
- 字幕のフォント、サイズ、位置、表示時間を固定する
環境音をショットをまたいで連続させるだけで、別々に生成したクリップが一つの空間に存在しているように感じられます。これは編集で最も費用対効果の高い作業の一つです。
書き出しの統一
編集ソフトで最終書き出しをする際、次の設定を全編で固定します。
- 解像度とアスペクト比
- フレームレート
- 色空間とガンマ
- ビットレートの下限
- シャープネスの量
生成モデルごとに微妙に異なるシャープネス傾向は、編集側で軽くぼかしてから共通のシャープをかけると均一になります。
ツール選定の判断基準
ツールは流行ではなく、自分の工程に合うかで選びます。判断の軸は次の五つです。
- 参照画像の効き方:複数参照に対応しているか、重み付けができるか
- 動きの再現性:同じ入力で同じ出力に近い結果が出るか
- 制御の粒度:カメラワークや動きの量を指定できるか
- 解像度と尺:用途に足りる出力が得られるか
- 工程への組み込みやすさ:自動化やバッチ処理ができるか
用途別の考え方
| 用途 | 重視する点 | 注意点 |
|---|---|---|
| ショート動画 | 生成速度と縦型対応 | 縦型は構図が崩れやすい |
| 商品紹介 | 質感と色の正確さ | 反射や透明素材は揺れやすい |
| 物語作品 | キャラクター一貫性 | 尺を伸ばすと破綻しやすい |
| 広告バリエーション | バッチ生成と差分管理 | 版管理を怠ると混在する |
| 試作・絵コンテ | 反復速度 | 高解像度に固執しない |
複数のモデルを使い分けること自体は悪いことではありません。ただし作品ごとに主要モデルを一つ決め、他のモデルは補助に限定するのが一貫性の秘訣です。モデルを混ぜると、それぞれの癖が混ざり、統一感が失われます。
自動化とキュー管理
ショット数が増えると、生成待ちの管理が問題になります。次のような運用を決めておくと混乱しません。
- 生成ジョブには必ずショット番号と版番号を付ける
- 失敗したジョブは理由を一行メモして再投入する
- 一度に大量に投げず、10〜20ショット単位で確認する
- 承認済みのショットは別フォルダに移動し、触らない
よくある失敗とトラブルシューティング
顔が毎回変わる
最も多い相談です。切り分けの順序は次のとおりです。
- 参照画像の解像度と明瞭さを確認する
- 参照画像の色温度をそろえる
- 顔領域を切り出した補助参照を追加する
- プロンプトから年齢や髪型の記述を削り、参照に任せる
- それでも揺れるなら、そのショットは別カットに置き換える
最後の手段としてカットを変えるのは有効です。正面の顔を長く見せるショットは最も難しいため、横顔や後ろ姿、手元のカットで物語を進めるほうが安定します。
色がショットごとに違う
生成後に全ショットへ同じカラーマッチングを適用します。基準ショットを決め、他のショットをそれに寄せるだけで大きく改善します。手動でやる場合は、肌の明度、影の色、ハイライトの色の三点を合わせます。
動きが不自然になる
動作が速すぎる、または複雑すぎることが原因です。動きを一つに絞り、尺を長めに取り、カメラを固定します。歩行と振り返りを同時に指定すると破綻しやすいので、分割してください。
背景が勝手に変わる
背景の参照が弱いか、プロンプトの環境記述が薄い状態です。環境参照を追加し、光の方向と時刻を明記します。
途中で画風が変わる
生成セッションを分けたことが原因のことが多いです。参照画像のセット、プロンプトの語彙、出力設定を一つのテンプレートにまとめ、毎回それを複製して使います。
実践シナリオ:4ショットの短編をそろえる
具体例で流れを確認します。テーマは「雨上がりの街で、少女が一通の手紙を読む」とします。
準備
- マスターフレームを1枚決める(夕方、濡れた路面、暖色の街灯)
- パレットを5色抽出する(濃い青、橙、灰色、生成り、黒)
- キャラクター参照を正面、斜め、全身、手元の4枚用意する
- 環境参照を路地、窓辺、街灯の3枚用意する
- スタイル参照を粒子感のある写真から2枚選ぶ
ショット1:路地を歩く後ろ姿(4秒)
アイデンティティ参照は全身の背面、環境参照は路地。カメラはゆっくり前進。プロンプトには「一定の歩調」「濡れた路面の反射」「弱い風」だけを書きます。
ショット2:立ち止まり、振り返る(3秒)
顔参照を強く、環境参照を弱く。動きは一つだけ。振り返りの完了タイミングを尺の後半に指定します。
ショット3:手紙を読む手元(5秒)
手元の参照を使用。顔は映さないことで、難所を避けつつ情緒を作ります。ここで環境音を雨の残響に統一します。
ショット4:街灯と路面のカット(4秒)
人物なし。環境参照とスタイル参照のみ。締めのカットとして色温度をわずかに下げ、余韻を作ります。
仕上げ
全ショットに同じカラーマッチングを適用し、粒子を均一化し、環境音を連続させ、字幕の位置を固定します。この作業だけで、別々に生成した4本が一つの世界に見えます。
よくある質問
参照画像は何枚まで増やせばよいですか
増やせばよいわけではありません。役割が重複した参照は、かえって結果を濁します。アイデンティティ、衣装、スタイル、環境の四役に対して、それぞれ1〜3枚が目安です。合計10枚を超えると管理が難しくなります。
実写とイラストを混ぜても統一できますか
可能ですが難度は上がります。混在させる場合は、質感の統一を編集側で行う前提で、生成時は同じスタイル参照を全ショットに適用してください。
一つのショットだけ他と雰囲気が違うときは
まず出力設定の違いを疑います。次に参照画像の色温度、最後にプロンプトの語彙を確認します。モデルを変えるのは最後の手段です。
生成に失敗したショットはどう扱いますか
三回試して改善しないなら、構図を変えます。正面の長回し、複雑な手の動き、多数の人物は難度が高いため、代替カットを用意しておくのが実務的です。
作業時間の目安は
4ショット程度の短編なら、準備に半日、生成に半日、編集に半日が目安です。準備を省くと生成と編集で倍以上かかります。
チームで作業する場合の注意点は
作品バイブルと命名規則を共有することが最優先です。担当者が変わっても同じ参照と同じ設定を使える状態を作れば、一貫性は維持できます。
まとめ:一貫性を保つためのチェックリスト
最後に、制作の各段階で確認すべき項目をまとめます。
準備段階
- マスターフレームを決めた
- 5色のパレットを数値で記録した
- キャラクター参照を4方向そろえた
- 環境参照とスタイル参照を用意した
- 参照画像の色温度と解像度をそろえた
- 作品バイブルと禁止事項を書いた
生成段階
- 動きは一ショットにつき一つに絞った
- カメラワークを明示した
- 参照の役割と重みをショットごとに決めた
- ショット番号と版番号を記録した
- 10〜20ショットごとに確認した
仕上げ段階
- 全ショットに同じカラーマッチングを適用した
- 粒子とシャープネスを均一化した
- 環境音を連続させた
- 字幕の書式を固定した
- 書き出し設定を全編でそろえた
一貫性のある世界観は、特別な才能から生まれるものではありません。参照を整理し、言葉を辞書化し、工程を固定する。この地味な積み重ねが、シリーズ全体を一つの作品に見せます。まずは4ショットの短編から始めて、上のチェックリストを一度通してみてください。二本目を作るときの迷いが、確実に減っているはずです。


