なぜキャラクターの一貫性がAI動画制作の最大の壁になるのか
AI動画生成は、1カットだけを見れば驚くほど高品質な映像を返すようになった。しかし複数カットをつないで一つの物語や一つの広告に仕上げようとすると、途端に問題が現れる。同じ人物のはずなのに、カットが変わるたびに顔の輪郭、目の間隔、髪の分け目、衣装のディテールがわずかにずれていく。視聴者はこのずれを無意識に感知し、「さっきと別人では」という違和感を抱く。没入感はそこで途切れ、作品全体の説得力が落ちる。
原因は仕組みにある。多くの動画生成モデルは、テキストプロンプトとノイズから各フレームを予測する。キャラクターの同一性を明示的に保持する仕組みを持たない場合、プロンプトの語順が変わっただけでも潜在空間上の位置が動き、結果として顔立ちが変わる。シードを固定しても、カメラアングルやポーズが変われば同じことが起きる。つまり「テキストで人物を説明する」という方法自体に限界がある。
よく使われる回避策には、それぞれ弱点がある。プロンプトを完全にコピーする方法は、構図や動きの指定を変えられない。最初のフレームを画像として渡す方法は、その1枚に写っていない角度や表情になった瞬間に破綻する。シード固定は短いカットでは効いても、長い尺や複数モデルの併用では効かない。
そこで有効になるのが、複数の参照画像からキャラクターの不変要素を抽出し、それを生成の制約として使い続けるアプローチだ。正面、斜め、横顔、表情違い、全身と半身。複数の視点を与えることで、「この人物の何が変わってはいけないのか」をモデルに伝えやすくなる。本記事では、この考え方を軸に、画像から動画へ変換する実践的なワークフローを組み立てていく。
重要なのは、一貫性は「魔法のボタン」ではなく「設計」だという前提だ。参照画像の設計、ショット設計、プロンプト設計、編集での検証という4つの工程が噛み合って初めて、視聴者に違和感を与えない映像になる。逆に言えば、どの工程が欠けても破綻する。
参照画像の設計:キャラクター固定の出発点
参照画像の質は、出力の一貫性をほぼ決める。ここを雑にすると、後工程でどれだけ調整しても取り返しがつかない。まずは「何を渡すか」を設計する。
必要な参照画像の種類と枚数
最低限そろえたいのは次の5種類だ。
- 正面のバストアップ(表情はニュートラル)
- 斜め45度のバストアップ
- 横顔
- 全身の立ち姿(服装と体型がわかるもの)
- 表情違い(笑顔、真顔、驚きなど2〜3枚)
枚数は多いほど良いわけではない。互いに矛盾する情報が混ざると、平均化された「似ているが別人」が生成されやすい。5〜10枚程度に絞り、同じ光源・同じ髪型・同じ衣装で統一するのが現実的だ。衣装を途中で変える作品なら、衣装ごとに参照画像のセットを分けて管理する。
参照画像の品質チェックリスト
渡す前に、次の項目を確認したい。
- 顔が画面の一定以上の面積を占めているか(遠景の集合写真は不向き)
- 解像度が十分か(引き伸ばした粗い画像は特徴が潰れる)
- 背景が単純か、少なくとも人物と分離しやすいか
- 光源の向きと色温度がセット内で揃っているか
- 強いフィルターや美肌加工がかかっていないか
- 手や指が大きく写り込んでいないか(崩れの原因になる)
- ロゴや文字が衣服に大きく入っていないか
特に光源の統一は見落とされやすい。正面は昼光、横顔は暖色の室内灯というセットを渡すと、生成側が「肌の色そのものが変わる人物」と解釈し、シーンごとに色味が暴れる原因になる。
避けるべき参照画像
次のような画像は、一貫性を下げる方向に働く。サングラスやマスクで目元が隠れている画像、帽子で髪型が判別できない画像、極端な逆光で輪郭が潰れている画像、複数人が同じ構図に写っている画像、そして実在の著名人に似すぎた画像だ。とくに最後の項目は、権利面でも運用面でもトラブルになりやすい。商用利用を想定するなら、自分で撮影した人物か、明確に利用許諾を得た素材を使う。
全体ワークフロー:絵コンテから最終書き出しまで
一貫性を守る作業は、いきなり生成を始めるのではなく、前工程でほとんどが決まる。ここでは4つのステップに分けて整理する。
ステップ1 キャラクター設定シートを作る
文章でキャラクターを定義する。年齢感、体型、髪型と髪色、目の色、肌のトーン、基本の衣装、アクセサリー、そして「絶対に変えない要素」と「シーンごとに変えてよい要素」を明記する。この2つを分けておくことが、後のプロンプト設計を格段に楽にする。
設定シートには、参照画像のファイル名も対応表として書いておく。正面はA、横顔はB、笑顔はC。チーム制作なら、この表が共通言語になる。
ステップ2 ショットリストとキーフレームを設計する
カット割りを先に決める。1カットの長さは3〜5秒を基本にし、キャラクターの顔が大きく映るカットと、引きのカットを交互に配置すると、崩れが目立ちにくい。逆に、顔のアップを連続させると、わずかな差が強調されてしまう。
各カットについて、開始フレームのキーフレーム画像を用意する。ここで参照画像から派生させた静止画を作り、それを動画化する流れにすると、カット間の連続性が保ちやすい。
ステップ3 画像から動画へ変換する
キーフレーム画像とプロンプトを渡し、動きを指定する。カメラワーク(固定、ゆっくり寄る、横に流れる)、被写体の動き(歩く、振り返る、話す)、環境の動き(髪がなびく、光が揺れる)を分けて書く。一つのカットに動きを詰め込みすぎると、モデルが情報を処理しきれず顔が崩れる。
ステップ4 編集と連続性チェック
生成したカットを並べ、前後のカットを交互に見比べる。顔、髪、衣装、小物、背景の色味の5点をチェックする。ずれが小さい場合は編集ソフトでの色調整やトリミングで吸収できる。ずれが大きい場合は、そのカットだけ再生成する。全部を作り直す必要はない。
プロンプト設計でキャラクター記述を固定する
参照画像を渡しても、プロンプトが毎回バラバラでは効果が半減する。文章の設計そのものをテンプレート化しよう。
不変要素と可変要素を分ける
プロンプトを3ブロックに分けて書く。1ブロック目はキャラクターの不変要素(年齢感、髪型、髪色、目の色、骨格の特徴)。2ブロック目は衣装と小物。3ブロック目はシーン固有の要素(場所、時間帯、天候、カメラワーク、動き)だ。
1ブロック目と2ブロック目は全カットで一字一句同じにする。3ブロック目だけを書き換える。この運用だけで、体感できるほどばらつきが減る。
ネガティブ指定の使い方
避けたい要素を明示する。たとえば「顔の左右非対称」「指の本数の誤り」「髪の長さの変化」「衣装の色の変化」「顔の上に乗るテキストやロゴ」。ただしネガティブ指定を増やしすぎると、構図が硬直したり、動きが止まったりする。5〜8項目程度に抑えるのが扱いやすい。
シーン差分だけを書き換える
実務では、カットごとに変える部分をテンプレートの空欄に埋める形にする。たとえば「[場所]で[時間帯]、[カメラワーク]、[被写体の動作]」という枠を作り、場所と動作だけを差し替える。コピー&ペーストの作業になるので、ヒューマンエラーも減る。
モデルとツールの選定基準
一口に動画生成モデルと言っても、参照画像の扱い方や得意な尺は大きく違う。目的に合わせて使い分けたい。
画像参照に対応しているかを見る
選定の第一基準は、複数の参照画像を同時に扱えるかどうかだ。1枚の画像しか受け付けないモデルは、角度が変わった瞬間に別人化しやすい。複数参照に対応していれば、正面と横顔の情報を同時に与えられる。対応状況は更新が早い領域なので、導入前に必ず公式の仕様を確認する。
ショット割りと長回しの使い分け
短いカットを多数生成してつなぐ方式は、一貫性の管理がしやすい。一方、長回しは俳優の演技のような連続性が魅力だが、途中で崩れるリスクが高い。迷ったら短いカットで組み立て、どうしても必要な1カットだけ長回しに挑戦するのが安全だ。
クラウドとローカルの判断
クラウド型のサービスは、モデルの更新が早く、高性能な生成を手軽に試せる。ローカル環境は、大量の試行を低コストで回せる反面、初期構築とGPUの管理が必要になる。商用案件で納期が決まっているならクラウド、個人制作で反復回数を稼ぎたいならローカル、という住み分けが現実的だ。
スタイルと環境の一貫性を同時に保つ
キャラクターが同じでも、色味や質感がカットごとに変われば別作品に見える。キャラクターと環境はセットで管理する。
まず、作品全体のルックを文章で定義する。色温度、コントラスト、被写界深度、フィルムグレインの有無、レンズの焦点距離感。これを全カットのプロンプトに共通ブロックとして入れる。
次に、環境の連続性を保つ。同じ部屋のカットが複数あるなら、背景のキーフレーム画像を1枚作り、それを複数カットで使い回す。家具の配置や窓の位置が固定され、視聴者の空間認識が壊れない。
さらに、時間帯の変化を扱う場合でも、変化の方向を一貫させる。朝から昼、昼から夕方へと段階的に動かすのか、カットごとに自由にするのかを先に決めておく。場当たり的に変えると、シーンの前後関係が読み取れなくなる。
よくある失敗と対処法
顔が変わる、髪型が変わる
最も多い症状だ。原因は大きく3つある。参照画像が少なすぎる、プロンプトの人物記述がカットごとに違う、動きの指定が強すぎる。対処は、参照画像を斜めと横顔まで増やす、人物記述ブロックを完全固定する、動きの強度を下げる、の順に試す。
衣装や小物が消える
小物は情報量が少ないため、動きが加わると省略されやすい。対処として、小物をプロンプトの前方に書き、参照画像でも小物がはっきり写っているカットを1枚用意する。それでも消える場合は、小物が映るカットを短くし、カットの切り替わりで見せる編集に逃げるのも有効だ。
動きの途中で崩れる
歩行や振り返りなど、体の向きが大きく変わる動きで発生しやすい。対処は、動きを分割すること。1カットで180度振り返らせるのではなく、90度まで回すカットと、残りを別カットに分ける。あるいは振り返りの瞬間を別カットとして切り出し、編集でつなぐ。
色味とライティングがずれる
シーンごとに光源設定が変わると、肌の色が別人物のように見える。対処は、共通のルック指定をプロンプトに入れることに加え、編集段階でカット間のホワイトバランスを揃えること。生成側だけで完結させようとすると労力が大きい。
用途別の実践ワークフロー
SNS縦型ショート
15〜30秒、カット数は5〜8程度。顔のアップを多用するため、一貫性の要求が最も厳しい。参照画像は正面・斜め・笑顔の3枚を軸に、衣装違いを1セット用意する。動きは小さく、テロップと効果音でテンポを作る。生成で無理をするより、編集で見せる設計にするのがコツだ。
商品紹介・インフルエンサー風
10〜20秒、カット数は4〜6程度。人物が商品を持つ、手に取る、紹介するという動作が入るため、手元の崩れが起きやすい。対処として、手と商品がはっきり写った参照画像を1枚追加し、手の動きは小さく指定する。商品自体の形状は別途静止画で見せるカットを混ぜると、破綻が目立たない。
短編ストーリー
1〜3分、カット数は20以上。もはや編集プロジェクトとして管理する必要がある。カット番号、使用した参照画像セット、プロンプトのテンプレートIDを表で管理し、どのカットがどの設定で作られたかを追跡できるようにする。途中でキャラクターの設定を変えたくなったら、変更点をメモし、変更以降のカットだけを新しい設定で作り直す。
チェックリストと運用のコツ
制作前に確認する項目をまとめておく。
- 参照画像は5〜10枚、光源と衣装が統一されているか
- キャラクター設定シートに不変要素と可変要素が分けて書かれているか
- プロンプトの人物記述ブロックが全カットで同一か
- 1カットの長さが3〜5秒に収まっているか
- 顔のアップが連続していないか
- 作品全体のルック指定が共通ブロックとして入っているか
- 生成後に前後カットを並べて比較する工程が組まれているか
運用面では、うまくいったプロンプトと参照画像の組み合わせを必ず保存する。同じキャラクターで第2弾を作るとき、そのまま流用できるからだ。また、生成は一発で決めようとせず、同じプロンプトで3〜4案出して比較する前提で時間を見積もる。1案あたりの確認は10秒で済む。
さらに、修正は「小さい順」に試す。色調整、トリミング、カット長の変更、部分的な再生成、そして最後に設定の見直し。いきなり設定を変えると、それまで揃っていた他のカットとの整合性が崩れる。
FAQ
参照画像は何枚あれば十分ですか?
用途によって変わるが、顔のアップが多い作品なら5〜8枚、引きのカットが多い作品なら全身を含む3〜5枚でも実用になる。重要なのは枚数より一貫性で、光源・髪型・衣装が揃った5枚のほうが、ばらばらな15枚より良い結果を生む。
実写風とアニメ調で注意点は違いますか?
実写風は肌のトーンや毛穴、影の落ち方がカットごとに変わると別人感が出やすい。アニメ調は線の太さや目の形が変わると別キャラクターに見える。アニメ調のほうが「特徴を記号化しやすい」反面、少しの線の揺れが目立つ。参照画像をより丁寧に揃える必要があるのは、実はアニメ調のほうだ。
スマートフォンで撮った写真でも使えますか?
使える。ただし解像度、レンズの歪み、背景の写り込みに注意する。明るい場所で、背景が単純な場所で、少し離れて撮影するのが基本だ。自撮りよりも、誰かに撮ってもらったほうが歪みが少なく、参照画像として優秀になる。
生成した動画を別のモデルでさらに加工しても大丈夫ですか?
可能だが、加工のたびに情報が劣化する。色調整やトリミング程度なら問題ないが、別モデルで再度生成し直すと顔立ちが動く。どうしても必要な場合は、元のキーフレーム画像を再度入力する形で加工し、動画そのものを生成し直さないのが安全だ。
一貫性がどうしても取れないときの最終手段は?
カット割りを変えることだ。顔のアップを減らし、後ろ姿、手元、風景、シルエットを挟む。視聴者は見えていない部分を補完するため、直接顔を見せる時間を減らすだけで、一貫性の要求は大きく下がる。生成技術で解決できない問題は、演出で解決するのが実務的だ。
一貫性の維持は、結局のところ「変えない情報を先に決め、変える情報だけを後から足す」という設計作業に集約される。参照画像を丁寧に揃え、プロンプトのテンプレートを固定し、カット単位で検証する。この順番を守れば、画像から動画への変換は、偶発的な当たり待ちの作業ではなく、再現性のある制作工程になる。



