AI動画でキャラクターがブレる本当の理由
生成AIで動画を作り始めた人が最初にぶつかる壁は、たいてい「同じ人物が毎回別人になる」という問題です。1カット目は満足のいく仕上がりでも、2カット目では輪郭が変わり、3カット目では髪の色や服のディテールが変わる。プロンプトに特徴を細かく書き込み、シード値を固定し、ネガティブ指定を調整しても、根本的な解決にはなりません。この現象は一般にキャラクタードリフトと呼ばれ、長尺映像やシリーズ制作における最大の障害です。
原因は単純で、テキストは人物の「意味」しか伝えられないからです。目が大きい、髪が黒い、二十代前半といった単語は、無数の顔の中から平均的な像を作り出します。一方で、視聴者が「同じ人物だ」と認識する判断材料は、目と鼻の距離、顎の角度、耳の形、肌の陰影、左右のわずかな非対称といった、言葉にしにくい微細な情報です。テキストだけではこの微細情報を安定して指定できないため、カットごとにモデルが別の平均像を選んでしまいます。
さらに、シーン条件がドリフトを加速します。逆光のカット、雨のカット、走っているカットでは、照明やポーズの変化に合わせてモデル内部の人物表現が引きずられます。結果として、顔立ちだけでなく年齢や体格まで揺れ、視聴者は無意識に「別の作品の寄せ集め」だと感じ取ります。シリーズ化や広告の継続運用を考えるなら、この揺れは致命的です。
解決の方向性は明確です。人物の同一性を、テキストではなく画像の集合として与える。これがマルチ画像フュージョンの基本的な発想です。
マルチ画像フュージョンの仕組み
マルチ画像フュージョンは、複数の参照画像から人物の同一性を表す特徴を取り出し、それらを一つの安定した表現に統合したうえで、各カットの生成時に繰り返し注入する技術です。単一の参照画像を使う方式との最大の違いは、情報の冗長性にあります。1枚だけでは、その写真に写り込んだ照明、角度、表情、レンズ歪みまでが人物の特徴として扱われてしまいます。複数枚を突き合わせることで、どの画像にも共通して現れる要素だけが人物の本質として残り、写真固有のノイズが相対的に弱まります。
特徴ベクトルと潜在空間
モデルは参照画像を、潜在空間と呼ばれる高次元の座標に変換します。この座標上では、似た顔は近くに、違う顔は遠くに配置されます。複数枚の参照画像は、この空間内の複数の点として扱われ、平均や重み付き合成によって一つの中心点、いわゆる人物のアイデンティティ表現にまとめられます。中心点が安定していれば、ポーズや背景が変わっても同じ人物として描画されます。逆に参照画像が1枚だけ、あるいは互いに矛盾していると、中心点が定まらず、カットごとに別の場所へ飛んでしまいます。
ここで重要なのは、参照画像の「数」より「一貫性」です。同じ人物を別の日に撮った写真でも、照明とレンズが揃っていれば中心点はぶれません。逆に、別人混じりの参照セットを作ると、中心点は誰でもない中間的な顔になり、どのカットでも微妙に似ていない人物が生まれます。
重み付けと注目機構
すべての参照画像を均等に扱うのが最適とは限りません。正面の鮮明な写真と、遠景でピンボケした写真では、役に立つ情報量が違います。そこで使われるのが注目機構です。各参照画像のどの領域が、いま生成しようとしているフレームのどの領域に対応するかを計算し、必要な部分を強く参照します。髪型の再現では髪の情報が多い画像が、衣装の再現では全身が写った画像が優先的に効く、という具合です。この仕組みにより、参照画像の枚数が増えても破綻しにくくなります。
実務では、この性質を利用して参照画像を「役割分担」させます。顔の基準はブレの少ない正面写真、衣装の基準は全身写真、小物の基準は接写、といった具合に役割を決めておくと、生成側の重み付けが期待どおりに働きやすくなります。
時間方向の安定化
静止画の一貫性と、動画の一貫性は別問題です。動画では、フレーム間で髪が揺れ、口が動き、筋肉が伸縮します。ここで人物表現を固定しすぎると動きが硬くなり、緩すぎると顔が崩れます。実務的には、人物の同一性を強めに固定し、表情と体の動きは別の制御に任せる分離設計が有効です。キーフレームを指定して、その間を補間させる使い方も同じ考え方に基づきます。
参照画像セットの設計
ここが成果を最も大きく左右します。良い参照セットは、人物の情報を重複なく、矛盾なくカバーしています。目安は6枚から12枚です。少なすぎると情報が足りず、多すぎると互いに矛盾する要素が増えて中心点がぼやけます。
| 役割 | 枚数の目安 | 内容の例 |
|---|---|---|
| 正面の基準 | 1〜2枚 | 自然光、無表情、顔全体がはっきり写る |
| 斜め顔 | 2枚 | 左右それぞれ45度程度 |
| 横顔 | 1枚 | 鼻筋と顎のラインの確認用 |
| 表情 | 2枚 | 笑顔、驚きなど感情が乗った状態 |
| 全身 | 1〜2枚 | 体格、姿勢、立ち方の基準 |
| 衣装 | 1〜2枚 | 本編で使う衣装を着た状態 |
| 小物 | 1枚 | めがね、アクセサリー、傷跡など |
顔の情報を最優先する
顔の再現度は、そのまま作品の説得力を決めます。参照セットを組むときは、まず顔を固め、その後に衣装と小物を足す順序を守ってください。最初から全部を詰め込むと、どこが原因で崩れたのか切り分けられなくなります。顔だけのセットで3カットほどテスト生成し、同一人物に見えることを確認してから次の情報を追加するのが安全です。
解像度の目安は、顔が画面の長辺の3分の1以上を占めていることです。小さく写った集合写真を切り出して拡大した画像は、輪郭が甘く、かえって別の顔を生みます。
衣装と小物は別枠で管理する
衣装は作品ごとに変わる可能性があります。人物の同一性と衣装の情報を同じセットに混ぜると、衣装を着替えた瞬間に人物まで変わることがあります。人物用の参照セットと衣装用の参照セットを分けておき、生成時に組み合わせる運用がおすすめです。小物も同様に、接写の参照を1枚用意しておくと、毎カット安定して同じ位置に描かれます。
避けたい参照画像
- 強すぎるフィルターや美肌加工がかかった写真(肌の質感情報が失われる)
- 極端な広角や魚眼で撮られた写真(顔の比率が歪む)
- 逆光で顔が暗い写真(陰影が人物の特徴として学習される)
- マスクやサングラスで顔の半分が隠れた写真
- 権利者の許諾がない第三者の写真や著名人の写真
実践ワークフロー:設定からレンダリングまで
ここからは、実際に手を動かす順序を説明します。所要時間の目安は、初回の設定に2〜3時間、以降のエピソードは30分程度です。
ステップ1:キャラクター設定書を作る
生成を始める前に、人物の仕様を文章で書き出します。年齢、身長、体型、髪型、目の色、特徴的な傷やほくろ、基本の服装、声の印象、性格。これは映像には直接出ませんが、カットごとの判断基準になります。特に「変えてはいけない要素」と「シーンごとに変えてよい要素」を分けて書いておくと、後工程での混乱が減ります。
ステップ2:参照画像を選定し正規化する
集めた写真は、同じ長辺サイズに揃え、背景をできるだけ単純化し、彩度と明るさをおおむね統一します。ここでの目的は写真を美しくすることではなく、照明条件の差を減らして人物の情報だけを際立たせることです。作業の前後で必ず同じテストカットを生成し、変化を比較してください。
ステップ3:ショット設計とプロンプトを書く
カットごとに、フレーミング、カメラの動き、照明、感情、尺を決めます。このとき、人物の外見に関する記述は最小限にします。参照画像が同一性を担保しているので、プロンプトで髪の色や顔の形を繰り返すと、かえって情報が競合します。代わりに、環境と演技に言葉を割り当てます。
ショット3:中景、ゆっくり右へパン
人物は窓辺に立ち、外の雨を見ている。肩がわずかに下がる。
照明:窓からの寒色の間接光、室内は暗め。
演技:ため息のあと、視線だけをカメラ側へ。
尺:4秒。
ステップ4:検証と差分修正
生成したカットは、次の3点で確認します。第一に、顔の比率が基準カットと一致しているか。第二に、衣装と小物の位置が同じか。第三に、動きの中で顔が崩れる瞬間がないか。崩れを見つけたら、参照画像を増やす前に、まずシーン側の条件を見直してください。多くの場合、原因は参照ではなく照明やカメラワークの矛盾です。
シーン適応とスタイル分離
一貫性の悩みは「キャラクターが変わる」だけでなく「作品の雰囲気が変わる」ことにも現れます。ホラー調のカットと明るい日常カットが同じ作品に混ざると、たとえ顔が同じでも別作品のように見えます。これを防ぐには、人物の情報と画面スタイルの情報を分離して管理します。
人物の参照セットは全カット共通で固定し、スタイルは作品全体のスタイル指示として別に与えます。色温度、コントラスト、粒子感、レンズの印象を数値や短い言葉で定義し、全カットで同じ指示を使います。シーンごとに変えてよいのは、時間帯、天候、場所、感情の温度感です。
この分離ができていると、同じ人物を昼の公園でも夜の屋上でも自然に登場させられます。逆に分離できていないと、夜のシーンで顔の陰影が強くなりすぎ、視聴者には「別人が演じている」ように映ります。
ツール選定の判断基準
生成ツールは多数あり、どれが優れているかは用途によります。選ぶときは、次の観点で比較してください。
| 観点 | 確認する内容 |
|---|---|
| 参照画像の扱い | 複数枚を同時に渡せるか、枚数の上限はいくつか |
| 一貫性の強度 | 人物固定の強さを調整できるか |
| 動画の長さ | 1回の生成で得られる尺と、継続生成のしやすさ |
| カメラ制御 | パン、ズーム、ドリーなどを指定できるか |
| キーフレーム | 始点と終点を指定して補間できるか |
| 出力品質 | 解像度、フレームレート、書き出し形式 |
| 再現性 | 同じ設定で同じ結果が得られるか |
| 権利と商用条件 | 生成物の利用範囲、入力画像の取り扱い |
判断に迷ったら、次の順序で絞り込みます。まず参照画像を複数扱えるかどうかで候補を絞る。次に、自分の作品で必要な尺とカメラ制御が満たせるかで絞る。最後に、実際に同じ参照セットで3カットを生成し、顔の一致度を目視で比較します。カタログ上の数字より、自分の題材での実測が優先です。
なお、静止画生成ツールと動画生成ツールを組み合わせる構成も有効です。静止画側で参照セットを固め、その結果を使って動画側のキーフレームを作る流れは、試行錯誤のコストを下げます。
よくある失敗と対処法
顔が別人になる
最も多い症状です。原因は三つに分かれます。参照画像が少なすぎる、参照画像どうしが矛盾している、プロンプトで外見を上書きしている。まずプロンプトから外見記述を削り、次に参照セットを役割別に整理してください。
年齢が上下に揺れる
照明の強さが原因のことが多いです。暗いシーンでは陰影が深くなり、老けて見えます。肌の情報が豊富な明るい参照画像を1枚追加し、暗いシーンでは補助光を想定した指示を加えます。
衣装の色が混ざる
複数の衣装参照を同時に渡すと起こります。衣装は1カットにつき1セットに限定し、着替えのカットは前後で分けて生成してください。
背景が人物に引っ張られる
人物の参照画像に強い背景が写っていると、その背景が別のカットに滲み出します。参照画像の背景は単純化するか、人物だけを切り出した素材を用意します。
動きが硬い、あるいは顔が崩れる
人物固定の強さが適切でない可能性があります。会話シーンでは弱め、遠景のアクションでは強め、というように、ショットの種類ごとに調整値を記録しておくと再現が効きます。
手や指が破綻する
参照セットに手の情報が含まれていないことが原因です。手を写した参照を1枚追加し、手を使う演技ではカメラを近づけすぎない構図を選びます。
運用設計:シリーズ制作を支える管理の仕方
一貫性は技術だけでなく、運用でも保たれます。エピソードが増えるほど、参照画像、プロンプト、調整値、生成結果が散らばり、再現できなくなります。
命名規則とバージョン管理
参照画像には、人物名、役割、撮影条件、改訂番号を含む名前を付けます。例として、人物名_正面_自然光_v2 のような形式です。参照セット全体にも版番号を付け、どの版でどのカットを生成したかを記録します。新人が加わっても同じ状態を再現できることが、シリーズ制作では最も価値のある資産になります。
レビュー工程の固定化
カットを承認する前に、必ず同一人物の基準カットと並べて確認する工程を入れます。目視の比較は原始的ですが、もっとも確実です。可能なら、顔の領域を並べて表示する簡単な比較シートを作ると判断が速くなります。
権利と同意の確認
実在の人物を参照する場合は、本人の許諾と利用範囲の取り決めが必須です。第三者が撮影した写真を無断で参照セットに使うことは避けてください。商用利用を想定する場合、入力画像と生成物の扱いを規約で確認し、社内の記録として残しておくと後で困りません。
よくある質問
参照画像は何枚が最適ですか
6枚から12枚が実用的な範囲です。顔の正面、斜め、横、表情2枚、全身、衣装、小物という構成を出発点にし、崩れるカットが出たときだけ追加します。闇雲に増やすと矛盾が増えます。
同じ参照セットでもカットによって顔が変わります
シーン条件の差が原因であることが大半です。照明の色温度、レンズの焦点距離、カメラの高さを揃えるだけで改善します。参照側を疑う前に、撮影条件の統一を確認してください。
実写風とアニメ調を同じ人物で使い分けられますか
可能ですが、参照セットをスタイル別に用意するほうが安定します。人物の構造は共通でも、描画スタイルが変わると同じ特徴量が別の形で現れるためです。
一人称視点や後ろ姿のカットでも一貫性は保てますか
顔が見えないカットでも、体格、姿勢、髪の流れ、服のしわで同一性は伝わります。全身参照と歩行の参照を用意しておくと、後ろ姿の説得力が上がります。
生成が遅くて試行錯誤が進みません
テストは低解像度かつ短い尺で行い、構図と同一性が固まってから本番品質で再生成します。検証用の設定と本番用の設定を分けて記録しておくと、待ち時間を大きく減らせます。
参照画像の背景は消すべきですか
消すか、少なくとも単純化することをおすすめします。背景の模様や強い色は、人物の特徴として混入し、別カットに滲み出すことがあります。
チームで作業するときの注意点は
参照セットと調整値を一か所に集約し、誰が触っても同じ状態から始められるようにします。担当者ごとに参照を差し替えると、作品全体の一貫性が崩れます。
仕上がりを左右する小さな習慣
最後に、効果が大きく、かつ見落とされやすい習慣をまとめます。第一に、参照セットを凍結する期間を決めること。制作中に参照を差し替えると、前後のカットが別人物になります。第二に、変更は一度に一つだけ行うこと。参照、プロンプト、調整値を同時に変えると、何が効いたのか分からなくなります。第三に、失敗した設定を記録すること。うまくいかなかった条件の記録は、成功例と同じくらい価値があります。
第四に、カット単体ではなく並べた状態で確認すること。単体では気づかない差異も、並べると一目で分かります。第五に、人物の同一性と演技の質を分けて評価すること。演技が素晴らしくても人物が違えば作品は壊れ、人物が完璧でも演技が死んでいれば映像は退屈になります。
マルチ画像フュージョンは、魔法のボタンではありません。人物の情報を丁寧に集め、シーン条件を揃え、変更を一つずつ検証する。この地味な積み重ねの上で、技術が最もよく働きます。逆に言えば、参照セットの設計と運用の規律さえ押さえれば、これまで不可能だった長尺の連続作品を、少人数でも安定して作れるようになります。まずは3カットのテストから始めて、同じ人物が画面の中で生き続ける感覚を確かめてみてください。


