同じキャラクターを複数のカットに登場させたはずが、二つ目のカットで別人になっている。髪の色は合っているのに、目の形と輪郭が微妙に違う。服の模様は合っているのに、なぜか背中の位置に移動している。生成AIで映像を作り始めた人のほとんどが、一度はこの壁にぶつかる。そして多くの場合、原因は「モデルの性能が足りない」ことではなく、キャラクターの同一性をモデルに伝える手段を用意していないことにある。
この記事は、複数の参照画像を組み合わせて一人のキャラクターを固定する手法、いわゆるマルチ画像フュージョンを軸に、なぜ従来の生成が崩れるのか、どの情報を参照画像に載せるべきなのか、そして実際の制作工程にどう組み込むかを順に整理する。アニメ調の2Dキャラクターと実写系の人物では、崩れ方も対策も異なるため、両方を比較しながら見ていく。読み終えたとき、自分の案件で「どのカットをどう固定し、どこで落ちるかを予測できる」状態になることを目標にしている。
キャラクター一貫性が崩れる三つの原因
はじめに、現象ではなく原因を押さえる。原因を切り分けられないまま参照画像の枚数を増やすと、たいてい状況は悪化する。
原因1:同一性の情報がテキストに圧縮されている
プロンプトだけで人物を指定すると、「銀髪、緑の瞳、黒いジャケット」といった記述が数十トークンに圧縮される。この圧縮表現は、その条件を満たす無数の人物の集合を指しており、一人を指してはいない。だから同じプロンプトでも毎回ちがう顔が出てくる。これは不具合ではなく、テキストという入力形式の限界である。
原因2:シードと正規乱数がカットごとにリセットされる
同じシード値を使えば同じ結果になる、という説明は半分正しい。シードは「どのノイズから出発するか」を固定するだけであって、解像度、フレーム数、カメラアングル、モーション強度が変われば、ノイズが展開される過程そのものが変わる。したがって、長回しなら同一シードで顔が保たれても、寄りと引きのカットをまたぐと破綻する。
原因3:時間方向の記憶が短期である
動画生成モデルは、直前の数フレームを参照して次のフレームを作る。この参照範囲は限られており、数十フレーム前の顔の情報は薄まっていく。結果として、前半は同一人物、後半は別人という「ドリフト」が起きる。参照画像を渡さない限り、モデルは時間の経過とともに自分の直前の出力をコピーし続け、誤差が蓄積する。
参照ベース制御という考え方
テキストによる抽象的な指定をやめ、画像による具体的な指定に置き換える。これが参照ベース制御の基本である。参照画像は、圧縮された形容詞の集まりではなく、輪郭、パーツの比率、色の分布といった具体的情報をそのまま運べる。
重要なのは、参照画像は増やせばよいわけではないという点だ。矛盾する情報を多数与えると、モデルは平均的な人物を作り出し、どの参照とも似ていない顔になる。マルチ画像フュージョンとは、複数の参照を平均することではなく、参照ごとに役割を分けて統合することである。役割が重複した参照は、精度に寄与しない。
参照画像を役割で分けて設計する
役割分担を決めずに画像を集めると、情報が衝突する。実務では次の四つの役割に分けると整理しやすい。
役割A:アイデンティティ(顔そのもの)
正面、斜め45度、横顔の3枚が基本になる。照明はできるだけ平坦で、強い影が顔の構造を歪めていないものが望ましい。正面だけを渡すと、プロフィールのシーンで鼻筋と顎のラインが崩れる。逆に横顔しかないと、正面カットで目の間隔が狂う。
役割B:体型とシルエット
立ち姿の全身が一枚あると、頭身と肩幅が固定される。アニメ調では頭身がキャラクターの記号として強く機能するため、この一枚の有無が印象の一致度を大きく左右する。実写調では骨格と姿勢が該当する。
役割C:衣装と装飾
衣装はキャラクター同一性の中で最も壊れやすい。ボタンの数、柄の位置、ロゴの形は、生成の過程で確率的に揺らぐ。衣装単体を切り出した参照を別に用意し、顔の参照と分けて渡すと安定する。
役割D:質感とスタイル
線の太さ、塗りのグラデーション、粒子感、フィルムグレイン。これはキャラクターではなく作品全体のトーンを決める参照であり、すべてのカットで共通に使う。ここを混ぜると、カットごとに画風が変わる。
役割を分けたら、参照の優先順位を明示する。顔が最優先、次に衣装、最後に質感という順序は、多くの案件で妥当な初期値になる。
役割分担の設計表
撮影や素材集めの前に、次の表を埋める習慣をつけると手戻りが減る。
| 役割 | 参照枚数の目安 | 選定基準 | よくある失敗 |
|---|---|---|---|
| アイデンティティ | 3枚(正面・斜め・横) | 影が浅く、顔が画面の3割以上 | 正面のみでプロフィールが崩れる |
| シルエット | 1枚 | 全身、背景が単純 | 頭身が合わず別人の印象になる |
| 衣装 | 1〜2枚 | 柄と装飾がはっきり写る | 柄が別位置に再配置される |
| 質感・スタイル | 1枚 | 作品の基準カット | カット間で画風がばらつく |
合計6枚前後が実務的な出発点になる。それ以上増やす場合は、必ず「どの役割を強化するためか」を言語化する。説明できない追加は、たいてい平均化を招くだけである。
ポーズと表情を動的にマッピングする
キャラクターが固定できたら、次に必要なのは「同じ人物のまま動かす」ことである。ここで多くの人がつまずく。参照画像は静止しているので、そのまま使うと姿勢と表情も固定され、棒立ちの人物しか出てこない。
二層に分けて制御する
解決の鍵は、制御を二層に分けることだ。
- 同一性の層 — 顔、体型、衣装。全カットを通じて変化させない。
- 状態の層 — ポーズ、表情、視線、体の向き。カットごとに意図的に変化させる。
同一性の層は画像参照で与え、状態の層はポーズ指定用の骨格情報やモーションの参照で与える。両方をテキストで書こうとすると、記述量が増えるほど情報が薄まり、どちらも中途半端になる。
ポーズ参照を顔参照と分離する
ポーズの参照画像に顔がはっきり写っていると、モデルはポーズと一緒にその顔も取り込もうとする。結果、意図しない別人の顔が混ざる。ポーズ参照には、関節位置が読めるが顔の詳細が少ない素材(後ろ姿、シルエット化した素材、顔を小さくした全身カット)を使うのが安全である。
表情は強度を段階的に上げる
表情変化は、いきなり大きく動かすと同一性が崩れる。無表情から微笑みへ、微笑みから笑顔へ、というように段階を刻むと崩れが小さい。1カットあたりの変化量を抑え、カット数で表現するほうが結果的に自然な芝居になる。
動きの激しいシーンほど参照を厚くする
走る、振り向く、髪が大きく流れるといったシーンでは、同一性の情報が失われやすい。こうしたカットでは顔の参照に加えて、同じ構図の静止画をあらかじめ用意し、その構図を起点にして動かすと破綻が減る。動きの大きさに比例して、参照側の準備を厚くするのが原則だ。
統合レイヤーの技術的な役割分担
ここまでの話は、単体の生成モデルの内部設定だけでは完結しない。参照画像の保管、ジョブの投入、結果の検証、再実行の記録まで含めて一つの流れとして設計する必要がある。このとき、層ごとに責務を分けておくと、どこで崩れたかを切り分けられる。
たとえば、外部から受け付けた生成要求を検証し、ジョブとして整えてから実行系に渡す層をアプリケーション側に置き、参照画像と生成結果、実行パラメータをまとめて保管する層をデータベース側に置く。データベースには、どの参照画像の組み合わせでどの出力が得られたかを記録しておく。すると、後から「この顔はどの参照セットの産物か」を追跡できる。
NestJS のようなサーバーサイドのフレームワークは、入力の検証、キューへの投入、進捗の状態管理、再試行の制御といった「順番と状態」を扱うのに向いている。一方、画像ファイルそのものの保管、参照セットの版管理、生成履歴の横断検索は Supabase のようなマネージドなデータ基盤に任せると、実装量を抑えつつ監査可能な記録を残せる。
この分担の実利は明確である。参照画像を差し替えたときに、どのカットが影響を受けるかを一覧で出せる。同じ参照セットを別の案件に流用できる。失敗した実行を、当時のパラメータのまま再現できる。モデルやプロバイダを切り替えたときの比較も、同一の参照セット上で行える。
アニメ調と実写調で崩れ方はどう違うか
同じマルチ画像フュージョンでも、対象がアニメ調か実写調かで重点が変わる。ここを混同すると、対策が空振りする。
アニメ調:線と色の離散性が鍵
アニメ調のキャラクターは、色数が少なく境界が明瞭である。したがって、輪郭線の太さ、目のハイライトの位置、髪の束の分け方といった離散的な要素の一致が重要になる。一方で、肌の質感や毛穴のような連続的な要素は存在しないため、そこに労力を割く意味はない。
崩れの典型は、目のハイライトが消える、輪郭線が太くなる、髪の房の数が変わる、といったパーツ単位の変化である。対策としては、キャラクター設定画に近い解像度の参照を複数角度から用意し、線の情報を明示的に与えるのが効く。
実写調:質感と照明の連続性が鍵
実写調では、逆に離散的な要素が少なく、肌の質感、毛孔、髪の一本一本、照明の当たり方が連続的に変化する。ここでは同一の照明条件を参照側で揃えることが最も効く。カットごとに光源の方向が変わると、顔の立体感が変わり、同じ人物でも別人の印象になる。
崩れの典型は、肌の年齢感が変わる、輪郭がのっぺりする、目の輝きが失われる、といった連続量のドリフトである。対策は、基準となる照明条件を決め、参照画像をその条件で撮影または選定すること。複数カットで照明を変えたい場合は、同一性の参照とは別に、照明だけを切り替える層を用意する。
共通する判断基準
どちらの場合も、「何を固定し、何を変えるか」を先に決めることが本質である。固定すべき要素を列挙し、可変要素を列挙し、両者が同じ参照画像に混ざっていないか確認する。混ざっていれば、必ずどちらかが犠牲になる。
制作ワークフローへの組み込み手順
ここまでの内容を、実際の案件で使える順序に落とす。
- キャラクター仕様書を一枚作る。 固定する要素を箇条書きで列挙する。顔の比率、髪、瞳の色、衣装の要点、身長の目安。文章は短くてよい。
- 参照セットを役割ごとに集める。 アイデンティティ3枚、シルエット1枚、衣装1〜2枚、質感1枚を基本とする。
- 参照セットを一枚ずつ検証する。 各参照が他の参照と矛盾していないか確認する。矛盾があれば、その参照は捨てるか役割を狭める。
- 静止画で同一性をテストする。 動かす前に、複数カットの静止画で顔が一致するかを確認する。ここで崩れるものを動画にしても崩れる。
- 短尺で動かす。 数秒の短いクリップで、時間方向のドリフトを確認する。長尺から始めない。
- 可変要素を一つずつ動かす。 ポーズ、表情、カメラ、照明を同時に変えない。一つ変えて結果を確認し、次へ進む。
- 崩れたカットを分類して記録する。 顔の崩れか、衣装か、時間ドリフトか。原因の分類が次回の対策を決める。
- 採用した参照セットを保管する。 案件名、役割、採用理由を添えて残す。次の案件の出発点になる。
この順序で特に省略されやすいのは四段目である。静止画で一致しないものを動画で一致させることは、ほぼ不可能だと考えてよい。
つまずきパターンと切り分け方
現場で繰り返し起きる症状と、その切り分けをまとめる。
顔が毎回変わる。 アイデンティティ参照が一枚しかないか、参照の照明条件がばらばらである。正面・斜め・横の三枚を同じ条件で揃え、それでも揺れるなら参照の解像度を上げる。
顔は合うが衣装が崩れる。 衣装の参照が顔と混ざっている。衣装単体の参照を別に切り出し、柄の位置を明示する。
途中から別人になる。 時間方向のドリフトである。カットを短く分割し、各カットの先頭で同一性の参照を再適用する。長回しに固執しない。
全員の顔が似てくる。 参照を増やしすぎて平均化が起きている。役割の重複を疑い、参照セットを削る。
動きが硬い。 ポーズ参照に顔の情報が混ざっている、または状態の層を動かしていない。ポーズ参照を無表情・無個性の素材に差し替える。
画風がカットごとに変わる。 質感の参照がカットごとに違う。作品共通の参照を一つに統一する。
切り分けの原則は単純である。症状が「変わるべきでないものが変わっている」なら同一性の層、「変わるべきものが変わっていない」なら状態の層を疑う。この二分類を最初にやるだけで、調査時間は大きく短縮する。
導入判断のチェックリスト
この手法を自分の制作に組み込むべきかどうかは、案件の性質で決まる。
-
同じキャラクターが三カット以上に登場するか。 一回だけの登場なら、参照設計にかける手間は回収できない。
-
カット間の連続性が視聴者に評価されるか。 ストーリー性のある映像ほど、顔の不一致は致命的になる。
-
作り直しのコストが高いか。 手戻りが高価な案件ほど、事前の参照設計の価値が上がる。
-
参照素材を用意できるか。 設定画やライトな撮影素材がない場合、参照設計そのものが難しくなる。
-
記録を残す余力があるか。 参照セットの保管ができないと、次回に知見が蓄積しない。
三つ以上に当てはまれば、最初から手法として組み込む価値がある。一つも当てはまらないなら、まずは単発のカットで様子を見るのが現実的である。
よくある質問
Q. 参照画像は何枚が最適か。 固定の正解はないが、役割ごとに1〜3枚、合計6枚前後が出発点になる。それ以上増やす場合は、追加の目的を言語化できる場合に限る。目的を説明できない追加は平均化を招きやすい。
Q. 同じシードを使えばキャラクターは固定されるのか。 固定されない。シードは出発点のノイズを決めるだけで、解像度や構図が変われば展開の仕方も変わる。シードは補助であり、参照画像による指定の代わりにはならない。
Q. アニメ調と実写調を同じ設定で扱えるか。 扱えない。アニメ調では線と色の離散性、実写調では質感と照明の連続性が支配的になる。参照の選び方も崩れ方も異なるため、設定を分けて管理したほうがよい。
Q. 顔の参照に実在の人物写真を使う場合の注意点は。 権利と同意の確認が前提になる。特に商用利用では、参照素材の利用条件を事前に確認し、記録として残しておく必要がある。
Q. 生成結果が安定しないとき、まず何を見直すべきか。 参照セットの矛盾を疑う。参照の照明条件、解像度、角度が揃っているかを確認する。次に、固定すべき要素と可変要素が同じ参照に混ざっていないかを確認する。
Q. 長尺の映像でも一貫性は保てるのか。 保てるが、構造化が必要になる。長回しを避け、カット単位に分割し、各カットの起点で同一性の参照を再適用する。カットの分割は品質のための投資であり、手間ではなく設計である。
Q. 参照セットは案件をまたいで再利用できるか。 質感やスタイルの参照は再利用しやすい。一方、アイデンティティの参照は作品固有なので、案件ごとに作り直すのが原則である。
まとめ
キャラクターが固定できない原因は、モデルの性能不足ではなく、同一性の情報をモデルに渡す設計が欠けていることにある。テキストによる抽象的な指定を、役割分担された参照画像による具体的な指定に置き換える。これがマルチ画像フュージョンの本質である。
実践の順序は明確だ。固定する要素を列挙し、参照を役割ごとに集め、互いの矛盾を取り除き、静止画で一致を確認してから動かす。ポーズと表情は同一性とは別の層として扱い、一つずつ変数として動かす。崩れたときは、変わるべきでないものが変わったのか、変わるべきものが変わっていないのかを最初に切り分ける。
アニメ調では線と色の離散性、実写調では質感と照明の連続性に注意を向ける。この二つは対策が異なるが、「何を固定し、何を変えるか」を先に決めるという原則は共通している。参照セットと実行条件を記録として残せば、次の案件では同じ試行錯誤を繰り返さずに済む。一貫性は才能ではなく、設計と記録の産物である。




