キャラクターの一貫性はなぜ崩れるのか
AI動画生成で最初にぶつかる壁は、ショットごとに人物が別人になってしまう問題です。1カット目では黒髪で丸顔だった主人公が、3カット目では顎が細くなり、5カット目では髪の長さまで変わる。静止画としては美しくても、つなげた瞬間に物語の説得力が失われます。
原因は生成の仕組みにあります。拡散モデルはテキスト条件とノイズから毎回ゼロベースで画像を再構成するため、「同じ人物」という概念が明示的に保持されません。プロンプトに「30代の女性、黒髪、ショートカット」と書いても、それは属性の指定であって個体の指定ではありません。同じ属性を持つ無数の人物が候補になり、そのどれが生成されるかはノイズの引き方次第で変わります。
シード値を固定する方法も、万能ではありません。シードは構図や全体のトーンを安定させる効果はありますが、カメラアングル、ポーズ、照明が変わると、顔の造形は簡単にドリフトします。つまり一貫性を守るには、「属性を言葉で指定する」段階から、「個体を視覚情報として固定する」段階へ発想を切り替える必要があります。
マルチ画像フュージョンという解決アプローチ
マルチ画像フュージョンは、複数の参照画像から人物の同一性を抽出し、それを1つの条件情報として生成に組み込む考え方です。正面、斜め45度、横顔、笑顔、真顔、別の照明下のカットなど、複数の角度から得た特徴を統合することで、単一の参照画像よりもはるかに頑健な「その人らしさ」を作れます。
単一参照では、参照画像に写っていない角度を生成しようとした瞬間に情報が不足し、モデルが勝手に補完して別人化します。3〜6枚の異なる角度を融合させると、モデルは「この顔は横から見るとこうなる」という情報をある程度持てるようになり、カメラが回り込むショットでも崩れにくくなります。
代表的な実装パターン
同じ「融合」でも実装はいくつかに分かれます。
- 参照画像条件付け型:参照画像の特徴を埋め込みベクトルとしてプロンプト条件に混ぜる方式。手軽で学習不要だが、顔の細部の再現度は中程度。
- ID特化型:顔の識別情報を抽出して構造側に注入する方式。正面顔の再現度が高く、短時間で結果が出る。
- 追加学習型:10〜30枚程度の画像で軽量な追加学習を行い、その人物専用の重みを作る方式。準備に時間はかかるが、角度・表情・衣装の自由度が最も高い。
- 後処理型:生成後に顔だけを差し替える方式。動画の安定性は高いが、首から下の体型や髪の流れが別人格のまま残りやすい。
実務ではこれらを単独で使うより、組み合わせる方が現実的です。たとえば参照画像条件付けでラフを大量に出し、重要なカットだけ後処理で顔を整える。あるいは追加学習で人物を作り、動画化の段階では構図の安定を優先する、といった分担です。
何を「固定」し、何を「動かす」のかを決める
一貫性設計で最も重要なのは、固定する要素と変化させる要素を先に決めることです。
| 固定する要素 | 変化させる要素 |
|---|---|
| 顔立ち、骨格、髪質 | 表情、視線 |
| 体型、身長バランス | ポーズ、手の位置 |
| 衣装の基本デザイン | 衣装の乱れ、シワ、汚れ |
| 年齢感 | 時間経過による変化 |
| カラーパレット | 照明の方向と色温度 |
この表を先に埋めておくと、生成時の判断が速くなります。逆にこれを決めずに走り出すと、「なぜか毎回ジャケットの色が違う」「髪型だけ妙にリアル」といった小さな破綻が積み重なります。
キャラクターシートの作り方
参照画像は量より設計です。20枚の似たような自撮り風カットより、意図を持った6枚の方が強力に働きます。
必須カット
- 正面のバストアップ(ニュートラルな表情、均一な照明)
- 斜め45度のバストアップ(顔の立体感を伝える)
- 横顔(鼻筋、顎のライン、耳の形)
- 全身(体型、手足の長さ、姿勢の癖)
- 笑顔(口元と目の変化)
- 別照明下のカット(順光だけでなく逆光や室内光)
余裕があれば、怒り・悲しみ・驚きの表情、帽子や眼鏡などの小道具をつけた状態、季節の違う衣装も加えます。物語の中で実際に使うバリエーションを参照に入れておくのが原則です。
避けるべき参照画像
- 極端な逆光や強いフィルターがかかった写真(肌色情報が壊れる)
- 顔の半分が髪や手で隠れているカット
- ピントが甘い、あるいは解像度が低すぎる画像
- 視線が大きく外れている、または極端な俯瞰・あおり
- 別人の顔が同じフレームに大きく写っている画像
参照の質は出力の上限を決めます。ここを妥協すると、どれだけ生成側の設定を詰めても破綻は消えません。
前処理でそろえるべきこと
参照画像は、背景を単純化し、肌の露出とライティングの傾向をなるべく揃えてから使います。顔の位置と大きさをそろえておくと、抽出される特徴のばらつきが減ります。色温度がばらばらだと、生成側が「この人物は光によって肌の色が大きく変わる」と学習してしまい、シーンごとに肌色が揺れる原因になります。
実践ワークフロー:基準カットからシーン展開へ
ここからは、実際の制作の流れを順に追います。
ステップ1:ヒーローショットを確定する
最初に作るのは、物語の中で最も重要な1カットです。冒頭か、ポスターに使うような決めカットを選びます。このカットを「基準カット」として、以降のすべてのショットはここに寄せていきます。
基準カットが決まったら、顔のクローズアップを別途生成し、細部を確認します。目頭の形、歯並び、耳の輪郭、首のライン。この時点で違和感があれば、参照画像を差し替えるか、融合の重みを調整して作り直します。後工程での修正はコストが跳ね上がるため、ここで妥協しないのが鉄則です。
ステップ2:アングルとポーズを展開する
基準カットを土台に、同じ人物を別アングルで生成します。この段階では動画化せず、静止画のまま枚数を稼ぐのが効率的です。
- 同じ構図で表情だけ変える(感情のバリエーション)
- カメラ位置を左右に振る(視線の整合性チェック)
- 立ち、座り、歩行のポーズ展開
- 手や小道具を持たせた状態
表情だけを変えたシリーズを作ると、動画化したときの口パクや瞬きの基準になります。また、同じ構図で連続生成すると、キャラクターのドリフトが目視で発見しやすくなります。
ステップ3:動画化とモーション設計
静止画から動画へ移すとき、動きの大きさを欲張ると一貫性が崩れます。特に顔が大きく動くショット(振り向き、走り出し、笑い出す瞬間)は、フレーム間で顔の造形が再解釈されやすい領域です。
対策としては、次の順序で難易度を上げていきます。
- 軽微な動き(髪が揺れる、瞬き、わずかな首の動き)
- 中程度の動き(上半身のターン、歩行、手振り)
- 大きな動き(走る、跳ぶ、カメラが大きく回り込む)
各段階でプレビューを確認し、崩れたら前の段階に戻ります。動きの激しいショットは、いっそ別カットに分割して編集でつなぐ方が、結果的に品質が高くなることも多いです。
ステップ4:編集段階での微調整
動画生成は「撮影」、編集は「仕上げ」です。色調補正、肌の質感調整、軽微な顔の位置合わせ、フレーム単位の差し替えなどを行います。ここで重要なのは、全ショットに同じルックを適用することです。カットごとに彩度やコントラストが違うと、人物が同一でも別の作品のように見えます。
シーンをまたぐ一貫性:衣装・照明・時間経過
物語には時間の流れがあります。同じ衣装のままでは不自然な場面もあれば、照明が変われば顔の印象も変わります。ここをどう扱うかが、作品の完成度を左右します。
衣装チェンジの設計
衣装を変えるときは、顔の一貫性よりも「色とシルエットの一貫性」を意識します。たとえば主人公の基調色をネイビーに決めておけば、シャツでもコートでも同じ人物として認識されやすくなります。衣装を変えるカットは、変える瞬間を物語の転換点として使うと自然です。
照明の連続性
ショットごとに光源の方向がばらつくと、同じ顔でも別人に見えます。シーンごとに「主光源の方向」「色温度」「コントラストの強さ」を決めてメモしておき、生成時のプロンプトに反映させます。屋外の昼、室内の夜、蛍光灯の下では、肌の見え方が根本的に変わります。
時間経過と加齢
回想シーンや数年後の場面では、顔をわずかに変化させる必要があります。このとき、一気に変えず、髪型・肌の質感・姿勢といった要素で差をつけると、同一人物としての連続性を保ったまま変化を表現できます。
モデル別の傾向と使い分け
一口にAI動画生成といっても、モデルによって得手不得手があります。用途別に整理します。
フォトリアル系
実写風の質感に強く、肌や髪の描写が細かいのが特徴です。その反面、顔の同一性を保つには参照条件の設計が重要になります。人物のクローズアップが多い作品、企業の広告、インタビュー風の映像に向きます。
アニメ・イラスト系
線と色の再現度が高く、キャラクターの一貫性は比較的保ちやすい傾向があります。ただし画風そのものの統一が必要で、線の太さや彩色のタッチがカットごとに変わると別作品のように見えます。
スタイライズ・実験系
絵画的、あるいは抽象的な表現に強く、短い尺のミュージックビデオやSNS向けのループ映像に向きます。一貫性の要求水準が緩い代わりに、視聴者に強い印象を残せます。
実務では、1つの作品で複数モデルを混ぜるよりも、メインのモデルを1つに決め、苦手なショットだけ別モデルで補う方が破綻が少なくなります。モデルを混ぜるときは、解像度とフレームレートを揃え、編集でルックを統一します。
よくある失敗とトラブルシューティング
実際の制作で頻出する問題と、その対処をまとめます。
顔が平均化して個性が消える
参照画像の影響が弱すぎる状態です。融合の重みを上げるか、参照画像の枚数を増やします。それでも改善しない場合は、特徴的な要素(ほくろ、傷、メガネ、独特の髪型)を参照に含めると、識別の手がかりが増えます。
参照画像のポーズが毎回再現される
逆に影響が強すぎる状態です。参照から引き継ぐ情報を顔に限定し、構図やポーズは別の条件で指定します。全身を使った参照を顔だけに使うと、この症状が出やすいので注意します。
衣装の色がカットごとに変わる
色を言葉だけで指定していると起こります。基準カットを参照に含める、色を具体的な名称や値で指定する、編集で色調をそろえるといった対策を組み合わせます。
手や指が崩れる
動画生成でもっとも壊れやすい部分です。手が画面の主要素になるショットは、引きの構図にするか、手を小道具で隠す、あるいは別カットに差し替えるのが現実的です。
カメラが回り込むと顔が崩れる
参照に横顔や背面が含まれていない場合に起こります。横顔と斜め後ろのカットを参照に追加するだけで改善することが多いです。
ショット間で明るさが揺れる
照明条件の指定が曖昧なことが原因です。シーンごとに光源の方向と色温度を固定し、編集段階でトーンを合わせます。
品質チェックリスト
納品前、あるいは公開前に確認したい項目です。
- 主人公の顔は、全ショットで同じ人物に見えるか
- 髪の長さ、分け目、色は一致しているか
- 体型と身長のバランスは保たれているか
- 衣装の基本デザインと色は統一されているか
- 光源の方向と色温度はシーン内で揃っているか
- 手や指の破綻はないか
- カット間の動きの方向(軸)はつながっているか
- 解像度とフレームレートは統一されているか
- 全体のルック(彩度、コントラスト、粒状感)は揃っているか
この項目を上から順に確認するだけで、公開後の「なんとなく安っぽい」印象の多くは防げます。
よくある質問
参照画像は何枚くらいが適切ですか
3〜6枚が実用的な出発点です。1枚では角度の情報が足りず、10枚を超えると似たカットが増えて効果が薄まり、処理も重くなります。まずは質の高い6枚をそろえ、不足を感じた角度だけ追加するのが効率的です。
追加学習と参照条件付け、どちらを選ぶべきですか
1本の短編や単発の案件なら参照条件付けが現実的です。同じキャラクターを何本も使うシリーズ、あるいはグッズ展開や長期的な企画があるなら、追加学習の投資は回収しやすくなります。
一貫性を保ったまま表情を豊かにするには
基準となる無表情のカットを1枚決め、そこから表情だけを変えたシリーズを先に作ります。表情の基準が固まってから動画化すると、感情の起伏があるシーンでも崩れにくくなります。
実写素材とAI生成を混ぜても大丈夫ですか
可能ですが、ルックの統一が必須です。解像度、粒状感、被写界深度、色調を編集でそろえないと、切り替わりで視聴者が違和感を覚えます。AI生成側に実写風の質感を寄せる方が、逆方向より合わせやすい傾向があります。
生成に時間がかかりすぎる場合の対処は
まず解像度を落として構図と動きを検証し、確定したカットだけ高解像度で再生成します。試行錯誤の段階で最高品質を狙うのは効率が悪く、判断も鈍ります。ラフと本番を明確に分けるのが結果的に速い方法です。
衣装や小道具のバリエーションは増やせますか
増やせますが、一度に複数要素を変えないことが大切です。髪型と衣装と背景を同時に変えると、どの要素が崩れの原因か特定できなくなります。1つずつ変えて比較するのが、遠回りのようで最短です。
まとめ:一貫性は技術ではなく設計で決まる
キャラクターの一貫性は、最新モデルを使えば自動的に得られるものではありません。参照画像をどう設計し、何を固定して何を動かし、どの段階で品質を確認するか。この設計の質が、最終的な映像の説得力になります。
まずは主人公の参照画像を6枚そろえ、基準カットを1枚確定させる。そこから表情、アングル、動きの順に難易度を上げていく。崩れたら前の段階に戻る。この反復だけで、ショットをつないだときの印象は大きく変わります。
技術は今後も進化し続けますが、「同じ人物が同じ物語を生きている」と視聴者に信じさせる力は、モデルの性能だけでは生まれません。参照画像の設計と、地道な検証の積み重ねが、シームレスな物語をつくる土台になります。

