AI動画でアバターの一貫性が崩れる根本原因
AI動画生成の品質は年々上がり、数秒のカットであれば驚くほど自然な映像が作れるようになりました。しかし、同じキャラクターを複数のショットに登場させる途端、多くの人が同じ壁にぶつかります。1カット目は完璧だったのに、2カット目では顎のラインが変わり、3カット目では髪の長さが変わり、4カット目では衣装の色がわずかにずれている。この「別人化」は、生成技術そのものの限界というより、制作フローの設計不足から起きるケースがほとんどです。
アバターの一貫性を保つという作業は、単一の魔法のボタンで解決できるものではありません。複数の生成モデルを使い分けながら、参照情報・プロンプト・照明・カメラワーク・仕上げ処理のすべてを同じ方向に揃えていく、総合的な設計行為です。ここでは、実際の制作現場で再現性が高い手順を順番に整理していきます。
モデルごとに「顔の解釈」が違う
生成モデルはそれぞれ異なる学習データと異なるアーキテクチャを持っています。そのため、同じ参照画像を入力しても、目の形の再現度、鼻筋の描写、肌の質感、顔の立体感の出し方がモデルごとに微妙に変わります。写実的な人物を得意とするモデルと、アニメ調の人物を得意とするモデルでは、そもそも「顔とはどういう構造か」という内部表現が異なります。
この性質を理解せずに、シーンごとに気分でモデルを切り替えると、カットごとに顔の印象が変わります。逆に言えば、モデル切り替えを前提にしたワークフローを最初から組んでおけば、この差は制御可能な変数になります。
参照情報の不足と過多
参照画像が1枚だけだと、モデルは見えていない部分を想像で埋めます。髪の毛の後ろ側、耳の形、首の太さ、肩幅などは、カットごとに勝手に生成されます。これが積み重なると、視聴者には「なんとなく違う人」として認識されます。
反対に、参照画像を20枚・30枚と大量に投入すると、今度は情報が矛盾します。照明の向きが違う写真、表情が違いすぎる写真、別人に見える角度の写真が混ざると、モデルはどの特徴を優先すべきか判断できず、平均化された無個性な顔になります。参照情報は「多いほど良い」ではなく、「整合性が取れているほど良い」のです。
シード値に頼りすぎる落とし穴
シード値を固定すれば同じ結果が得られる、という説明をよく見かけます。これは厳密には、同一モデル・同一バージョン・同一設定・同一プロンプトの場合にのみ成立します。モデルを更新したり、解像度を変えたり、モーション強度を変えたりすれば、シード値の意味は失われます。シードは補助輪であって、設計図ではありません。
制作前の準備:キャラクター設計資料を整える
一貫性の問題の多くは、生成を始める前の準備段階で予防できます。撮影で言えばプリプロダクションにあたる工程を、AI動画でも省略しないことが重要です。
参照画像セットの作り方
まず、キャラクターの基準となる参照画像セットを用意します。理想的な構成は次のとおりです。
- 正面のバストアップ(基準となる1枚。これが最も重要)
- 斜め45度のバストアップ
- 真横のプロフィール
- 後ろ姿または背面ヘアが見えるカット
- 全身の立ち姿(体型とプロポーション確認用)
- 表情差分(無表情、微笑み、驚き、怒り、悲しみ)
- 照明条件のバリエーション(順光、逆光、室内の暖色、屋外の寒色)
- 衣装違いのバリエーション(同じ人物で服装だけ変えたもの)
合計10〜15枚程度が扱いやすい上限です。すべて同じ人物として見えることが絶対条件で、少しでも「別人に見えるかも」と感じる画像は外します。
キャラクターシートに書くべき項目
画像だけでなく、テキストの設定資料も用意します。プロンプトに毎回貼り付ける「固定ブロック」として使うためです。
- 年齢感と性別
- 身長と体格(細身、筋肉質、がっしり型など)
- 髪の色(色番号で指定)、長さ、質感、分け目
- 瞳の色と形
- 肌のトーン
- 特徴的な要素(ほくろ、傷、眼鏡、ピアスなど)
- 基本衣装と素材感(革、コットン、ニットなど)
- 印象キーワード(落ち着いた、快活、疲れた様子など)
ここで重要なのは、色を言葉ではなく数値や具体的な色名で書くことです。「茶色の髪」ではなく「ダークブラウン、やや赤みのある栗色」のように、モデルが解釈の幅を狭められる表現を選びます。
権利と同意の確認
実在の人物をモデルにする場合は、必ず本人の同意と利用範囲の合意を取ります。著名人に似せたキャラクターを商用利用する場合も、肖像権やパブリシティ権の問題が生じます。AI生成キャラクターであっても、既存の著作物に酷似していないかの確認は欠かせません。
モデル選定の判断基準
モデルを「なんとなく」選ぶのをやめ、用途ごとに分類して使い分けると、一貫性が格段に安定します。
用途別のモデル分類
フォトリアル系は、実写風の人物表現に強みがあります。肌の質感、毛穴、光の反射まで描けるため、企業の広告やインタビュー風の映像に向きます。一方で、微妙な照明の違いに敏感で、カット間の色調を合わせる手間が増えます。
アニメ・イラスト系は、線の太さや塗りのトーンを揃えやすいのが利点です。ただし、モデルごとに線の処理が違うため、シリーズ全体をひとつのモデルで通すか、少なくとも同じ系統で固めるのが安全です。
モーション特化系は、動きの滑らかさや身体のバランスに優れます。顔の再現度は他のモデルに劣ることがあるため、顔は別工程で作り、体の動きだけを任せる分業が有効です。
リップシンク・トーキングヘッド系は、音声に合わせた口の動きを専門に扱います。ナレーション付きの解説動画や、プレゼン形式のコンテンツと相性が良いです。
アップスケール・補正系は、生成した映像の解像度を上げたり、ノイズを減らしたりする仕上げ工程を担当します。この工程を挟むと挟まないとでは、最終的な印象が大きく変わります。
選定チェックリスト
モデルを選ぶときは、次の順番で確認します。
- そのカットで最も重要な要素は何か(顔の再現、動き、ライティング、尺)
- その要素を最も得意とするモデルはどれか
- 直前のカットと同じモデルを使えるか
- 使えない場合、差を埋めるポスト処理は何か
- レンダリング時間と試行回数の見積もり
この5項目を毎回メモしておくと、シリーズ制作の後半で「なぜこのモデルを選んだのか」が分からなくなる事態を防げます。
ショット単位の実践ワークフロー
実際の制作は、次の順番で進めると手戻りが少なくなります。
ステップ1:マスターショットを作る
最初に、キャラクターが最もよく見える基準カットを作ります。正面のバストアップ、中程度の距離、シンプルな背景、均一な照明。この1カットに時間をかけて、納得のいく顔ができるまで調整します。ここで妥協すると、以降のすべてのカットが妥協の連鎖になります。
ステップ2:基準フレームを確定する
マスターショットから、もっとも顔がはっきり写っている1フレームを切り出し、画像として保存します。これが以降のカットすべての参照画像になります。動画を参照にするよりも、静止画1枚を基準にしたほうが、モデル間の移植性が高まります。
ステップ3:角度と距離を展開する
基準フレームを参照しながら、斜め45度、横顔、全身、引きのショットを順に作ります。各カットは前のカットの結果を参照に足していくのではなく、常に基準フレームに戻って作ります。連鎖参照は色味や顔立ちがドリフトしていく原因になります。
ステップ4:動きを追加する
静止に近いカットが揃ったら、モーションを加えます。深呼吸、まばたき、首のわずかな動き、手の仕草など、小さな動きから始めます。大きな動作は顔の形状が崩れやすいので、顔がアップのカットでは控えめにします。
ステップ5:つなぎを調整する
カットをつないだときに、目の位置、頭の高さ、体の向きが急に飛ばないかを確認します。必要であれば編集ソフトで位置を微調整し、ジャンプカットを和らげます。
プロンプト設計で一貫性を守る
プロンプトは毎回ゼロから書くのではなく、固定部分と可変部分に分けて管理します。
固定ブロックと可変ブロック
固定ブロックには、人物の外見、衣装、素材、印象を書きます。可変ブロックには、カメラアングル、ショットサイズ、動き、背景、時間帯、感情を書きます。この2つを明確に分けておけば、カットごとに人物の記述が微妙に変わる事故を防げます。
記述の順序を統一する
プロンプト内の語順も統一します。一般的には、ショットサイズ → 被写体 → 外見 → 衣装 → 動作 → カメラ → 照明 → 背景 → スタイルの順で書くと、モデルが安定して解釈しやすくなります。順序を毎回変えると、同じ内容でも結果が変わります。
ネガティブ指定の活用
避けたい要素はネガティブ側にまとめます。顔の崩れ、指の本数の異常、余分な手足、文字の混入、過度なぼかし、彩度の跳ね上がりなどが定番です。ただしネガティブ指定を盛りすぎると、画面全体が硬直的になります。5〜10項目程度に絞るのが実用的です。
カメラと照明の言語化
「映画的な照明」といった曖昧な表現は、カットごとに解釈がぶれます。「左前方45度からのソフトなキーライト、背景に暖色のリムライト、影は柔らかく」のように、方向と質を具体的に書きます。同じ照明条件をシリーズ全体で使い回すと、それだけで統一感が生まれます。
ポストプロダクションでの統一処理
生成しただけでは揃わない差分を、仕上げ工程で吸収します。
色調の統一
すべてのカットに同じカラールックアップテーブル(LUT)を適用します。ホワイトバランス、コントラスト、彩度を揃えるだけで、別々のモデルで作ったカットが同じ世界の映像に見えてきます。
グレインとシャープネスの統一
モデルごとにノイズの量と輪郭の強調具合が違います。全カットに同じフィルムグレインを薄くかけ、シャープネスを揃えると、質感の差が目立たなくなります。
顔の部分差し替え
どうしても顔が崩れたカットは、基準フレームから顔のパーツだけを合成する方法があります。静止画であれば画像編集で、動画であればフレーム単位のトラッキングで適用します。すべてのカットでやる必要はなく、目立つ1〜2カットを救うだけで完成度が上がります。
音声とリップシンクの同期
トーキングヘッドを使う場合、音声の波形と口の動きを必ず確認します。日本語は母音の口の開きが少ないため、英語向けの設定のままだと口が大きく動きすぎることがあります。口の開き具合を調整できるツールでは、控えめな設定から試します。
よくある失敗と対策
失敗1:カットごとに髪型が変わる。 参照画像に後ろ姿がなく、モデルが想像で埋めているケースです。背面の参照を追加し、髪の長さと分け目をプロンプトの固定ブロックに明記します。
失敗2:照明が変わると顔が変わる。 照明条件ごとに参照画像を用意し、同じ照明設定を連続するカットで使い回します。
失敗3:動きをつけると顔が溶ける。 モーション強度を下げ、顔のアップでは動きを最小限にします。動きの大きいカットは引きのショットに逃がします。
失敗4:アップと引きで別人になる。 全身の参照画像を用意し、引きのショットでは顔の細部より体型とシルエットの一致を優先します。
失敗5:色味がカットごとに違う。 仕上げで共通のLUTを適用します。生成段階で色を揃えようとすると試行回数が増え、かえって非効率です。
失敗6:参照画像を増やしすぎて無個性になる。 参照は10〜15枚に絞り、矛盾する画像を排除します。
失敗7:シード固定に固執してモデル更新で破綻する。 シードは記録として残しつつ、参照画像とプロンプトのほうを主軸にします。
チームで運用するためのルール設計
複数人で制作する場合、個人の工夫ではなく仕組みとして一貫性を守る必要があります。
命名規則とバージョン管理
キャラクター名、カット番号、バージョン、使用モデル、日付をファイル名に含めます。例えば「hero_c003_v02_modelA_0212」のような形式です。どのカットがどの条件で作られたかが追えるだけで、再現にかかる時間が大幅に減ります。
アセットの共有場所
参照画像セット、キャラクターシート、プロンプトの固定ブロック、LUTファイルを一箇所にまとめます。担当者が変わっても同じ素材にたどり着けることが重要です。
レビュー工程の分割
「顔の一致」と「動きの自然さ」と「色調」を別々のレビューで確認します。一度に全部を見ようとすると、どれも中途半端な指摘になります。
変更の記録
参照画像を差し替えた、プロンプトの固定ブロックを変えたといった変更は、必ず記録します。後から「途中から顔が変わった」と気づいたとき、原因を特定できるかどうかがこの記録にかかっています。
よくある質問
Q. 一貫性を保つには、結局ひとつのモデルに絞るべきですか。
シリーズ全体をひとつのモデルで通せればそれが最も安定します。ただし、動きの自然さ、ライティングの再現、解像度など、苦手分野は必ず出ます。その場合は「顔を作る工程」「動きをつける工程」「仕上げる工程」で役割を分け、顔の基準を常に同じ参照画像に固定するのが実用的です。
Q. 参照画像は何枚が適切ですか。
10〜15枚が扱いやすい目安です。正面、斜め、横、背面、全身、表情差分、照明差分、衣装差分を網羅し、それ以上は増やさないほうが安定します。
Q. シード値を固定すれば同じ人物になりますか。
同一モデル・同一バージョン・同一設定であれば効果がありますが、モデル更新や解像度変更で意味を失います。参照画像とプロンプトの固定ブロックを主軸にし、シードは補助として扱うのが安全です。
Q. 顔だけ別のツールで作るのはアリですか。
有効な方法です。顔の生成に強いツールで基準フレームを作り、動きは別のツールに任せ、最後に合成する分業は現場でよく使われます。工程が増える分、色調と解像度の統一を丁寧に行う必要があります。
Q. どのくらいの尺から一貫性の問題が顕著になりますか。
15秒を超えたあたりから、視聴者はカット間の差分に気づきやすくなります。30秒以上の作品では、参照画像セットと固定プロンプトの運用を最初から前提にしたほうが安全です。
Q. 予算と時間が限られている場合、どこを優先すべきですか。
優先順位は、参照画像セットの整備、プロンプトの固定ブロック化、共通LUTの適用の3つです。この3つは追加の生成コストがほとんどかからず、効果が大きい工程です。モデルを増やすより、まずこの3つを固めることをおすすめします。
まとめ:一貫性は「設計」で作る
アバターの一貫性は、優れたモデルを探し当てることで得られるものではありません。参照情報を整え、モデルの役割を決め、プロンプトを固定し、仕上げで差分を吸収する。この一連の設計を丁寧に積み上げた結果として得られるものです。
最初は手順が多いように感じますが、一度テンプレート化してしまえば、2本目以降の制作は驚くほど速くなります。新しいモデルが登場しても、参照画像セットと固定プロンプトという土台があれば、差し替えは容易です。技術の変化に振り回されない制作基盤を、ぜひ自分のワークフローとして育てていってください。



