AI動画でキャラクターが崩れる根本原因
生成AIによる動画制作で、最初にぶつかる壁は画質ではありません。「同じ人物が、どのカットでも同じ人物に見え続けるか」という一貫性の問題です。1カット目では黒髪のショートヘアだった人物が、3カット目では髪が肩まで伸び、5カット目では目の色が変わり、10カット目では顔の骨格そのものが別人になっている。この現象は、生成モデルが「人物」を概念として理解しているのではなく、テキストと画像の統計的な対応関係からピクセルを再構成しているために起こります。
より正確に言えば、拡散モデルは各フレームを独立した確率過程として描画します。前のフレームの情報を暗黙に引き継ぐ仕組みはありますが、それは「似ている」ことを保証するだけで、「同一である」ことを保証しません。カメラアングル、照明、背景、服装、ポーズが変わるたびに、モデルは与えられた条件に最も合致するピクセル配置を新しく計算し直します。その結果として、視聴者には「微妙に別人」という違和感が残ります。
さらに厄介なのは、崩れ方が段階的であることです。1カット単位で見ると許容範囲に見えても、30秒の動画を通して見ると、顔の輪郭、目の間隔、髪のボリューム、肌のトーンが少しずつドリフトしていきます。この累積的なズレは、静止画の比較では気づきにくく、動画として再生したときに初めて「別人化」として知覚されます。
原因を分解すると、大きく4つに整理できます。第一に、テキストプロンプトには「同一人物」を指定する語彙が存在しないこと。第二に、参照画像を使う場合でも、どの特徴をどれだけ優先するかの制御が曖昧になりやすいこと。第三に、シーン条件(照明・レンズ・衣装)が変わると、モデルがアイデンティティよりもシーン条件を優先してしまうこと。第四に、画像から動画へ変換する段階で、動きの生成が顔の形状をわずかに歪めることです。
この記事では、これら4つの原因に対して、参照アセットの設計、マルチイメージ融合による条件付け、モデル選定の判断基準、ショット設計、品質チェックの順に、実務で再現性のあるワークフローとして整理します。特別な環境は必要ありません。画像生成ツール、動画生成ツール、そして整理されたアセットフォルダがあれば始められます。
一貫性の土台になる参照アセットの設計
一貫性の8割は、生成を始める前の準備で決まります。プロンプトの工夫よりも、参照アセットの質と構造のほうが結果に与える影響は大きいです。ここでは、キャラクターを「固定できる対象」に変えるための設計手順を説明します。
三面図と表情差分を先に作る
最初に用意すべきは、正面・斜め45度・横顔の3方向のバストアップ画像です。これに全身の立ち絵を加えると、体型の再現精度が上がります。重要なのは、3方向の画像が同一の照明条件・同一のレンズ感・同一の背景で作られていることです。片方が逆光、片方が順光であれば、モデルは「照明の違い」と「顔の違い」を区別できず、平均化された曖昧な顔を出力します。
次に、表情差分を4〜6種類用意します。無表情、微笑み、驚き、怒り、悲しみ、真剣な表情の6種があれば、ほとんどのシーンに対応できます。表情差分は、顔のパーツ配置を固定したまま筋肉の動きだけを変えるための参照です。これがないと、笑顔のシーンで「笑っている別の人」が生成されやすくなります。
背景は無地のグレーか白に統一し、アクセサリは外した状態と装着した状態の両方を用意します。眼鏡、帽子、イヤリング、ネックレスなどは、シーンによって有無が変わるため、両方のバリエーションがあると後工程で混乱しません。
言語化できる要素と言語化できない要素を分ける
参照アセットと同時に、テキストで管理するパラメータ表を作ります。髪色のカラーコード、瞳の色、肌のトーン、身長に対する頭部の比率、肩幅、髪の長さ(cm単位ではなく「鎖骨下」などの相対表現)、衣装の素材感、靴の形状。これらは数値や短いフレーズで記述できるため、プロンプトに毎回同じ文言で埋め込めます。
一方で、言語化が難しい要素もあります。顔の「雰囲気」、目の「鋭さ」、笑ったときの「口角の上がり方」などです。これらはテキストではなく、参照画像の重み付けで制御します。プロンプトだけで顔立ちを指定しようとすると、抽象語の解釈がモデルごとにばらつき、かえって不安定になります。
パラメータ表は、キャラクター名、バージョン番号、作成日、参照画像のファイル名をセットで記録します。シリーズ制作では、キャラクターの設定が途中で微修正されることが必ずあります。バージョン管理がないと、どのカットがどの設定に基づいているか追跡できなくなります。
マルチイメージ融合でアイデンティティを固定する
参照アセットが揃ったら、次はそれを生成プロセスに組み込みます。テキストプロンプトだけに頼らず、複数の参照画像を条件として同時に与える手法が、現在の一貫性確保の中心的なアプローチです。
参照画像の枚数と重み付けの目安
実務的には、3〜5枚の参照画像を併用するのが扱いやすいバランスです。内訳の目安は、顔のクローズアップ1枚、別アングルのバストアップ1枚、全身1枚、衣装のディテール1枚です。5枚を超えると、モデルが各画像の共通点を平均化し始め、特徴が薄まることがあります。特に顔の輪郭や目の形は、平均化の影響を受けやすい部位です。
重み付けについては、「顔のクローズアップを最も強く、全身を中程度、衣装を弱め」に設定するのが基本です。全身の重みを強くしすぎると、顔のディテールが体型情報に押し出されて平坦になります。逆に顔の重みを強くしすぎると、構図がクローズアップに引っ張られ、引きのカットで顔が過剰に拡大されることがあります。
画像から動画へ変換するときの維持テクニック
静止画で一貫したキャラクターが作れても、動画化の段階で崩れることがあります。これを抑えるには、いくつかの実践的な工夫が有効です。
第一に、動きの強度を下げます。モーション量を最大化すると、フレーム間の変形が大きくなり、顔のパーツ配置がドリフトします。歩行や振り向きのような大きな動きは、動きの強度を中程度に保ち、カットを短く分割して繋ぐほうが結果が安定します。
第二に、最初と最後のフレームを固定します。開始フレームと終了フレームを明示的に指定すると、モデルはその2点を結ぶ補間として動きを生成するため、アイデンティティの逸脱が抑えられます。特にセリフのあるシーンや、カメラが寄るシーンで効果的です。
第三に、顔のアップを定期的に挟みます。3〜4カットに1回、顔のクローズアップを入れると、視聴者の記憶がリセットされ、多少のドリフトが知覚されにくくなります。これは編集上の工夫でありながら、一貫性の体感を大きく改善します。
第四に、乱数のシード値を固定します。同じシードと同じプロンプト、同じ参照画像の組み合わせは、ほぼ同じ出力を再現します。シーンごとにシードを変える場合は、変更した要素を1つずつ記録しておくと、崩れた原因を切り分けやすくなります。
モデル選定の判断基準
一貫性はモデルの性能だけで決まるわけではありませんが、用途とモデルの相性は大きく影響します。ここでは、シーンや画風に応じた選び方を整理します。
実写系・アニメ系・様式化の使い分け
実写調の表現を求める場合、肌の質感や毛穴、髪の一本一本を再現できるモデルが適しています。ただし、これらのモデルは顔のディテールを細かく描き分ける反面、照明条件の変化に敏感で、シーンをまたぐと顔の陰影が変わりやすいという特性があります。対策として、全カットで光源の方向と強さを統一するプロンプトを必ず添えます。
アニメ調やイラスト調の場合、線の太さ、目や髪のデフォルメ比率が重要になります。この領域では、参照画像の影響が非常に強く出るため、参照アセットの線質を最初に固めておくことが決定的に重要です。逆に、参照が曖昧だとデフォルメの度合いがカットごとにばらつきます。
様式化された表現、たとえばドット絵調、ブロック玩具調、切り絵調、レトロゲーム調などは、実は一貫性の確保が最も容易な領域です。形状が単純化されているため、アイデンティティを構成する要素が少なく、色とシルエットで同一性を保てます。シリーズ制作の初期段階で、あえて様式化を選ぶのは、一貫性リスクを下げる合理的な判断です。
モデルをまたぐときの手順
1本の動画の中で複数のモデルを使うことは珍しくありません。たとえば、人物のアップは実写系モデル、背景の俯瞰は別モデル、エフェクトシーンはさらに別モデルという構成です。このとき、モデルを切り替えるたびにキャラクターが変わるリスクがあります。
対策はシンプルです。切り替え前に、前モデルで生成した「基準フレーム」を1枚確定し、それを次モデルの参照画像として渡します。つまり、テキスト仕様書ではなく画像そのものをバトンにしてリレーします。この方法なら、モデル間の解釈差を画像が吸収してくれます。
もう一つのコツは、切り替えを目立たないカットで行うことです。視線が別方向を向いている瞬間、手元のアップ、シルエットのカットなど、顔が大きく映らないタイミングでモデルを変えると、視聴者は変化に気づきません。
ショット設計で一貫性を守る
一貫性は生成だけでなく、演出でも守れます。むしろ、演出で守れる部分のほうが大きく、生成の失敗をカバーできます。
照明とレンズの連続性を固定する
同じシーンの中で、カットごとに光源の方向が変わると、視聴者は無意識に「別人」と感じます。逆光のカットの次に順光のカットを置くと、たとえ同じ顔でも連続性が失われます。シーンごとに「光源の方向・高さ・色温度」を1セット決め、全カットで同じ記述を使います。
レンズ感も同様です。広角で顔を撮ると鼻が大きく写り、望遠で撮ると顔が平坦になります。同じ人物でもレンズによって顔の印象は変わります。シーン内では焦点距離の印象を統一し、レンズを変える場合はカットの切り替わりとして明示的に扱います。
視線とポーズで記憶を補強する
人間の記憶は、顔そのものよりも「特徴的な動作」に強く結びつきます。特定の仕草、たとえば髪をかき上げる、首を少し傾ける、右手で頬を触るといった動作をキャラクターのシグネチャーとして設定し、各カットに1回ずつ入れると、視聴者は顔の微妙な差を補正して「同じ人物」として認識します。
衣装も同じ役割を果たします。シーンをまたいでも変わらない要素(たとえば赤いスカーフ、特定の柄のシャツ)を1つ決めておくと、それだけで同一性のアンカーになります。逆に、全カットで衣装が変わると、顔が完璧でも別人に見えます。
実践ワークフロー:15秒の縦型ショートを作る
ここまでの要素を、実際の制作手順に落とし込みます。15秒・縦型・5カットの構成を例にします。
手順1:コンセプトとカット割りを決める。 5カットそれぞれについて、画面サイズ(アップ/バストアップ/全身)、動き、背景、セリフの有無を書き出します。この時点で、顔が大きく映るカットを2つまでに抑えると難易度が下がります。
手順2:参照アセットを生成する。 三面図、表情差分6種、全身、衣装ディテールを用意します。この工程に時間をかけるほど、後工程が短くなります。目安として、参照アセット作成に全体工数の3割を割り当てます。
手順3:キービジュアルを1枚確定する。 全カットの中で最もキャラクターらしさが出る1枚を作り、これを「基準画像」として保存します。以降のすべての生成は、この1枚を参照に含めます。
手順4:カットごとに静止画を生成する。 各カットの構図を静止画で確定させます。動画にしてから直すより、静止画段階で顔を揃えるほうが修正コストは圧倒的に低くなります。
手順5:画像から動画へ変換する。 動きの強度を中程度に設定し、開始フレームと終了フレームを指定します。カメラワークは1カットにつき1種類(寄る、引く、横に流れる、固定)に限定します。複数の動きを同時に指定すると崩れやすくなります。
手順6:つなぎを調整する。 カット間に0.2〜0.4秒のつなぎを入れ、必要に応じてクロスディゾルブを使います。急な切り替えはアイデンティティの差を強調するため、ソフトなつなぎが有効です。
手順7:色調整で統一する。 全カットに同じカラーグレーディングを適用します。トーンカーブと彩度を揃えるだけで、生成時のわずかな色差が目立たなくなります。
手順8:音を入れて通しで確認する。 音声やBGMを載せた状態で通しで見ます。無音で見ると気づかなかった違和感が、音が入ると目立たなくなることもあります。逆に、音を入れると顔の揺れが強調される場合もあります。
よくある失敗と対処法
現場で頻出する失敗を、原因と対処の形で整理します。
失敗1:カットごとに顔の輪郭が変わる。 原因は参照画像の照明条件の不一致です。順光と逆光の参照が混在していると、モデルは輪郭を平均化します。対処は、参照を同一照明で撮り直すか生成し直すことです。
失敗2:動かすと顔が歪む。 原因はモーション量の過多です。動きの強度を下げ、カットを短く分割します。また、冒頭と末尾のフレームを固定すると改善します。
失敗3:笑顔だけ別人になる。 原因は表情差分の不足です。無表情の参照だけでは、笑顔の筋肉配置をモデルが推測できません。笑顔の参照を必ず含めます。
失敗4:引きのカットで顔が幼くなる。 原因は全身参照の重みが強すぎることです。全身参照の重みを下げ、顔のクローズアップ参照を追加します。
失敗5:背景が毎回変わる。 原因は背景記述の不足です。背景も参照画像として1枚用意し、構図の参照として渡すと安定します。
失敗6:手や指が崩れる。 これは人物の一貫性とは別の問題ですが、視聴者の注意を引くため一貫性の印象も損ないます。手が映るカットでは、手のアップを参照に加えるか、手を画面外に逃がす構図に変更します。
失敗7:モデルを変えた途端に別人化する。 原因はテキスト仕様だけで引き継いでいることです。前述のとおり、基準フレーム画像をバトンとして渡します。
失敗8:通しで見ると肌のトーンが浮く。 原因はカットごとのホワイトバランスの差です。最終工程で全カットに同一のグレーディングを適用し、肌色を基準に補正します。
品質チェックとレビューの自動化
一貫性は感覚だけでは管理できません。チェックを仕組みにすることで、属人性を減らせます。
チェックリストの運用
各カットについて、次の項目を確認します。顔の輪郭が基準画像と一致しているか。瞳の色と形が一致しているか。髪の長さと分け目が一致しているか。衣装の色と柄が一致しているか。光源の方向が同一シーン内で揃っているか。肌のトーンが前後カットと連続しているか。これらを表形式で記録し、全カット分を並べて確認します。
並べて見る工程を必ず入れる
個別のカットを大きく見るだけでは、ドリフトは発見できません。全カットの顔を同じサイズに切り出し、横一列に並べたコンタクトシートを作ります。このシートを見れば、3カット目だけ目の間隔が広い、といった差異が一目でわかります。修正対象を特定する速度が大幅に上がります。
命名規則とバージョン管理
ファイル名には、プロジェクト名、キャラクター名、カット番号、バージョン、日付を順に含めます。たとえば「proj01_hero_c03_v04」のような形式です。参照画像、生成画像、動画、プロンプトのテキストを同じ命名規則で揃えると、後から別の担当者が引き継いでも迷いません。
チーム制作での運用ルール
複数人で制作する場合、一貫性は技術よりも運用の問題になります。
第一に、参照アセットの正本を1箇所に定めます。共有フォルダでも、アセット管理ツールでも構いませんが、「どれが最新か」が一意に決まる状態を作ります。
第二に、プロンプトのテンプレートを固定します。人物記述、照明記述、レンズ記述、背景記述の順に並べたテンプレートを用意し、担当者は可変部分だけを書き換えます。自由記述を許すと、担当者ごとに語彙がばらつき、出力もばらつきます。
第三に、承認フローを決めます。基準画像の確定、各カットの静止画承認、動画化の承認という3段階を設け、後工程での手戻りを防ぎます。特に静止画段階での承認を省略すると、動画化後の修正が高コストになります。
第四に、権利と利用範囲を記録します。参照画像の生成元、使用したモデル、学習データに関する制約、商用利用の可否をキャラクターごとに台帳化します。シリーズ展開を想定するなら、この記録は後で必ず必要になります。
FAQ
Q. 参照画像は何枚が最適ですか。 顔のクローズアップ、別アングルのバストアップ、全身、衣装ディテールの4〜5枚が実務的な上限です。それ以上増やすと特徴が平均化され、かえって個性が薄まります。
Q. プロンプトだけで一貫性は保てますか。 短期のカットや抽象度の高い画風であれば可能ですが、人物の顔が大きく映るシーンでは限界があります。参照画像による条件付けを併用するのが現実的です。
Q. 一度崩れたカットは修正できますか。 静止画段階なら再生成で対応できます。動画化後に崩れている場合は、開始フレームを差し替えて再生成するのが最短です。全フレームを手作業で修正するより効率的です。
Q. どのくらいの頻度で参照アセットを見直すべきですか。 シリーズの各エピソード開始時と、キャラクター設定に変更があったときに見直します。エピソードをまたぐと、参照の微妙な差が蓄積して別人化が進みます。
Q. 一貫性を優先すると表現の幅が狭くなりませんか。 幅を狭めるのは構図と照明の自由度であり、感情表現や動きの幅は保てます。むしろ制約を固定することで、表情や仕草のバリエーションに集中できます。
Q. 学習型の追加調整は必要ですか。 同一キャラクターを大量に生成する長期プロジェクトでは有効な選択肢です。ただし参照画像による条件付けで十分な精度が得られる場合も多く、まずは参照ベースで試し、不足を感じた段階で検討するのが合理的です。
Q. 動画の長さは一貫性に影響しますか。 影響します。長尺になるほどドリフトが累積します。対策として、カットを短く刻み、顔のアップを定期的に挟み、シーンごとに参照を再適用します。
Q. 低予算でも再現できますか。 できます。高価なツールよりも、参照アセットの設計とカット割りの工夫のほうが結果への寄与が大きいです。まず三面図と表情差分を丁寧に作り、カット数を絞ることから始めてください。
一貫性のある動画制作は、特別な技術の導入ではなく、準備と運用の設計で達成できます。参照アセットを固定し、画像をバトンにしてモデルをつなぎ、ショット設計とチェック工程で崩れを吸収する。この流れを一度型として確立してしまえば、シリーズ制作の速度と品質は安定して上がっていきます。


