なぜAI動画でキャラクターの一貫性が崩れるのか
AI動画生成の精度は急速に上がり、短いクリップであれば驚くほど自然な映像が数分で作れるようになった。ところが、同じ人物を3ショット、5ショットと続けて登場させた瞬間に、顔の輪郭が変わり、髪の長さが揺れ、服装のディテールが別人のように入れ替わる。この「なんとなく別人になっていく」現象は、現場ではジェネレーション・ドリフトやキャラクター・ドリフトと呼ばれ、シリーズコンテンツやブランド映像を作るうえで最も厄介な問題であり続けている。
原因は単純ではない。画像生成モデルも動画生成モデルも、テキストや参照画像を潜在空間と呼ばれる高次元の数値空間に変換し、そこから映像を復元している。この空間では「笑顔の男性」といった意味的な情報と、実際の目鼻立ちのピクセル配置は非線形に対応しており、モデルが変われば同じプロンプトでも解釈が変わる。つまり、キャラクターの同一性は1つの数値では表現できず、複数の手がかりを組み合わせて初めて安定する。
この記事では、特定のサービスに依存しない形で、AI動画におけるキャラクター維持の考え方と手順を整理する。参照画像の作り方、テキストによる定義、ツールの使い分け、編集での底上げ、失敗の切り分け方までを一通り扱うので、ショート動画シリーズでも長尺のストーリー映像でも応用できるはずだ。
モデルごとに異なる「顔の解釈」
同じプロンプトを別のモデルに渡すと、結果は驚くほど違う。あるモデルは丸顔で柔和な人物を出力し、別のモデルは面長で彫りの深い人物を返す。これは学習データの偏りと、テキストと画像を結び付けるエンコーダの特性によるもので、プロンプトをどれだけ細かく書いても完全には制御できない。
したがって、複数モデルをまたぐ制作では「文章で指定する」より「画像で固定する」ほうが圧倒的に安定する。テキストは補助、画像は基準。この優先順位を最初に決めておくだけで、後工程の手戻りが大きく減る。
シード値だけでは足りない理由
シードを固定すれば同じ顔になる、という説明をよく見かける。しかしこれは同じモデル・同じプロンプト・同じ解像度という条件下での話である。構図が変わればノイズの配置も変わり、顔のパーツは別の位置に再構成される。ましてやモデルを切り替えた時点で、シード値の意味はほぼ失われる。シードは再現性の補助輪であって、キャラクター定義そのものではない。
崩れが起きやすい5つの場面
経験上、崩れは次の場面に集中して発生する。
- 顔のアップから引きのショットへ切り替わるとき
- 横顔や後ろ姿など、参照にない角度を要求したとき
- 手や小物を持たせたとき
- 激しい動きやモーションブラーが入るとき
- 照明が大きく変わる夜間・逆光のシーン
これらはすべて「情報が不足する瞬間」である。モデルは不足を埋め合わせるために学習データの平均的な顔を呼び出してしまう。対策は、事前に情報を補うか、そもそもそのショットを避ける設計にすることのどちらかだ。
キャラクター一貫性を支える3つの柱
一貫性は魔法のボタンで得られるものではない。設計・生成・仕上げという3つの層で支える構造物だと考えると整理しやすい。どれか1つが欠けると、他の2つにしわ寄せがいく。
柱1:参照画像セット
単一の1枚ではなく、角度・表情・照明を変えた5〜15枚の参照セットを用意する。これがキャラクターの身分証になる。顔のアップ、バストアップ、全身、左右の斜め45度、笑顔と真顔、室内と室外の光。できれば衣装違いも2パターン入れておくと、後から差し替えが効く。
参照画像は「美しい写真」である必要はない。むしろ、情報量が多いことのほうが重要だ。髪の分け目、眉の形、耳の形、首の長さ、肩幅、指の長さといった、文章では伝えにくい要素が写り込んでいるほど強い。
柱2:キャラクターシート
画像だけでは性格や話し方、立ち居振る舞いは伝わらない。年齢、体型、髪色と瞳の色、肌のトーン、服装の素材、アクセサリーの位置、話し方の癖、姿勢の癖などを箇条書きにした1枚のドキュメントを用意する。これはプロンプトの部品であり、同時にチーム内の共通認識にもなる。
ポイントは、形容詞を減らして名詞を増やすこと。「優しそうな人」ではなく「口角が上がり気味、目尻に薄い皺、眉はやや太めで直線的」と書く。モデルにも人間にも解釈の余地が少ない表現のほうが、再現性が高い。
柱3:ポスト処理と編集
生成した映像をそのまま並べるだけでは、色調や粒子感の違いで別作品のように見える。カラーグレーディング、粒子、レンズ歪み、フレームレートの統一といった編集工程が、見た目の連続性を大きく底上げする。ここを省くと、どれだけ顔が一致していても「別々の素材感」が残ってしまう。
特に効果が大きいのは、全ショットに共通のルックを適用する工程だ。同じLUTを薄くかけ、同じ粒子を乗せ、同じシャープネスを揃える。これだけで視聴者は「同じ世界の出来事」として受け取りやすくなる。
参照画像セットの作り方
参照セットの品質は、そのまま最終的な一貫性の上限になる。逆に言えば、ここに時間をかければ後工程の苦労は激減する。目安として、30秒の縦型ショートなら2〜3時間、シリーズ前提なら半日をここに投じる価値がある。
必要なアングルと表情の数
最低限そろえたいのは次の6種類だ。
- 正面のバストアップ(真顔)
- 正面のバストアップ(笑顔)
- 左右それぞれの斜め45度
- 真横のプロファイル
- 全身の立ち姿
- やや見下ろし気味のアングル
余裕があれば、後ろ姿、座った姿勢、会話中の口の開いた表情、手を顔の近くに置いた構図も追加する。動画では顔の角度が連続的に変わるため、静止画の参照は「補間の材料」として使われる。両端の角度がそろっているほど、中間の角度も安定する。
実写で撮るかAIで作るか
実在の人物をモデルにする場合は、実写で参照を撮るのが最も確実だ。スマートフォンでも、窓からの自然光で正面と斜めを撮れば十分機能する。レンズ歪みを避けるため、広角過ぎない設定で、顔から1.5〜2メートル離れて撮るのがよい。
架空のキャラクターの場合は、まず画像生成で基準となる1枚を作り、それを起点に角度違いを生成していく。このとき、一度に多くのバリエーションを出そうとすると顔がばらつくので、1枚ずつ確認しながら進める。採用した画像は必ず別フォルダに保存し、後から上書きしないようにする。
前処理で整えるべき項目
- 背景は可能なら単色またはシンプルなものに置き換える
- 解像度は長辺1024〜2048ピクセルに統一する
- 顔が画面の30〜60パーセントを占めるようにトリミングする
- ファイル名は front_smile_01.png のように内容が分かる形式にする
- 色温度をそろえ、極端に黄色い写真や青い写真を混ぜない
前処理を怠ると、参照画像そのものの色や構図の差がノイズとして学習され、生成結果が不安定になる。地味な作業だが、ここが一貫性の土台になる。
キャラクターシートの書き方
キャラクターシートは、参照画像を補完するテキストの設計図だ。1枚のMarkdownファイルか表計算シートで管理し、プロジェクトごとに複製して使う。
固定する項目と揺らしてよい項目
一貫性の鍵は、固定する項目と揺らす項目をあらかじめ分けておくことだ。
固定する項目の例:顔の骨格、肌のトーン、髪色と長さ、瞳の色、年齢感、体型、声質(ナレーションを使う場合)。
揺らしてよい項目の例:衣装、小物、髪型のアレンジ、メイクの強さ、背景、季節、照明の色。
この線引きをしておかないと、「衣装を変えたら顔まで変わった」という事故が起きる。逆に、揺らしてよい項目をあえて毎回変えることで、同じ人物がさまざまな状況に置かれているという説得力が生まれる。
プロンプトのテンプレート例
実際のプロンプトは、固定ブロックと可変ブロックに分けて書くと管理しやすい。
固定ブロックの例:30代前半の女性、肩までの黒髪を右分け、切れ長の目、薄いそばかす、首がやや長い、自然な肌の質感、中性的な照明。
可変ブロックの例:白いシャツに紺のジャケット、夕方のオフィス、窓から差し込むオレンジの光、中景、ゆっくり歩く。
この2つを毎回連結して使う。固定ブロックは絶対に語順を変えないこと。語順が変わるとモデルが受ける重みも変わり、顔つきが微妙にずれる。
ネガティブ指定の考え方
ネガティブ指定は、崩れのパターンが分かってから足すほうがよい。最初から大量に指定すると、モデルの表現力まで削ってしまう。よく使うのは、顔の左右非対称、過度な美肌加工、プラスチックのような肌、指の本数の誤り、二重の輪郭、余分な手足などだ。
シリーズ制作では、ネガティブ指定もキャラクターシートに書き残し、全ショットで同じものを使う。ショットごとに変えると、それだけで別人物に見え始める。
ツール別ワークフローの比較
ここからは実際のツール選びについて整理する。重要なのは「どのツールが優れているか」ではなく「自分の制作体制に合っているか」だ。
画像生成ベースのアプローチ
Stable Diffusion系やFlux系の画像生成モデルでキーフレームを作り、それを動画生成モデルに渡す方法。最も制御が効きやすく、参照画像の活用や追加学習との相性もよい。ComfyUIのようなノードベースの環境を使えば、参照画像の適用、構図の固定、顔のディテール補正を1つのフローにまとめられる。
欠点は学習コストの高さだ。ノードの組み方、モデルの選定、VRAMの管理など、覚えることが多い。ただし一度テンプレートを作れば、その後の量産効率は圧倒的に高い。
動画生成特化型モデル
Runway、Kling、Luma、Pika、Sora系といった動画生成に特化したツールは、テキストと参照画像から直接映像を生成できる。操作が簡単で、モーションの自然さやカメラワークの表現力が高い。
一方で、参照画像の扱いはツールごとに差が大きい。1枚しか受け付けないもの、複数枚を受け付けるもの、参照の強度を数値で指定できるものなどさまざまだ。複数参照に対応しているツールを選ぶと、一貫性の作業がかなり楽になる。
アバター・リップシンク系
決まった人物が話す映像を作るなら、アバター系ツールやリップシンク系のツールが強力だ。1枚の顔写真から口の動きを生成できるため、顔の同一性はほぼ自動で担保される。ナレーション付きの解説動画、バーチャルプレゼンター、教育コンテンツと相性がよい。
ただし、体の動きやカメラアングルの自由度は低い。全身を使ったアクションシーンには向かないため、用途を割り切って使うのが正解だ。
追加学習で固める方法
同じキャラクターを何十ショットも使う長期プロジェクトでは、LoRAなどの軽量な追加学習でキャラクターをモデルに覚えさせる方法が有効だ。10〜30枚の良質な参照画像を用意し、過学習を避けるためにステップ数を調整する。
この方法の利点は、プロンプトに長い説明を書かなくても顔が安定すること。欠点は、モデルを切り替えると学習をやり直す必要があることだ。短期の案件では過剰投資になりやすい。
選び方の判断基準
- ショット数が5以下:動画生成特化型ツールで十分
- ショット数が10〜30:画像生成ベースでキーフレームを固める
- ショット数が50以上:追加学習を検討する
- 人物が話すだけ:アバター・リップシンク系で完結させる
- 実写素材と混ぜる:グレーディング工程を最初から計画に入れる
迷ったら、いきなり高機能な構成にせず、最小構成で1本作ってみることを勧める。実際に手を動かすと、どの工程が自分のボトルネックなのかが見えてくる。
ショット設計と編集で一貫性を守る
生成の工夫だけで一貫性を守ろうとすると限界が来る。撮影設計と編集の段階でカバーする発想が重要だ。
カット割りで情報を補う
人間の目は、顔が短時間しか映らないショットでは細部を検証しない。逆に、5秒以上続く顔のアップではわずかな違いも気づかれる。したがって、次のような設計が有効だ。
- 顔のアップは1〜2秒に抑え、手元や背景で語る
- 重要な台詞は正面のバストアップで、短く
- 角度が変わるショットは影や逆光で輪郭を柔らかくする
- 同じ人物の連続ショットの間に、物や風景のカットを挟む
これはごまかしではなく、映像文法として正当な手法である。観客の注意をどこに向けるかを設計することが、結果的に一貫性の知覚を支える。
色調・粒子・フレームレートの統一
全ショットに同じルックを適用する。コントラスト、彩度、ハイライトの色味、シャドウの持ち上げ量をそろえ、粒子を薄く均一に乗せる。フレームレートも24fpsまたは30fpsのどちらかに統一する。
ここで有効なのは、基準ショットを1つ決めて、それをリファレンスに他のショットを合わせる方法だ。数値で覚えるより、目で見て合わせるほうが速く、破綻も少ない。
つなぎの技術
ショット間のつなぎでは、以下のいずれかを使うと違和感が減る。
- 動作の途中で切る(歩き始め、振り向きの途中)
- 同じ構図で背景だけ変えるマッチカット
- 手前の物体で画面を覆って切り替えるワイプ
- 短い暗転や光のフレアを挟む
特に「動作の途中で切る」は効果が高い。人間の脳は動きの連続性で人物を同定するため、静止した状態で切り替えるより自然につながる。
よくある失敗と対処法
顔は一致するのに服装が変わる
服の記述が毎回わずかに違うことが原因だ。カラー、素材、襟の形、ボタンの数まで固定ブロックに書き、可変にするのは「上に羽織るもの」だけに限定する。
動きが大きいショットで崩れる
動きの激しいショットでは、フレーム間で顔の位置が大きく動き、参照情報が薄まる。対策は、動きを2段階に分けること。まず小さな動きで生成し、それを編集で速度調整して激しく見せる。
長尺で徐々に別人化する
30秒を超えると、後半ほど顔が平均化していく。対策として、シーンごとに参照画像を再適用し、区切りのいいところで一度生成をリセットする。前のショットの最終フレームを次の中間参照として渡す方法も有効だ。
手・小物・背景の破綻
顔に注意が集中しがちだが、手や小物の破綻は一貫性の印象を大きく損なう。手は参照画像に含めておき、小物は色と形をキャラクターシートに記載する。背景は別レイヤーで合成する前提で設計すると、後からの修正が容易になる。
制作パイプライン実例:30秒の縦型ショート
ここでは、台詞なし・BGMとテロップのみの30秒縦型ショートを作る想定で、工程を具体化する。
プリプロダクション
- キャラクターシートを作成する(30分)
- 参照画像を8枚そろえ、前処理する(2時間)
- 6〜8カットの絵コンテを書き、各カットの尺を決める(45分)
- 固定ブロックと可変ブロックを分けたプロンプトを用意する(30分)
生成フェーズ
まず基準となるキーフレームを各カットにつき2〜3案生成し、最も顔が安定しているものを選ぶ。次に、選んだキーフレームを動画生成に渡し、3〜5秒のクリップを作る。1カットにつき2〜3テイク試し、最も自然なものを採用する。
このとき、各テイクのプロンプトと使用した参照画像をメモに残す。後で崩れたときに原因を追えるからだ。
仕上げと書き出し
採用クリップをタイムラインに並べ、尺を整える。共通ルックを適用し、テロップとBGMを載せる。最後に通しで再生し、顔の変化が気になる箇所だけ部分再生成する。
レビューの観点
通しで見るときは、次の順にチェックする。
- 最初の3秒で人物が印象づけられているか
- カットが変わるたびに顔の印象が跳ねていないか
- 色調がカットごとに揺れていないか
- 手と小物が破綻していないか
- 最後のショットが最初と同じ人物に見えるか
シリーズ運用のためのチェックリスト
1本作って終わりではなく、シリーズとして続けるなら、再現できる仕組みが必要になる。
ショット単位のチェック
- 参照画像セットは最新版を使ったか
- 固定ブロックの語順を変えていないか
- ネガティブ指定は共通のものを使ったか
- 生成ログを残したか
エピソード単位のチェック
- 全カットに共通ルックを適用したか
- フレームレートと解像度がそろっているか
- 衣装の連続性(前話とのつながり)は保たれているか
- 声や話し方のトーンが一定か
ナレッジを残す
うまくいったプロンプト、失敗したパターン、使用した参照画像の組み合わせを記録しておく。シリーズが長くなるほど、この記録が資産になる。特に「どの角度の参照を足したら安定したか」という知見は、次のキャラクターを作るときにそのまま流用できる。
よくある質問
無料のツールだけでも一貫性は保てる?
保てるが、条件がある。参照画像を丁寧にそろえること、ショット数を絞ること、顔のアップを短くすること。この3つを守れば、無料枠のツールでも驚くほど安定する。逆に有料ツールでも、参照画像が1枚だけでは崩れる。
参照画像は何枚必要?
最小は6枚、推奨は10〜15枚。角度の両端(真横と正面)がそろっていることが最も重要で、枚数よりバリエーションの質が効く。同じような正面写真を10枚集めても意味は薄い。
実写とAIを混ぜてもよい?
問題なく混ぜられる。ただし、生成側の解像度、粒子、被写界深度を実写側に寄せる必要がある。逆に実写側に軽い粒子を乗せて寄せる方法もある。どちらに合わせるかを最初に決めておくと、後半で破綻しない。
崩れたときのリカバリ手順は?
まず原因を切り分ける。顔が違うなら参照画像、服が違うならプロンプト、動きが不自然ならモーション設定。切り分けができたら、変更する変数を1つだけにして再生成する。複数を同時に変えると、何が効いたのか分からなくなる。
権利面で気をつけることは?
実在の人物をモデルにする場合は、用途と公開範囲を明確にしたうえで許諾を得る。著名人に似たキャラクターを商用利用するのは避ける。生成物の利用条件はツールごとに異なるため、公開前に必ず確認しておきたい。
まとめ:一貫性は設計で決まる
AI動画でキャラクターを維持する作業は、派手さのない地道な工程の積み重ねである。参照画像をそろえ、キャラクターシートを書き、固定する項目と揺らす項目を分け、ショット設計と編集で見え方を整える。どれも単独では決定的な効果を生まないが、組み合わせると驚くほど安定する。
最初から完璧を目指す必要はない。まず1本、6カットの短い動画を作ってみてほしい。そして、どのカットで崩れたかを記録する。その記録こそが、次の作品で一貫性を守るための最も実用的な地図になる。技術は日々更新されるが、設計の考え方は変わらない。モデルが変わっても使えるワークフローを、自分の手で作っていこう。


