キャラクターの一貫性が崩れる本当の原因
AI動画制作で最も多い悩みは「カットが変わった瞬間に別人になる」というものだ。顔の輪郭がわずかに変わり、髪の色が数トーンずれ、衣装のディテールが別物になる。こうした崩れはモデルの性能不足だと思われがちだが、実際の原因はほとんどが制作フローの設計にある。
一貫性は四つの層で決まる。第一層は設計で、キャラクターの特徴をどこまで言語化し、共有できているか。第二層は参照で、入力する画像セットの品質とばらつきの少なさ。第三層は生成で、用途に合ったモデル選びとプロンプトの固定度。第四層は編集で、色調・尺・テンポの統一だ。
この四層のうち一つでも抜けると、後工程でどれだけ修正しても違和感は消えない。顔だけを修正しても、色温度がカットごとに違えば視聴者は別人だと感じる。逆に言えば、四層すべてにルールを置けば、複数の生成モデルをまたいでも同一人物として認識される映像を作れる。
もう一つの落とし穴は「一枚の完璧な基準画像」に頼りすぎることだ。正面の一枚しかなければ、横顔や俯角のシーンでモデルは推測で埋めるしかない。推測が積み重なると、シーンを追うごとに顔が平均化していく。一貫性とは一点の再現ではなく、角度と表情のレンジをカバーする設計だと考えたほうがうまくいく。
制作前の設計:キャラクター設定書を作る
撮影の現場には「キャラクター表」や「衣裳合わせ」がある。AI動画にも同じものが必要だ。ここでは設定書を「キャラクターバイブル」と呼ぶ。テキストで書いた設定は、そのままプロンプトの語彙リストになり、チーム内の共通言語にもなる。
設定書に必ず書く七項目
- 骨格と顔立ち:丸顔か面長か、顎のライン、頬骨の出方、目の間隔、まぶたの厚み。抽象語ではなく比較で書く(例:面長だが顎は角ばらず、頬はやや張っている)。
- 髪:長さ、分け目、前髪の形、毛量、ハイライトの位置、結び方。動きのあるシーンでは毛先の跳ね方まで決めておく。
- 衣装:素材、シルエット、縫い目やボタンの数、アクセサリーの位置。小物は「左手首に細い革ベルト」のように左右まで指定する。
- 色彩:肌・髪・衣装・瞳の基準色を、言葉と近い色名の両方で記録する。編集段階のカラーマッチに効く。
- 演技の癖:話すときに眉を上げる、笑うと片目が細くなる、考えると口角が下がる。短い尺でも人物らしさが出る。
- 声と話速:声質、抑揚、間の取り方。音声を後から乗せる場合も先に決めておく。
- NGリスト:年齢に見えない要素、避けたい髪型、似せたくない既存キャラクター。否定条件はここに集約する。
参照画像は「3系統×4角度」を目安に
設定書と同時に用意したいのが参照画像だ。最低限そろえたいのは、正面・斜め45度・横顔・やや俯角の4角度。さらに表情を「無表情」「微笑み」「驚き」の3系統に分けると、感情の振れ幅に対応できる。合計12枚前後が現実的な出発点になる。
参照画像セットの構築:ばらつきを減らす撮影ルール
参照画像は多いほど良いわけではない。**条件がそろっていない画像は、枚数を増やすほどノイズになる。**同じ人物として扱ってほしいなら、まず撮影条件をそろえる。
ライティングを固定する
同じ光源位置、同じ色温度、同じ光量で撮る。窓明かりと室内灯が混ざった画像を混ぜると、モデルは肌の色そのものを学習対象として扱い、カットごとに肌色が揺れる。屋外なら曇天の拡散光、室内なら正面やや上方の単一光源が扱いやすい。
背景を単純化する
背景が複雑だと、生成時に背景の要素が人物の輪郭へ混ざることがある。参照画像の段階では無地または単色の壁を推奨する。背景を後から合成する前提で作れば、シーンごとの美術を自由に差し替えられる。
解像度と比率をそろえる
参照画像の縦横比がばらつくと、出力のフレーミングも安定しない。縦型の配信を想定するなら参照も縦位置でそろえ、横型の作品なら横位置でそろえる。混在させる場合は、本番の出力比率に合わせた画像だけを使う。
避けたい参照画像の例
- 逆光で顔の半分が影になっている写真
- 強い美肌加工や色調補正がかかった画像
- 手ぶれや圧縮ノイズが目立つ低解像度画像
- サングラスやマスクで顔の主要パーツが隠れた画像
- 極端な広角で顔が歪んだ画像
これらは一見「使えそう」に見えるが、生成結果に癖として残る。迷ったら捨てる判断が結果的に速い。
モデル選定の判断基準:用途別の使い分け
複数の生成モデルを併用する最大の利点は、シーンごとに最適な描画特性を選べることだ。ただし、何でも試すと人物の質感がカットごとに変わって一貫性が壊れる。選定は「作品全体で1つのメインモデル」を決め、サブを例外処理に限定するのが原則になる。
実写寄りの人物表現
肌の質感、毛穴、瞳の反射まで描くタイプのモデルは、ドラマ調や企業VP、リアルなポートレート作品に向く。一方で、同じ人物を何度も生成すると顔の細部がわずかに揺れやすい。参照画像の質と、後述する固定プロンプトの精度が結果を左右する。
アニメ・イラスト調
線の太さや塗りのトーンが安定しているモデルは、アニメ調のシリーズ作品と相性が良い。実写寄りモデルより顔の崩れが目立ちにくい代わりに、線の揺れが「作画崩壊」として目立つ。輪郭線の太さを指定語で固定すると安定する。
モーション制御に強いモデル
歩行、走行、ダンス、カメラワークなど、動きの再現性を重視する場面では、動きの指示を構造的に受け取れるモデルが有利だ。キャラクターの同一性よりも動きの自然さを優先したいシーンで使い、顔のアップは別モデルに任せる分業が現実的。
文化的ニュアンスを扱えるモデル
衣装、調度品、建築、髪型など、地域固有の表現を含む作品では、その文化圏のデータを多く含むモデルのほうが破綻が少ない。逆に、汎用モデルに任せると、伝統衣装の構造が曖昧になり、視聴者に違和感を与える。
選定チェックリスト
| 判断軸 | 確認すること | 見落とすと起きること |
|---|---|---|
| 人物の質感 | 肌・髪の描写が作風に合うか | カットごとに質感が変わる |
| 動きの再現 | 歩行や手振りの自然さ | 手足が不自然に伸びる |
| 構図の安定 | 指定したフレーミングの再現度 | アップとロングが混ざる |
| 表情の幅 | 喜怒哀楽の出しやすさ | 無表情しか作れない |
| 縦横比対応 | 配信先の比率に耐えるか | 端が切れる、余白が出る |
| 再現の安定 | 同じ指示で同じ顔になるか | テイクごとに別人になる |
迷ったら、同じプロンプトと同じ参照画像で3回生成し、顔の一致度を比べる。このテストだけで選定の失敗をかなり減らせる。
ショット設計とキーフレーム管理
一貫性は「生成の瞬間」よりも「どこで切るか」で決まる。長いカットを一発で作ろうとすると、途中で顔が溶けていく。短く切ってつなぐほうが、結果的に安定し、編集の自由度も上がる。
1カットの長さの目安
人物が歩き、話し、表情を変える場合は、まず3〜5秒で切る。アップの表情カットなら2〜3秒でも十分に成立する。長回しにしたい場合も、いったん短い単位で生成し、編集で連続性を補うほうが破綻が少ない。
キーフレームの命名規則
シーンが増えると、どの画像がどのカットに対応するか分からなくなる。命名は「作品名_キャラ名_シーン番号_カット番号_角度_表情」のように固定する。たとえば ep01_aoi_s03_c05_45deg_smile とすれば、フォルダを開いた瞬間にどの参照画像を使うか判断できる。
前後フレームの引き継ぎ
カットNのラストフレームを、カットN+1の参照として使う手法は有効だ。ただし連続でつなぐと色と質感が徐々にドリフトする。3カットに1回は基準の参照画像セットに戻し、軌道修正する。
シーケンス分割の考え方
- シーンを「場所・時間・感情」の3軸で分解する
- 1シーンを3〜6カットに割る
- 各カットに必要な参照画像とモデルを割り当てる
- カット間で衣装と髪型が変わらないことを確認する
この表を先に作っておくと、撮影順を入れ替えても設定が崩れない。
プロンプト設計で一貫性を守る
プロンプトは毎回書き直すのではなく、固定部分と可変部分を分離するのが基本だ。固定部分には人物の身体的特徴、衣装、光の方向、レンズ感を書く。可変部分には表情、動作、カメラの動きを書く。
記述順序のテンプレート
安定しやすい順序は次のとおり。
- 被写体の種別と年齢感
- 顔立ちと髪の描写
- 衣装と小物
- 表情と視線
- 動作とポーズ
- カメラワークと画角
- ライティングと質感
- 除外したい要素
順序を変えると生成結果が変わるモデルもあるため、一度決めた順序は作品内で統一する。
固定する要素と動かす要素
| 区分 | 固定する例 | 動かす例 |
|---|---|---|
| 顔 | 目の形、顎のライン、頬の張り | 眉の動き、口角の角度 |
| 髪 | 長さ、分け目、色 | 風による揺れ、束の落ち方 |
| 衣装 | 素材、色、シルエット | シワの入り方、裾の動き |
| カメラ | 焦点距離の印象 | パン、チルト、ドリー |
固定側を短く、動かす側を具体的に書くのがコツだ。固定側を長くしすぎると、モデルが情報過多で細部を省略し始める。
否定条件の書き方
避けたい要素は最後にまとめて書く。年齢を若く見せたくない、髪を短くしたくない、といった条件を否定語で列挙する。否定条件は増やしすぎると全体の描画が硬くなるため、5項目以内を目安にする。
シードと揺らぎの扱い
同じシードを使えば同じ結果が得られやすいが、動きのあるシーンでは硬直した絵になりがちだ。アップの顔カットはシードを固定し、動きの大きいカットは揺らぎを許容する、という使い分けが現実的。重要なのは、どのカットで固定したかを記録しておくことだ。
モーション・リップシンク・音声の統合
人物が話すシーンは、一貫性が最も問われる場面だ。口の動きと声がずれると、どれだけ顔が似ていても別物に見える。
話すシーンの手順
- 先に音声を確定させる(話速と間が映像の尺を決める)
- 音声の波形に合わせてカットを割る
- 口の動きを生成し、顔のアップを基準モデルで作る
- 首と肩の動きを最小限に抑える(動かすと別人化しやすい)
- 最後にまばたきと視線の動きを足す
特に「首を振る」「肩を揺らす」動作は、顔の輪郭を変形させて別人感を生む。話している間は体幹を固定するほうが安全だ。
歩行・動作のシーン
歩行は全身のプロポーションが露出するため、顔の一致よりも体型の一致が目立つ。身長比、肩幅、脚の長さを設定書に数値で書き、参照画像でも全身カットを用意する。足元の接地と重心移動を指示語で補うと、滑るような不自然さが減る。
カメラワークとの相性
ドリーインやパンは、背景の動きによって人物の静止を演出できる。人物を大きく動かさずにカメラだけを動かすほうが、顔の安定度は高い。逆に、人物がカメラに近づくほど顔の情報量が増え、崩れが目立つ。近づくカットは短く、引きのカットは長く、という配分が安定する。
編集段階で一貫性を守る
生成が終わったあとの編集で、カット間のわずかな差を吸収できる。ここを飛ばすと、せっかくの努力が視聴者には伝わらない。
カラーマッチ
カットごとにホワイトバランスと彩度をそろえる。人物の肌の基準色を1つ決め、全カットをその色に寄せる。色温度が揃うだけで、同じ人物に見える確率は大きく上がる。
コントラストと粒状感
カットごとにコントラストが違うと、別のカメラで撮ったように見える。作品全体に共通のトーンカーブを適用し、粒状感も統一する。片方だけがクリアすぎると、質感の差が目立つ。
尺とテンポ
同じ人物が画面に現れる間隔が空きすぎると、視聴者は前のカットを忘れる。人物の再登場は短い間隔で挟み、印象をつなぐ。逆にテンポが速すぎると、顔の差が確認されにくくなるという利点もある。
差し替えとテイク管理
1カットにつき3テイクを残し、フォルダは「採用・予備・没」に分ける。採用テイクだけを別ディレクトリにコピーしておくと、編集時の迷いが減る。テイク名には生成に使ったモデルと参照画像の番号を残す。あとから同じ条件を再現できるからだ。
品質チェックリストとよくある失敗
公開前に次の項目を確認する。10分で終わる作業だが、視聴者の離脱を大きく減らせる。
- 全カットで髪の分け目が同じ向きか
- 瞳の色とハイライトの位置が一致しているか
- 衣装の小物が左右逆になっていないか
- 肌の色温度がカット間で揺れていないか
- 手や指の本数と関節が破綻していないか
- 背景の消失点と人物の身長比が合っているか
- 声のトーンと口の動きが同期しているか
- 字幕やロゴが顔にかかっていないか
症状別の対処表
| 症状 | 主な原因 | 対処 |
|---|---|---|
| 顔が毎回変わる | 参照画像の条件が不統一 | 光源と角度をそろえて撮り直す |
| 途中で髪色が変わる | 固定プロンプトの欠落 | 髪の記述を冒頭に固定する |
| 手が崩れる | 手の描写が曖昧 | 手を画面外に置く構図に変更する |
| 目線が定まらない | 視線の指示がない | 見る対象を明示する |
| 質感がカットごとに違う | モデルの混在 | メインモデルを1つに絞る |
| 動きがカクつく | 1カットが長すぎる | 3〜5秒に分割する |
| 声と口がずれる | 音声が後決め | 音声を先に確定する |
失敗の多くは「あとで直せる」と考えて工程を飛ばした結果だ。参照画像と音声を先に固めるだけで、修正の手戻りは大幅に減る。
チーム運用・記録・スケールの整え方
一人で作る場合と、複数人で分担する場合では運用が変わる。ここでは規模が大きくなっても崩れないための管理方法をまとめる。
共有するもの
- キャラクター設定書(テキスト)
- 参照画像セット(角度別フォルダ)
- プロンプトの固定テンプレート
- カット表(シーン・尺・使用モデル)
- カラーの基準値
この5点を共有リポジトリに置き、更新履歴を残す。設定を変えたら必ず版番号を上げる。古い版の参照画像で作ったカットが混ざると、そこだけ質感が浮く。
役割分担の例
- 設計担当:設定書とカット表を作る
- 生成担当:ショットごとに生成しテイクを残す
- 確認担当:チェックリストで検品する
- 編集担当:色と尺をそろえて仕上げる
少人数なら兼務で構わないが、「確認」は必ず別の目で行う。自分で作ったカットは崩れに気づきにくい。
試行回数を減らす工夫
同じプロンプトを何度も回す前に、参照画像と音声を見直す。生成の試行回数を減らす最短ルートは、入力の質を上げることだ。1カットあたりの試行上限を決めておき、超えたら設定に戻る、というルールを置くと作業が停滞しない。
よくある質問
Q1. 参照画像は1枚でも一貫性は保てますか
短い尺で同じ構図を繰り返すなら可能です。ただし角度が変わると崩れやすいため、実務では4角度以上を推奨します。
Q2. 複数の生成モデルを混ぜても大丈夫ですか
作品全体のメインモデルを1つ決め、動きの再現や特殊な背景など例外のみサブモデルを使うのが安全です。混在させる場合はカット表に使用モデルを記録してください。
Q3. 顔だけが安定しません。何を優先すべきですか
参照画像の光源統一と、固定プロンプトの順序統一です。この2つを整えるだけで改善するケースが大半です。
Q4. 長回しのカットを作りたいです
3〜5秒の短いカットで生成し、編集でつないで長回しに見せる方法が現実的です。1回の生成で長尺を作ると、中盤で顔が崩れやすくなります。
Q5. 衣装替えのあるシリーズはどう管理しますか
衣装ごとに参照画像セットと固定プロンプトを作り、カット表に衣装番号を記載します。衣装の切り替え点はシーンの区切りと一致させると混乱しません。
Q6. どの工程に最も時間をかけるべきですか
設計と参照画像の準備です。ここに時間をかけるほど、生成と修正の時間が減ります。逆にここを飛ばすと、どれだけ生成を繰り返しても安定しません。
Q7. 途中でキャラクター設定を変えたくなったら
設定書の版番号を上げ、変更点を明記したうえで、影響するカットを洗い出します。変更後に作るカットと既存カットが混ざると違和感が出るため、該当シーンの再生成を前提に計画してください。
まとめ:一貫性は「工程の設計」で決まる
キャラクターの一貫性は、優れたモデルを選ぶことで自動的に得られるものではない。設定書で特徴を言語化し、条件をそろえた参照画像を用意し、用途に合ったモデルを1つに絞り、短いカットで積み上げ、編集で色と尺をそろえる。この流れを毎回同じ手順で繰り返すことが、結果として最も遠回りに見えて最短の道になる。
最初から完璧を目指す必要はない。まずは4角度の参照画像と固定プロンプトのテンプレートを作り、3カットの短いテストを作ってみる。カット間で顔・髪・衣装・色が崩れていないかを確認し、崩れた箇所を設定書にフィードバックする。この小さなループを回すだけで、シリーズ作品でも安定した人物表現が手に入る。
さらに規模を広げる場合は、チェックリストとカット表をチームの共通資産として育てていく。属人的な勘ではなく、記録と手順に基づいて判断できる状態を作ることが、長く続くシリーズ制作の土台になる。

