なぜAI動画でキャラクターの一貫性が崩れるのか
AI動画生成の画質は急速に向上している。しかし複数のカットをつないで同じキャラクターを演じさせようとすると、多くの制作者が同じ壁にぶつかる。1カット目は完璧だったのに、2カット目では輪郭が変わり、3カット目では髪の色が少し明るくなり、4カット目では「別の誰か」になっている。これはツールの性能不足というより、生成の仕組みそのものに由来する構造的な問題だ。
生成モデルは、画像や動画のピクセルを確率分布から毎回サンプリングして出力する。同じプロンプトを同じ設定で投入しても、内部のノイズの引き方がわずかに異なり、結果もわずかに異なる。人間の目はこの「わずか」に極めて敏感で、目と目の間隔が数ピクセル違うだけで別人として認識してしまう。さらにテキストプロンプトは本質的に曖昧だ。「青い目」と書いても、モデル内部の意味空間では毎回少し違う座標に着地する。この二つが重なることで、カットごとの揺らぎが積み上がっていく。
一貫性が崩れる主な原因
- 確率的サンプリングによる揺らぎ:同じ入力でも出力が毎回微妙に変わる
- プロンプトの情報量不足:人物の定義が曖昧なまま生成している
- 参照画像の不足:1枚の写真では角度情報も立体情報も足りない
- モデル間の描画スタイルの差:肌の質感や彩度の基準がツールごとに違う
- 記録漏れ:前回うまくいった設定を再現できない
- 尺の問題:動画が長くなるほど後半でアイデンティティが崩れやすい
特に見落とされやすいのが、最後の二つだ。うまくいった設定をメモしていなければ、翌日には再現できない。また、10秒のカットでも終盤になると顔のパーツ配置が緩み始める。生成モデルは時間方向の一貫性を保つ仕組みを持っているが、それは「直前のフレームと矛盾しない」という意味であって、「最初に決めた人物定義と矛盾しない」という意味ではない。この違いを理解しておくと、対策の方向性が見えてくる。
一貫性が崩れると何が失われるか
一貫性の崩れは、単なる見た目の問題では済まない。第一に視聴者の没入感が切れる。人は顔の変化に対して無意識に警戒反応を起こすため、物語に集中できなくなる。第二にシリーズ化の資産価値が下がる。回を追うごとに主人公の顔が変われば、シリーズとしての記憶が積み上がらない。第三に修正コストが膨らむ。納品間際に「3カット目の顔だけ差し替え」が発生すると、再生成、再編集、再確認で作業時間が倍増する。
裏を返せば、一貫性は「作ってから直すもの」ではなく「作る前に設計するもの」だ。次の章から、その設計手法を具体的に見ていく。
ブロックピクセル設計とは何か
ブロックピクセル設計とは、キャラクターの視覚的アイデンティティを「変更してはいけないコア情報」と「シーンごとに変えてよい表現レイヤー」に厳密に分離し、ブロック玩具のように組み替え可能な状態で管理する考え方だ。ブロック玩具では、基本パーツの形は決まっているが、組み合わせ次第で家にも車にもなる。同じ発想で、顔や骨格という基盤パーツは固定し、衣装や照明や背景だけを差し替えていく。
この設計の利点は、変更の影響範囲が限定されることにある。「このシーンは夜だから照明を変える」という作業が、顔の造形に影響を与えない。もしコアと表現が混ざったまま生成していたら、照明を変えるだけで顔も変わってしまう。分離は、再現性と効率の両方に効く。
コア層に置くべきもの
- 骨格の比率:頭身、肩幅、手足の長さの比率
- 顔のパーツ配置:目の間隔、鼻の位置、口の幅、あごの角度
- 肌の基準色と質感(乾燥しているか、ツヤがあるか)
- 髪の生え際、分け目、長さ、基準色
- 識別マーク:ほくろ、傷、眼鏡、特徴的な眉の形
- シルエット:3秒で線画にできる輪郭
表現層に置くべきもの
- 衣装と小物
- 表情とポーズ
- ライティングの種類と方向
- 背景、美術、天候
- レンズの焦点距離、構図、カメラワーク
- レンダリングのスタイル(写実、アニメ、水彩など)
固定する情報を選ぶ3つの判断基準
すべてをコア層に入れると、キャラクターが硬直して演技ができなくなる。逆に少なすぎると別人化する。判断には次の基準を使うとよい。
- シルエットで識別できるか。塗りつぶした影だけを見て誰か分かる特徴は最優先で固定する。
- 一言で言語化できるか。説明できない特徴は、毎回のプロンプトで再現できない。
- 別角度・別照明でも成立するか。正面だけで成立する特徴は、コアではなく表現層に近い。
迷ったときの実務的なコツは、「これは視聴者が気づくか」で判断することだ。視聴者が気づかない細部にこだわると、生成の自由度だけが奪われる。逆に、視聴者が無意識に認識している要素(目の間隔、輪郭、髪の分け目)は、たとえ地味でも必ず固定する。
キャラクター定義書の作り方
コア層を頭の中だけで保持するのは無理がある。チーム制作ならなおさらだ。必要なのは、誰が読んでも同じ生成結果に近づけるキャラクター定義書(キャラクター・バイブル)である。
必須項目チェックリスト
- 名前、年齢、性別、役割
- 身長と頭身、体型の比率
- 顔の各パーツの位置関係
- 肌の色(数値指定)と質感
- 髪の色(数値指定)、長さ、分け目、質感
- 目の色と形、まぶたの印象
- 識別マークとその位置
- 標準衣装の色と素材感
- 持ち物や小物
- 基本の立ち姿とシルエット
- 声や話し方のトーン(映像の演技設計に影響する)
- 禁止事項(やってはいけない表現)
数値と言葉を併記する
定義書が機能しない最大の原因は、比喩だけで書かれていることだ。「優しそうな目」では生成結果が毎回変わる。「目の横幅は顔の幅の約5分の1、外眼角はわずかに下がり、まぶたは二重で幅は狭め」まで書けば、プロンプトに落とし込みやすい。色は必ず数値で指定する。色名だけでは、モデルごとに解釈がずれる。
定義書が機能していないサイン
- 生成のたびに担当者がプロンプトを書き直している
- 「なんとなく違う」と言われても、どこが違うか説明できない
- 定義書に書かれていない特徴が、完成カットにだけ存在する
- 同じ定義書を使っているのに、担当者ごとに顔が違う
これらが当てはまるなら、定義書の粒度が粗すぎるか、コアと表現の境界が曖昧になっている。まずは識別マークと目の間隔、輪郭の三点を数値化するところから始めると効果が大きい。
参照画像セットの設計とマルチイメージ活用
テキストだけでは伝えきれない情報を補うのが参照画像だ。ただし、闇雲に枚数を増やせばよいわけではない。矛盾する参照画像を混ぜると、モデルは平均的な別人を作り出してしまう。
何枚あれば足りるか
実務では6〜12枚が扱いやすい。内訳の目安は次の通り。
- 正面のバストアップ(基準画像)
- 斜め45度のバストアップ
- 横顔
- やや見下ろしとやや見上げの2枚
- 表情違い3枚(無表情、笑顔、驚き)
- 全身の立ち姿
- 衣装のディテールアップ
- 照明条件の違う1枚
このセットがあれば、多くのモデルで安定した人物参照ができる。逆に、同じ構図の画像を10枚並べても情報量は増えない。角度と表情と照明を意図的に散らすことが重要だ。
矛盾する参照画像の扱い
参照画像同士が矛盾する場合(髪の長さが違う、目の色が違うなど)は、必ず優先順位を決める。基準画像を1枚指定し、それ以外は「補助」と明示する。複数画像を入力できるツールでは、重み付けができるものも多い。重みを調整できない場合は、矛盾する画像を削除するほうが安全だ。
参照画像を作る手順
- 定義書をもとに基準画像を生成する
- 10〜20枚出力し、定義書と最も一致するものを選ぶ
- 選んだ画像から角度違いを生成し、不足を補う
- 全画像を並べて矛盾がないか目視確認する
- 命名規則に従って保存し、定義書にリンクする
この作業を省くと、後工程で必ず揺り戻しが起きる。参照画像セットは、いわば映像制作における「配役決定」に近い。ここで時間をかけるほど、撮影(生成)が楽になる。
モデル間・カット間でルックをそろえる実践ワークフロー
複数の生成モデルを併用するのは、もはや一般的だ。得意分野が違うため、あるシーンは写実的なモデル、別のシーンはアニメ調のモデルを使いたくなる。問題は、モデルごとに肌の質感、彩度、輪郭の扱いが違うことにある。
プロンプトを層で組み立てる
もっとも効果的なのは、プロンプトを固定部分と可変部分に分けることだ。
- 固定部分:キャラクターのコア定義(定義書からコピー)
- 可変部分1:衣装と小物
- 可変部分2:ポーズと表情
- 可変部分3:ライティング
- 可変部分4:レンズと構図
- 可変部分5:レンダリングスタイル
固定部分は毎回一字一句同じ文言を使う。ここを言い換えると、モデルは別の人物として解釈する。可変部分だけを差し替える運用にすれば、揺らぎの発生源が限定される。
モデルごとの癖を把握する
モデルを変えると、次のような差が出やすい。
- 肌の描写が滑らかすぎて、実写よりも人形のように見える
- 彩度が高く、衣装の色が定義とずれる
- 目の描き込みが強く、印象がきつくなる
- 背景の解像度が上がり、相対的に人物が小さく見える
これらは、プロンプトのスタイル記述と、ポスト処理の色調整で吸収する。重要なのは「どのモデルがどの方向にずれるか」を記録しておくことだ。記録があれば、次回のカットで迷わない。
記録しておくべき項目
- 使用モデルとバージョン
- プロンプト全文(固定部分と可変部分を分けて保存)
- 参照画像セットのID
- 乱数シード
- 解像度、アスペクト比、フレームレート
- 生成時間と試行回数
- 採用/不採用の理由
この表をスプレッドシートで管理するだけで、再現性は劇的に上がる。特に「不採用の理由」は、同じ失敗を繰り返さないための資産になる。
同じモデルでも揺れるとき
同一モデル・同一プロンプトでも結果が揺れる場合、原因は乱数シードか、参照画像の優先順位の揺れであることが多い。シードを固定し、それでも揺れるなら参照画像の枚数を減らして基準画像を強化する。枚数を絞ることで安定するケースは想像以上に多い。
動き・ポーズ・カメラワークの整合性
静止画で一貫していたとしても、動画にすると崩れる。動きは情報量が多く、モデルが処理しきれなくなると、人物の造形を犠牲にして動きの整合性を優先するからだ。
モーション設計の順序
- シーンのキーポーズを3〜4点決める
- キーポーズ間の中間動作を言語化する
- カメラワークを決める
- カット尺を短く分割して生成する
- つなぎ目を確認し、必要なら前カットの最終フレームを次カットの開始画像に使う
特に効果が大きいのが最後の工程だ。前カットの最終フレームを次カットの初期画像として渡すと、ポーズと光の連続性が保たれ、見た目のジャンプが減る。これを「フレーム継承」と呼ぶことがある。
表情ラベルを統一する
「悲しそう」ではなく「眉の内側を上げ、口角を下げ、視線を左下に向ける」のように、表情を動作として記述する。抽象語はモデルごとに解釈が異なる。表情ラベルを定義書にまとめておけば、シリーズ全体で演技のトーンがそろう。
破綻しやすいポイント
- 顔が横を向いた瞬間に輪郭が変わる
- 手が顔の近くに来ると、指の本数や形が崩れる
- 走る・跳ぶなど大きな動作で体型比が変わる
- カメラが回り込むと、後頭部や耳の形が破綻する
- 早口のリップシンクで口の形が不自然になる
これらは、カットを短くする、動作を分割する、手を画面外に逃がす、といった演出側の工夫でかなり回避できる。技術で解決しようとする前に、演出で逃げる発想を持つことが実務では重要だ。
照明・環境・質感のバリエーション対応
物語には昼も夜も室内も屋外もある。シーンごとに光が変わるのは当然だが、そのたびに顔が変わっては困る。ここで効くのが、ライティングの共通ルールをあらかじめ決めておく方法だ。
ライティングの共通ルール
- キーライトの基本方向を決める(例:常にやや左上から)
- 色温度の基準を決める(昼は中立、夜は寒色寄りなど)
- コントラストの上下限を決める
- 肌のハイライトの強さを一定範囲に収める
このルールがあると、シーンが変わっても顔の見え方が極端に変わりにくい。特に肌のハイライトは、人物の印象を大きく左右するため、数値ではなく「どの程度まで許容するか」を言語化しておく。
シーン別プリセットを作る
- 昼・屋外・晴天
- 昼・屋内・窓光
- 夕方・逆光
- 夜・街灯
- 夜・室内の間接照明
- 曇天・拡散光
各プリセットに、キーライトの方向、色温度、コントラスト、背景の処理方針を書いておく。生成時にプリセットを選ぶだけで、シーン間のルックがそろう。
意図的なスタイル転換
回想シーンや夢のシーンでは、あえてスタイルを変えたいこともある。その場合も、コア層だけは維持する。レンダリングの質感を変え、骨格と顔の配置は変えない。この原則を守れば、視聴者は「同じ人物の別表現」として自然に受け取る。逆にコア層まで変えてしまうと、視聴者は別の人物が登場したと誤解する。
よくある失敗とトラブルシューティング
顔が変わる
原因はプロンプトの固定部分が毎回違うか、参照画像の優先順位が曖昧なことにある。対策は、固定プロンプトを定義書からコピーする運用に変え、基準画像を1枚だけ明示すること。それでも揺れる場合は、顔のアップのカットを短くし、正面に近いアングルを増やす。
髪型・髪色が変わる
髪は照明の影響を強く受けるため、色が変わったように見えることが多い。まず照明の色温度を疑い、次に髪の基準色の数値指定を確認する。長さや分け目は、動画では情報が落ちやすいので、定義書に「分け目は左から7対3」のように数値で書く。
衣装のディテールが消える
ボタン、刺繍、ロゴなどの細部は、解像度が足りないと消える。対策は、衣装のディテールアップ用の参照画像を用意すること、そして引きのカットでは細部にこだわらないこと。重要な小物は、アップのカットを1つ用意して視聴者に印象づける。
手や小物が崩れる
手は現在もっとも破綻しやすい部位のひとつだ。手を画面外に出す、手袋をさせる、小物を持たせる、といった演出で回避するのが実務的だ。どうしても必要な場合は、手だけのアップを短く挟み、生成回数を増やして選抜する。
動画の後半で別人化する
長尺の生成で起こりやすい。対策はカットを分割し、フレーム継承でつなぐこと。また、動きの激しいシーンでは尺を短くする。10秒を超えるカットは、よほど動きが穏やかでない限り避けたほうが安全だ。
背景だけ別世界になる
人物に注意が向きすぎて、背景の美術が揺れるケースだ。背景のプリセットを決め、同じ場所のシーンは同じ参照画像を使う。屋外なら空の色、建物の様式、植生の種類を固定すると安定する。
チーム制作での運用とレビュー体制
一人で作る場合でも管理は必要だが、複数人で作る場合は運用設計が品質を左右する。
命名規則を決める
プロジェクト名、キャラクター名、シーン番号、カット番号、バージョン、担当者を組み合わせる。例として、作品コードとキャラクター略号とカット番号を並べた形式にすると、検索と差し替えが容易になる。
バージョン管理
コア定義は変更履歴を残す。変更するときは理由を必ず書く。「目を少し大きく」といった曖昧な変更は、後から見ると原因不明のズレになる。変更は数値で記録し、変更前後の画像を並べて保存する。
レビューの観点
- コア層の特徴は維持されているか
- シルエットで識別できるか
- シーン間でライティングの基準が守られているか
- カットのつなぎ目でポーズが跳んでいないか
- 衣装や小物の矛盾がないか
- 定義書と実際のカットに差がないか
レビューは「なんとなく違う」で終わらせず、必ず観点に紐づけて指摘する。指摘の形式が統一されると、修正の速度が上がる。
引き継ぎ資料
定義書、参照画像セット、プロンプトの固定部分、記録表、レビュー記録の5点をセットで引き継ぐ。この5点があれば、担当が変わっても同じルックを再現できる。逆にどれかが欠けると、新しい担当者は手探りで作り直すことになる。
よくある質問(FAQ)
Q1. 参照画像は多いほうが安定しますか
いいえ。矛盾する画像が混ざると、モデルは平均値のような別人を作り出します。6〜12枚を目安に、角度・表情・照明を意図的に散らし、基準画像を1枚決めるのが安定します。
Q2. テキストだけで一貫性を保つことはできますか
短いカットを少数作るなら可能ですが、シリーズ制作では限界があります。定義書の数値と言葉を固定し、参照画像を併用するのが現実的です。テキストは方向づけ、画像は具体化の役割を担います。
Q3. どのモデルを使えばよいですか
用途で選びます。写実的な人物表現が得意なモデル、アニメ調に強いモデル、動きの自然さに優れたモデルがあります。ひとつの作品内で混ぜる場合は、固定プロンプトとポスト処理の色調整でルックを寄せます。
Q4. 生成のたびに顔が変わるのを止める最短の方法は
まずシードを固定し、次に参照画像を1枚に絞り、最後にプロンプトの人物記述を定義書からコピーする運用に変えます。この3つで多くの揺らぎは減ります。
Q5. 長い動画を作りたいときはどうしますか
1カットを短く分割し、前カットの最終フレームを次カットの初期画像として渡します。動きの激しいシーンほど尺を短くし、編集でつなぐほうが結果が安定します。
Q6. 顔のパーツの数値指定はどこまで細かくすべきですか
識別に効く要素から優先します。目の間隔、あごの角度、輪郭、髪の分け目の4点は数値化する価値があります。それ以外は、定義書の文章と参照画像で補うほうが効率的です。
Q7. スタイルを途中で変えても大丈夫ですか
コア層を維持したまま、表現層とレンダリングだけを変えるなら問題ありません。骨格や顔の配置まで変えると、視聴者は別の人物と認識します。
Q8. チームで作業するときの最大の落とし穴は何ですか
定義書の解釈が担当者ごとにずれることです。数値と言葉を併記し、レビューの観点を統一し、変更履歴を残すことで防げます。属人的な感覚に頼らない仕組みが品質を守ります。
一貫したキャラクター表現は、特別な魔法ではなく設計の積み重ねで得られる。コア層を決め、参照画像を整え、固定プロンプトで生成し、記録を残す。地味な手順だが、これを続けた制作だけが、シリーズを通して同じ人物を画面に立たせ続けられる。


