AI動画でキャラクターが崩れる根本原因を理解する
生成AIで動画を作り始めた人が最初にぶつかる壁は、画質ではありません。「同一性」です。1カット目では美しかった人物が、2カット目で別人になり、3カット目では髪の色まで変わっている。こうした現象は、モデルの性能不足というより、生成の仕組みそのものから来ています。
動画生成モデルは、1フレームごとに「もっともらしい絵」を潜在空間で再構成します。そこには「この人物は誰か」という永続的なIDが最初から存在しません。テキストプロンプトと、与えられた参照情報だけを手がかりに、毎回あたらしく人物を描き直しているのです。だからこそ、参照情報の質と量、そして与え方が結果を大きく左右します。
キャラクタードリフトの正体
キャラクタードリフトと呼ばれる現象は、主に4つの層で起こります。
- 顔立ちの平均化。参照が1枚だけだと、モデルはその1枚から「平均的な顔」を再構成しようとし、目尻の角度や鼻筋の細さといった個性が削られていきます。
- 衣装ディテールの欠落。刺繍、ボタンの数、ロゴの位置など、高周波の情報から先に失われます。
- 色の揺れ。シーンごとに光源が変わると、肌や服の色が別物に見えます。とくに逆光と室内灯の混在で顕著です。
- 小物の消失。眼鏡、イヤリング、指輪、ヘアピンなどは、動きが激しいカットで消えるか融合します。
これらはすべて「参照情報が不足している」か「参照情報が矛盾している」かのどちらかに起因します。逆に言えば、この2つを潰すだけで、完成度は驚くほど安定します。
参照画像を複数渡すと何が変わるのか
複数の参照画像を渡すと、モデルはそれぞれの画像から共通する特徴だけを抽出し、統合された人物表現を作ります。この処理は一般に、人物の埋め込み表現を生成するステップとして説明されます。
重要なのは、複数枚あることで「ノイズが平均化される」という点です。1枚目に強い影が入っていても、2枚目が均一な光なら、影は個性ではなくノイズとして扱われます。背景が違えば背景は無視され、顔の骨格だけが残ります。つまり複数画像の融合とは、足し算ではなく「共通項の抽出」なのです。
この考え方を軸にすると、参照画像は「多いほど良い」のではなく「共通項が正しく浮かび上がる構成」であることが重要だと分かります。同じ人物の、違う条件の写真を、意図をもって揃える。これがワークフローの出発点です。
参照画像セットの設計:何枚を、どの角度で用意するか
参照画像の設計は、動画制作全体でもっとも費用対効果の高い工程です。ここで30分かけるかどうかで、後工程のやり直し回数が3倍変わります。
3枚で足りるケース、10枚必要なケース
最小構成は3枚です。正面のバストアップ、斜め45度、全身の立ち姿。この3枚で、顔の骨格・髪のボリューム・体型の比率が伝わります。トーキングヘッド中心の短尺コンテンツなら、これで十分なことが多いです。
7枚前後に増やす価値が出るのは、次のような場合です。
- 喜怒哀楽を複数のカットで見せる芝居が必要
- 同じ人物が屋内と屋外の両方に登場する
- 横顔や後ろ姿のカットが含まれる
- 手元のアップがある
10枚以上が必要になるのは、衣装替え、加齢、特殊メイク、傷や痣といった「同一人物だが状態が異なる」表現を含む作品です。この場合は参照を「ベース人物」と「状態差分」に分けて管理すると破綻しにくくなります。
角度と表情の割り当て表を作る
おすすめは、スプレッドシートに以下の列を作ることです。ファイル名、角度、表情、光源、衣装、解像度、採用可否。これを埋めながら撮影・選定すると、抜けが一目で分かります。
| 用途 | 角度 | 表情 | 優先度 |
|---|---|---|---|
| 基準顔 | 正面 | 無表情 | 必須 |
| 立体感 | 斜め45度 | 微笑 | 必須 |
| 体型 | 全身正面 | 無表情 | 必須 |
| 芝居 | 斜め45度 | 驚き/怒り | 推奨 |
| 横顔 | 真横 | 無表情 | 任意 |
| 手元 | 手のアップ | ー | 任意 |
避けたい参照画像のパターン
次の画像は、混ぜるだけで結果を悪化させます。
- 強い逆光や、片側だけ濃い影が落ちている写真
- 顔が画面の10%以下の大きさしかない写真
- 手ぶれ、ISOノイズ、SNS圧縮でブロックノイズが出ている写真
- 美肌フィルタで毛穴や輪郭が消えている写真
- 別人やペットが写り込んでいる写真
- マスクやサングラスで顔の半分が隠れている写真
判断に迷ったら「この1枚だけでその人物を説明できるか」を自問してください。できない画像は、参照セットに入れる価値がありません。
前処理ワークフロー:解像度・光・背景を揃える
参照画像は、集めただけでは機能しません。条件を揃える前処理が必要です。ここでは実際に手を動かす順番で説明します。
ステップ1:クロップとアスペクト比の統一
まず全画像を同じアスペクト比に揃えます。動画の最終的な縦横比が16:9なら参照も16:9、9:16のショートなら9:16にします。比率が混在すると、モデルが構図を推論する際に余計な揺れが生まれます。
顔の位置も揃えます。頭頂から顎までがフレームの上から3分の1に収まるようにクロップすると、カット間の顔サイズが安定します。
ステップ2:色温度と露出の統一
もっとも効果が大きいのがこの工程です。基準となる1枚を決め、他の画像のホワイトバランスを合わせます。多くの画像編集ソフトには「マッチカラー」や「カラーマッチ」機能があり、これを使うだけで肌の色が揃います。
目標は、同じ人物が同じ照明環境に立っているように見せることです。屋外の青い影と、室内のオレンジの照明をそのまま混ぜると、モデルは肌色を「平均のベージュ」に寄せてしまい、個性が消えます。
ステップ3:背景の扱い
背景は2つの方針があります。ひとつは完全に除去して単色にする方法。もうひとつは、あえて複数の異なる背景を残す方法です。
前者は顔の再現度が上がりやすい一方、髪の輪郭が不自然になりがちです。後者は髪のディテールが保たれる代わりに、背景の要素が映像に漏れるリスクがあります。
実務的な結論としては、基準となる正面・斜めの2枚は背景除去、残りは背景を残す、というハイブリッドが扱いやすいです。
ステップ4:ファイル名とフォルダ構成
見落とされがちですが、ここを整えると制作速度が上がります。たとえば charA_face_front_neutral_v03.png のように、人物・部位・角度・表情・バージョンを名前に含めます。バージョン管理を怠ると、修正時に古い画像を参照してしまう事故が起きます。
複数画像を融合するプロンプト設計
参照画像を用意したら、次は指示文です。ここでの原則は「参照の役割を明示し、揺らしたい要素と固定したい要素を分ける」ことです。
参照の優先順位を書き分ける
複数参照を扱えるツールでは、どの画像が何を担当するかを文章で示せます。
- 参照A:顔の骨格と髪型
- 参照B:衣装と配色
- 参照C:体型と立ち姿勢
このように役割を分けると、モデルが「全部を1枚から取ろうとする」挙動を避けられます。とくに衣装が特殊な場合(制服、民族衣装、近未来的な装甲など)は、衣装専用の参照を用意するのが効果的です。
固定する要素と動かす要素を分離する
プロンプトは次の3層に分けて書くと整理しやすくなります。
- 固定層:人物ID、年齢感、髪型、衣装、体格
- 可変層:ポーズ、視線、表情、カメラアングル
- 環境層:場所、時間帯、天候、光源の種類
固定層は毎回ほぼ同じ文面をコピーし、可変層と環境層だけを書き換えます。これにより、モデルに渡る「変わらない情報」が一貫します。
カメラと照明の語彙を増やす
映像の連続性は、実はカメラ用語でかなり制御できます。
- レンズ:35mm相当、50mm相当、85mm相当
- アングル:アイレベル、やや見下ろし、肩越し
- 照明:ソフトボックス、逆光リム、窓明かり、曇天の拡散光
- 被写界深度:浅い、深い
同じ人物を同じレンズ感で撮り続けているように見せることが、結果として同一性の印象を強めます。逆に、カットごとにレンズ感がばらつくと、たとえ顔が同じでも「別の人物」に見えてしまいます。
ネガティブ指定で守るもの
避けたい要素を明示するのも有効です。顔の輪郭が溶ける、指が増える、衣装のロゴが消える、肌がプラスチックのように均一になる——こうした崩れは、ネガティブ指定と後述のショット設計の組み合わせでかなり抑えられます。
ショット設計と編集で連続性を守る
生成の精度だけに頼らず、編集で連続性を作るのも重要な技術です。プロの現場では、むしろこちらの比重が大きいこともあります。
ショットリストを先に作る
撮影前(生成前)に、カット番号、尺、アングル、人物の状態、背景を一覧にします。60秒の作品なら15〜25カットが目安です。1カットを平均2.5秒とすると、生成の試行回数を読みやすくなります。
ショットリストがあると、どのカットで同じ参照セットを使うべきかが明確になります。結果、参照を切り替える回数が減り、ドリフトの発生源そのものを減らせます。
つなぎ目を味方につける
カットとカットの間で顔が完全に一致している必要はありません。人間の視聴者は、前後の文脈で同一性を補完します。
- カットの切り替え直後に、同じ髪型・同じ衣装・同じ色調を見せる
- 視線の方向を前カットから引き継ぐ
- 動作の途中で切る(マッチカット)
- 極端な寄りから始めず、まずミディアムショットで人物を提示する
とくに最後の項目は効果的です。いきなり顔のアップから始めると、視聴者は比較対象を持たないまま「この顔が基準」と認識します。逆に、少し引きのカットから入ると、細部の揺れが気になりにくくなります。
色調を最後に統合する
編集ソフトで全カットに共通のカラーグレーディングをかけると、別々に生成した映像がひとつの世界に見えます。LUTを1つ決め、それを全カットに適用するだけで、体感の一貫性は大きく向上します。肌のトーンだけを揃えるマスク処理を併用すると、さらに安定します。
ツール選定の判断基準
ここでは特定のサービス名を前提にせず、選び方の基準を示します。
画像から動画か、動画から動画か
画像から動画を生成する方式は、1カット目の見た目を完全に制御できる利点があります。参照画像との相性も良く、キャラクターの初出しに向いています。
一方、既存の映像を変換する方式は、動きのリアリティとカメラワークの自然さで優れます。ただし元映像の人物に引っ張られるため、参照キャラクターへの置き換えは難易度が上がります。
実務的には、人物の初出しカットは画像から動画、動きの複雑なカットは動画から動画、という使い分けが現実的です。
モデルの得意分野を見極める
同じプロンプトでも、モデルによって得手不得手があります。選定時は次の観点で比較します。
- 人物の顔の再現度
- 手や指の破綻率
- カメラワークの指示への追従性
- 長回しでの安定性(何秒まで崩れないか)
- 参照画像を何枚まで受け付けるか
- 出力解像度と尺の上限
テストは必ず「同じ参照3枚+同じプロンプト」で行います。条件を変えると比較になりません。
ローカルとクラウドの使い分け
手元のマシンで動かす方式は、試行回数を気にせず回せる点が強みです。一方で初期設定の負荷が高く、モデルの更新も自分で管理する必要があります。
クラウド型は導入が速く、複数モデルを横断して試せる点が魅力です。判断基準はシンプルで、「1日に何十回も試行錯誤するならローカル、完成品を短期間で仕上げたいならクラウド」です。
失敗パターン別トラブルシューティング
顔だけが変わる
原因はほぼ、参照セット内で顔の条件が矛盾していることです。対策は次の順で試します。
- 参照を3枚に絞り、正面・斜め・全身だけにする
- 3枚のホワイトバランスを完全に合わせる
- 顔のアップ参照を追加する(毛穴や眉の形が伝わるもの)
- カメラ距離を固定し、寄りと引きを混ぜない
衣装が変わる、ロゴが消える
衣装専用の参照を1枚追加し、プロンプトの固定層に衣装の記述を具体的に移します。「赤いジャケット」より「襟に黒いパイピングのある赤いショートジャケット」のほうが保持されます。細かい文字やロゴは、そもそも生成が苦手な領域です。どうしても必要な場合は、編集ソフトで後から合成するほうが確実です。
動きが速いと崩れる
速いパン、走行、激しい身振りは、フレーム間の差分が大きくなり、同一性が破綻します。対策は、動きを遅くする、カットを短くする、モーション量を明示的に抑える、の3つです。1カット1.5秒に切ってしまうのも有効な解決策です。
手・髪・アクセサリーが壊れる
手は手の参照を、髪は後ろ姿の参照を追加すると改善します。眼鏡やイヤリングは、生成に任せずレイヤー合成に切り替える判断も必要です。完璧な生成を目指すより、壊れやすい要素を編集で担保するほうが総工数は下がります。
実践パイプライン:60秒のショートを半日で仕上げる手順
ここまでの内容を、実際の進行に落とし込みます。
- 企画と脚本(30分)。60秒、15カット、人物1名、場所2つ、と条件を絞ります。
- 参照画像セットの準備(45分)。正面・斜め・全身の3枚を選定し、ホワイトバランスを統一し、命名規則に沿って保存します。
- キャラクターの基準カットを3枚生成(40分)。同じ参照と同じプロンプトで、無表情・微笑・横顔を作ります。ここで顔の基準を確定させます。
- ショットリスト作成(20分)。カット番号、尺、アングル、背景、動作を表にします。
- カット生成(90分)。前半8カットを生成し、崩れがなければ後半7カットへ。崩れた場合はプロンプトの可変層だけを調整します。
- 選別とリテイク(40分)。各カット3案から最良を選び、破綻カットだけ再生成します。
- 編集とカラー統合(50分)。つなぎを整え、LUTを全カットに適用し、音を載せます。
- 最終チェック(15分)。後述のチェックリストを上から順に確認します。
合計およそ6時間。慣れれば4時間台に収まります。重要なのは、手順2と3で妥協しないことです。ここの精度が、後半のやり直し回数を決めます。
納品前の品質チェックリスト
- 参照セットの色温度は統一されているか
- カット間で髪の長さと分け目が一致しているか
- 衣装の配色が全カットで同じか
- 手の指の本数は正しいか
- 背景の小物が意図せず変化していないか
- カメラのレンズ感がカットごとにばらついていないか
- 全カットに同じグレーディングが適用されているか
- 無音で通しで見ても人物が同一に見えるか
- 音を载せた状態で不自然な間がないか
- 書き出し形式と解像度が納品先の指定と一致しているか
とくに「無音で通しで見る」は有効です。音があると注意が分散し、顔の揺れを見落とします。
よくある質問
参照画像は多いほど良いのでしょうか
いいえ。矛盾した参照を混ぜると精度は下がります。まず3枚で基準を作り、不足を感じた要素だけを足す進め方が安全です。
同じ人物を別の衣装で登場させたい場合は
人物のベース参照3枚と、衣装ごとの参照1枚を分けて管理します。衣装ごとに人物IDが再学習されないよう、ベース参照は常に同じファイルを使い回してください。
参照にイラストや3Dモデルを使ってもよいですか
問題ありません。ただし写真とイラストを混ぜると、モデルがどちらの表現に寄せるかが不安定になります。作品全体をイラスト調に統一するなら、参照もイラストで揃えるほうが安定します。
生成結果が毎回バラつきます。何を固定すべきですか
まず乱数シードを固定します。次に参照セット、次にプロンプトの固定層、最後にカメラ用語です。この順で固定していくと、変動要因を切り分けられます。
一度で完璧なカットは出ますか
出ません。1カットにつき3案を生成し、その中から選ぶ前提でスケジュールを組むのが現実的です。選別の目を鍛えることも、制作スキルの一部です。
短尺と長尺で進め方は変わりますか
変わります。15秒以下なら参照3枚とカット数5前後で完結します。3分を超える作品では、シーン単位で参照セットとショットリストを分割し、シーンごとに基準カットを作り直すほうが破綻しにくくなります。
まとめ:一貫性は「技術」ではなく「段取り」で作る
複数画像を融合して一貫したキャラクターを保つコツは、特別なテクニックではありません。参照画像の条件を揃えること、プロンプトの固定層と可変層を分けること、ショット設計と編集で補うこと。この3つを淡々と実行するだけです。
そして、うまくいかないときは必ず原因が特定できます。顔が変わるなら参照の矛盾、衣装が消えるなら解像度か指示の抽象度、動きで崩れるならカットの長さ。勘で直すのをやめ、切り分けの順序を持つことが、再現性のある制作への近道です。
最初は3枚の参照と5カットの短い作品から始めてください。そこで一貫性が保てた体験が、長尺作品への土台になります。


