なぜAI動画でキャラクターが「別人」になるのか
AI動画生成の現場で最も多くの人がつまずくのが、カットをまたぐとキャラクターが別人になってしまう問題です。1本のクリップだけを見れば驚くほど自然な映像が数分で出てくるのに、2カット目、3カット目をつないだ瞬間に、顔の輪郭、髪の長さ、服の色、年齢感、体型が少しずつズレていく。これはモデルの性能不足というより、テキストプロンプトだけで人物を指定していることによる構造的な問題です。
テキスト・トゥ・ビデオのモデルは、入力された文章を手がかりに、学習データの中から「それらしい人物」を毎回新しく描き直します。「30代の女性、ショートヘア、黒いコート」という指示は、モデルにとっては無数の候補から一つを選ぶ条件でしかありません。同じプロンプトを使っても、乱数シード、ステップ数、初期ノイズが変われば選ばれる人物は別物になります。
ズレが生じる要因は、大きく4つに分けられます。
- 識別情報の欠落:顔立ちや髪型など「その人らしさ」を決める要素が言語化されていない
- 視点の変化:カメラアングルが変わると、モデルは同じ人物を別角度から描き直す必要がある
- 環境の変化:背景、照明、時間帯の変更が人物の色味や陰影に影響する
- 状態の変化:服のしわ、髪の乱れ、表情の変化が積み重なって印象を変える
さらに厄介なのは、プロンプトを詳細にすればするほど破綻しやすくなる点です。「右目の下にほくろ」と書いても、次のカットではそれが消えていることが珍しくありません。言語は本質的に曖昧で、モデルは指示の一部を無視しても「全体として自然な絵」を優先するからです。
つまり、テキストは人物を説明できても固定できない。この限界を埋めるために使われるのが、画像をアンカー(錠前)として渡すという発想です。
マルチ画像フュージョンの基本設計
マルチ画像フュージョンとは、1枚の参照画像に頼るのではなく、複数の画像から「変えてはいけない要素」と「変えてよい要素」を分離して扱う考え方です。ここが理解できると、作業の質が一段変わります。
基本になるのは、人物を2つの層に分解する発想です。
- 構造層(アイデンティティ):骨格、顔の比率、目の形、髪の生え際、肌のトーン、体型
- 表層(スタイル):服装、小物、背景、ライティング、カラープロファイル、画風
構造層は全カットで完全に固定し、表層はシーンごとに自由に差し替える。これが一貫性と表現力を両立させる最も実用的な方法です。実際の作業では、参照画像を複数枚用意し、それぞれに「何を担当させるか」を決めておきます。
たとえば次のような分担です。
- 正面のバストアップ:顔の比率と目・鼻・口の配置を固定する
- 斜め45度の上半身:立体感と頬骨・顎のラインを固定する
- 全身の立ち姿:身長バランス、肩幅、手足の長さを固定する
- 表情違いのクローズアップ:笑顔・真顔・驚きの幅を定義する
- 衣装のディテール:縫い目、ボタン、ロゴ、素材感を固定する
この5枚があれば、多くの商用ワークフローは回ります。逆に1枚しかない場合、モデルは見えていない側面を推測で埋めるため、角度が変わるたびに顔が変わりやすくなります。
重要なのは、参照画像は「多いほど良い」わけではないという点です。矛盾する情報が混ざると、モデルはどの特徴を優先すべきか判断できず、平均的な別人が出力されます。10枚の似た写真より、意図の異なる5枚のほうが強い参照になります。
モデルに依存しない設計にする
同じキャラクターを複数の生成モデルで使い回すなら、参照セットは特定のモデルに最適化しすぎないほうが安全です。あるモデルで美しく出たプロンプトの言い回しは、別のモデルでは逆効果になることがあります。
そこで有効なのが、プロンプトを「キャラクター定義」と「ショット指定」に分けて管理する方法です。キャラクター定義は固定テキストとして保存し、ショット指定だけを毎回書き換えます。参照画像セットと固定テキストの組み合わせを「キャラクターカード」として扱うと、モデルを乗り換えても同じ人物を再現しやすくなります。
参照画像セットの作り方:実践手順
ここからは具体的な作り方です。参照画像の品質は、そのまま出力の上限を決めます。
解像度とトリミング
顔が判別できる最低ラインは、長辺1024ピクセル以上を目安にしてください。スマートフォンの集合写真から切り出した小さい顔は、拡大しても情報が増えないため、参照として弱くなります。また、被写体の周囲に余白を残しすぎると、モデルが背景まで学習してしまい、別のシーンで背景が滲み出ることがあります。バストアップなら肩の少し外側まで、全身なら足元までを含め、被写体が画面の6割以上を占める構図が扱いやすいです。
ライティングを揃えすぎない
意外に思われますが、参照画像の照明は完全に統一しないほうが汎用性が上がります。順光だけで揃えると、逆光のシーンで顔が潰れたり、暗所で別人化したりします。順光・斜光・やや逆光の3種類を混ぜておくと、どのシーンでも顔の骨格が保たれやすくなります。
背景はシンプルに
無地の背景、または大きくぼけた背景が理想です。模様の強い壁紙や看板の文字が入っていると、それが衣装や小物として映像に混入することがあります。グリーンバックである必要はありませんが、視線を引く要素はできるだけ排除してください。
避けたいNG例
- 強いフィルター加工:肌が平滑化され、年齢や質感の情報が失われる
- 顔の一部が髪や手で隠れている:隠れた部分をモデルが毎回創作する
- 極端な広角やローアングル:顔の比率が歪み、参照として矛盾を生む
- 複数人が写っている写真:どちらを固定すべきか判断できない
- AIで生成した画像をさらに参照にする:すでに崩れた手や耳の情報が増幅される
権利と同意の確認
実在の人物を参照にする場合は、肖像の使用許諾を必ず確認してください。著名人に似せたキャラクターを商用利用すると、宣伝文句だけでなく法的リスクにもなります。オリジナルキャラクターを作る場合は、髪型や衣装の組み合わせが既存作品と酷似していないかも確認しておくと安心です。
制作ワークフロー全体像:企画から書き出しまで
一貫性は「生成時のテクニック」ではなく「工程設計」で守るものです。以下は、短編映像を想定した実践的な流れです。
手順1:キャラクター設計書を書く
まず文章でキャラクターを定義します。年齢、職業、性格、歩き方、声のトーン、服装の基本形、持ち物。ここを飛ばすと、後工程で「この人はなぜ今こう動くのか」が決められなくなります。
手順2:参照画像セットを作る
前述のとおり、正面・斜め・全身・表情・衣装の5枚を用意します。手持ちの写真がなければ、画像生成モデルで作り込んでも構いません。その場合も最終的には手作業でレタッチし、指や耳の破綻を修正しておきます。
手順3:ショットリストを書く
カット番号、尺、カメラワーク、場所、時間帯、感情、セリフの有無を表にします。AI動画は1カットずつ生成するため、事前の分解がそのまま作業効率になります。1カット3〜5秒を基本単位にすると、破綻時の差し替えが容易です。
手順4:キーフレームを静止画で作る
いきなり動画を作らず、まず各カットの代表フレームを静止画で生成します。この段階で顔の一致を確認し、ズレていれば参照の重みやプロンプトを調整します。静止画で合わないものは、動画にしても合いません。
手順5:画像から動画へ変換する
キーフレームを開始フレームとして渡し、動きを指示します。動きの強度は控えめから始めるのが鉄則です。強い動きは人物の形状を大きく変えるため、同一性が崩れます。歩行や振り向きなど、変形の大きい動作は短いカットに分割してください。
手順6:カット間の整合を検証する
生成したカットを並べ、顔・髪・服・体型の4点を目視で照合します。ズレが小さい場合は編集で吸収できますが、大きい場合は該当カットだけ再生成します。ここで妥協すると、後工程で修正できなくなります。
手順7:編集・音・書き出し
編集ソフトでつなぎ、カットの頭と尻をわずかにトリムしてリズムを作ります。AI生成映像はフレームレートの揺らぎが出やすいため、必要に応じて手ぶれ補正やモーションブラーの追加でなじませます。音は映像の説得力を大きく左右します。環境音、足音、衣擦れを入れるだけで、視聴者は同一性のわずかなズレを意識しなくなります。
シーンやスタイルを変えても同一性を保つコツ
一貫性というと「すべて同じに見せること」と思われがちですが、実際に必要なのは「同じ人物だと認識できること」です。ここでは変化させる技術を扱います。
衣装を変える
衣装替えは最も基本的なシーン転換です。構造層を固定したまま、衣装だけをプロンプトで指定します。このとき、色を言葉で指定するよりも、新しい衣装の参照画像を1枚追加したほうが仕上がりは安定します。ただし参照画像を追加しすぎると顔の情報が薄まるため、衣装参照は1枚までに絞るのが無難です。
画風を変える
実写調からイラスト調へ切り替える場合、顔の比率が変わらないよう注意します。イラスト化すると目が大きくなり、輪郭が単純化されるため、別人感が出やすくなります。対策としては、デフォルメの強度を下げ、肌や髪の質感だけを変える方法が有効です。
背景と時間帯を変える
昼から夜へ変えると、肌の色が大きく変わります。これは同一性の判断に影響しますが、参照画像に夜のライティングが1枚あると、暗所でも同じ顔として認識されやすくなります。逆に、参照が昼の順光しかない場合、夜のシーンで顔がのっぺりしたり、別人化したりします。
カメラアングルを変える
見上げ・見下ろしは、顔の比率を最も崩す要素です。特に見下ろしは顎が強調され、目の位置がずれて見えます。対策として、極端なアングルは短尺に留め、アップは正面寄りで撮る構成にすると破綻が目立ちません。
感情の連続性を設計する
一貫性は見た目だけの話ではありません。序盤で怒っていた人物が、理由もなく次のカットで笑っていると、視聴者は「別の人物」として処理します。感情の変化には必ずきっかけを置き、カットの前後で表情のつながりを意識してください。
モデル選定とパラメータの判断基準
生成モデルは日々入れ替わります。特定の名前を追うよりも、判断基準を持ったほうが長く使えます。
| 判断軸 | 確認したいこと | 向いている用途 |
|---|---|---|
| 参照画像の尊重度 | 顔の特徴をどこまで保持するか | シリーズ物、連続ドラマ風 |
| 動きの自然さ | 歩行や手の動きが崩れにくいか | アクション、ダンス |
| 長回し耐性 | 1カットを長く保てるか | 会話シーン、ワンカット演出 |
| スタイル追従 | 画風指示にどこまで従うか | アニメ調、絵本調 |
| 一貫性と創造性のバランス | 指示外の要素を足しすぎないか | 商品映像、企業案件 |
| 出力の安定性 | 同じ設定で同じ結果が再現するか | 量産、テンプレート運用 |
実務では、1つのモデルで全部を作ろうとしないほうが結果が良くなります。キーフレームは画像生成に強いモデル、動きは人物保持に強いモデル、仕上げの補間は別のツール、という分業が現実的です。
押さえておきたいパラメータ
- シード:固定すると再現性が上がる。ただし固定しすぎると動きが硬くなる
- 参照の強度:高すぎると動きが死ぬ、低すぎると顔が変わる。まず中程度から
- 動きの強度:1カット内での変化量。小さく刻むのが安全
- 解像度:縦型と横型で構図が変わる。配信先を先に決める
- フレームレート:24fpsは映画的、30fpsは配信向け。混在させない
よくある失敗とトラブルシューティング
顔が毎カット変わる
原因は参照が1枚しかない、または参照の照明が偏っているケースが大半です。斜めと暗所の参照を追加し、プロンプトの人物記述を減らしてください。記述が多すぎると参照との矛盾が生じます。
手や指が崩れる
手は現行モデルでも最も破綻しやすい部位です。手を画面に入れない構図にする、手袋やポケットで隠す、カットを短くして動きを減らす、の3つが現実的な対処です。生成後に画像編集で修正する運用も有効です。
服の色がカットごとに変わる
色は照明の影響を強く受けます。色名ではなく素材と明度で指定し、衣装参照を1枚添えてください。また、シーンごとにホワイトバランスを揃えると、つないだときの違和感が減ります。
動きがカクつく、スタッタする
出力フレーム数が足りていないか、動きの強度が過大です。カットを短く分割し、必要ならフレーム補間ツールで滑らかにします。補間はディテールを甘くするため、多用は避けます。
参照画像の背景が混ざる
被写体の輪郭が背景と同系色だと、モデルが分離に失敗します。被写体を切り抜き、無地の背景に合成した参照画像を用意すると改善します。
参照がまったく効かない
モデルによって参照の扱いは大きく異なります。画像から動画を生成するモードを使っているか、参照画像の解像度が足りているか、ファイル形式が対応しているかを確認してください。
品質チェックと仕上げのチェックリスト
生成したカットをそのまま並べると、粗が目立ちます。書き出し前には次の項目を確認してください。
- 同一性:顔、髪、体型が全カットで説明可能か
- 視線:話者と聞き手の目線が交差しているか
- 画面の向き:越軸していないか
- 尺:1カットが長すぎないか。3〜5秒を基本に
- 音:環境音とセリフのバランスが取れているか
- 色:カット間で極端な色温度差がないか
- 解像度とアスペクト比:配信先の規定に合っているか
編集で吸収できるズレには限界があります。顔の輪郭が変わっているカットは、寄りにして部分的に見せる、モーションブラーでつなぐ、別カットに差し替えるなど、見せ方で解決するのが現実的です。
チーム運用とアセット管理
人数が増えるほど、一貫性は「技術」ではなく「運用」の問題になります。
命名規則を決める
キャラクター名、カット番号、バージョン、日付をファイル名に含めます。参照画像と生成物が混在すると、誤って古い参照を使う事故が起きます。
参照ライブラリを分離する
確定済みの参照セットは読み取り専用のフォルダに置き、作業中のファイルとは分けます。誰かが参照画像を上書きした瞬間に、チーム全体の出力が変わってしまうためです。
プロンプトを資産として管理する
キャラクター定義、ショット指定、ネガティブ指定を別々のテキストとして保存します。スプレッドシートでも構いません。再現性はここで決まります。
記録を残す
どのカットをどの設定で生成したかを記録しておくと、後から同じ質感で追加撮影ができます。トレーサビリティは、権利確認の観点でも役立ちます。
よくある質問
Q1. 参照画像は何枚が適切ですか
用途によりますが、5枚前後が実用的な出発点です。正面、斜め、全身、表情、衣装の5種類を基本形にし、必要に応じて追加します。10枚を超えると情報が矛盾しやすくなるため、増やすより選ぶことを優先してください。
Q2. 一度作ったキャラクターは別の作品でも使えますか
使えます。参照セットと固定プロンプトをそのまま流用し、衣装と背景だけを差し替えるのが基本です。シリーズ化を前提にするなら、最初から汎用性の高い参照を用意しておくと後が楽になります。
Q3. 生成モデルが更新されたら作り直す必要がありますか
多くの場合、参照セットはそのまま使えます。ただしモデルの癖が変わるため、最初の1カットで必ず検証してください。参照の強度や動きの設定は、更新ごとに再調整が必要です。
Q4. 実写とアニメ、どちらが一貫性を保ちやすいですか
一般にアニメ調のほうが保ちやすいです。線と塗りが単純化されているため、わずかなズレが目立ちにくいからです。実写調は肌の質感や毛穴の再現度が高いぶん、少しの差が別人感につながります。
Q5. 一貫性を最優先にすると、映像が単調になりませんか
なります。対策は、人物は固定したまま、カメラワーク、照明、背景、音で変化をつけることです。人物の見た目で变化を作ろうとすると、必ず崩れます。
Q6. どのくらいの尺から現実的ですか
15〜30秒の短尺から始めるのがおすすめです。カット数が少ないほど管理が簡単で、失敗から学べる範囲も狭くなります。慣れてきたら1分、3分と伸ばしてください。
Q7. 生成がうまくいかないときは何から疑うべきですか
まず参照画像を疑ってください。次にプロンプトの矛盾、最後にパラメータです。多くの失敗は、モデルではなく入力の側に原因があります。
まとめにかえて:一貫性は「固定」と「変化」の設計
AI動画でキャラクターの一貫性を保つ作業は、テクニックの寄せ集めではなく、何を固定し何を変えるかを決める設計作業です。構造層を参照画像で固定し、表層をシーンごとに変える。この原則さえ守れば、モデルが入れ替わっても、ツールが更新されても、同じ人物を映し続けられます。
最初の一歩としては、手持ちの写真から5枚の参照セットを作り、3カットだけの短いテストを生成してみてください。顔が一致していれば設計は成功です。ズレる場合は、参照のバリエーションを増やし、プロンプトの人物記述を削る。この往復を数回繰り返すだけで、作業の再現性は目に見えて上がります。一貫したキャラクターは、特別な機能ではなく、地味な準備の積み重ねから生まれます。


