Limited Time Offer: Get 50% OFF your first month of Pro & Ultra plans 🎉

マルチ画像フュージョンでキャラクターの一貫性を保つAI動画制作ワークフロー完全ガイド

Sep 20, 2026

AI動画でキャラクターが別人になる理由を整理する

生成AIによる動画制作は、1本のショートクリップを作る段階から、複数カットをつないでひとつの物語に仕上げる段階へと移りました。編集のタイムラインに並べたとき、視聴者が最初に違和感を覚えるのは音でも色でもなく「人物の同一性」です。1カット目の主人公と5カット目の主人公が、似ているのに別人に見える。その瞬間、物語への没入は途切れます。

この問題は、プロンプトを丁寧に書き足すだけでは解決しません。テキストは人物の「概念」しか運べないからです。「黒髪のショートボブ、茶色の目、白いシャツ」と指定しても、AIはその概念を毎回新しい顔に割り当てます。だからこそ、視覚的な参照を複数与えて特徴を固定するアプローチ、すなわちマルチ画像フュージョンが重要になります。

一貫性が崩れる3つの典型パターン

1. 顔・骨格のドリフト。 もっとも目立つ崩れです。輪郭の丸み、目の間隔、鼻の高さ、顎のラインがカットごとに数パーセントずつ動きます。単体では気づかない差でも、つなぐと「別の俳優」に見えます。

2. 衣装・質感のドリフト。 シャツの色が生成ごとに濃くなったり薄くなったり、ジャケットの素材が革からコットンに変わることがあります。柄物ほど崩れやすく、ロゴや文字はほぼ毎回変わります。

3. 画作り・色・レンズ感のドリフト。 人物が同じでも、カットごとに色温度、コントラスト、被写界深度が変わると、同じ作品に見えません。これはキャラクターではなく「撮影条件」の一貫性の問題ですが、視聴者には同じ種類の違和感として届きます。

なぜテキストの書き足しでは足りないのか

プロンプトに形容詞を増やすと、モデルはその形容詞を「平均的な顔」に反映させます。つまり毎回ゼロから顔を作り、毎回同じ形容詞を当てているだけです。参照画像を与えない限り、前のカットで作った顔を覚えているわけではありません。ここが根本的な理由です。

さらに厄介なのは、同じプロンプトと同じシードを使っても、解像度やアスペクト比を変えただけで出力が変わる点です。縦長にしただけで顔のバランスが崩れるのはよくある話です。つまり一貫性は「文章力」の問題ではなく、「条件設計」の問題だと考えたほうが現実的です。

マルチ画像フュージョンとは何か

マルチ画像フュージョンは、複数の参照画像から人物の本質的な特徴を抽出し、それを単一の安定した参照として生成プロセスに組み込む考え方です。1枚の写真をそのまま使うのではなく、角度・表情・照明の異なる複数枚を統合することで、特定のポーズや光に依存しない「人物そのもの」の表現を得ます。

単純な画像合成との違い

複数画像を平均化してぼやけた1枚を作る処理とは別物です。フュージョンの目的は平均像ではなく、ぶれない同一性です。髪の分け目、眉の角度、口元の形といった識別に効く要素を保ちながら、照明やポーズといった可変要素を切り離します。

平均化してしまうと、特徴が薄まって「どこにでもいる顔」になります。フュージョンでは識別に効く差分だけを残し、その他の差分をノイズとして扱います。この取捨選択の精度が、出力の安定度を左右します。

「参照ベクトル」という考え方

細かい実装はツールごとに異なりますが、概念としては共通です。参照画像群は特徴空間上のひとつの点(参照ベクトル)にまとめられ、生成時にはテキストプロンプトと並んで条件として使われます。テキストが変わっても参照ベクトルが同じなら、出力は同じ人物であり続けます。

この考え方の利点は、再利用できることです。一度よい参照ベクトルを作れば、衣装を変える、時間帯を変える、季節を変えるといった派生シーンに何度でも使い回せます。

モデル側で起きていること

モデルは、テキスト条件と視覚条件の両方を満たす画像を生成しようとします。テキスト条件が強いモデルは指示に忠実ですが、参照の影響が弱まることがあります。逆に参照を強く効かせるモデルは、ポーズ指定が効きにくくなることがあります。この綱引きを理解しておくと、後述するパラメータ調整の勘所がつかめます。

参照画像セットの設計:ここで結果の大半が決まる

一貫性の品質は、生成時のパラメータよりも参照画像の設計で決まります。どんなに優れたモデルでも、参照が悪ければ結果は不安定になります。

必要な枚数の目安

基本は3〜6枚です。1枚ではポーズや照明に引っ張られ、多すぎると特徴がぼやけます。まずは正面1枚、斜め45度2枚、横顔1枚、表情違い1枚の5枚構成から始めると安定します。

揃えるべきバリエーション

  • 角度:正面、斜め、横、軽い俯瞰
  • 表情:無表情、微笑み、真剣
  • 照明:柔らかい拡散光、やや硬いサイド光
  • 距離:バストアップ、顔アップ

逆に、同じ構図の似た画像を並べても意味がありません。情報量が増えないからです。

避けたい参照画像

  • 顔が半分隠れている(マスク、サングラス、手、髪)
  • 強いフィルター、過度な美肌補正、HDR
  • 極端な逆光や強いカラーフィルター
  • 低解像度、ブレ、圧縮ノイズの多い画像
  • 複数人が写っている画像

参照画像に写っていない情報は、モデルが勝手に補完します。補完は毎回ランダムなので、結果がぶれます。参照画像の品質は、そのまま一貫性の上限になります。

キャラクターシートの作り方

参照画像は「データ」として管理します。おすすめは、キャラクターごとに1枚のシートを作ることです。正面・斜め・横の顔、全身、衣装のディテール、小物、そして配色パレットを並べます。

シートには必ずテキストのメモを添えます。肌の色味、瞳の色、髪の長さ、身長感、年齢感、体型、特徴的なアクセサリー。人間が読むためだけでなく、プロンプトの固定ブロックを書くときの原稿として機能します。

衣装を変える場合の注意

シリーズ途中で衣装が変わる作品は多くあります。その場合でも、顔の参照セットは変えず、衣装だけを別の参照として差し替えます。顔と衣装を同じ参照に混ぜると、衣装を変えた瞬間に顔も動きます。役割ごとに参照を分けるのが原則です。

実践ワークフロー:7つのステップ

ここからは実際の制作手順を順番に追います。ショート動画でも長編でも基本の流れは同じです。

ステップ1:キャラクター仕様書を作る

最初に文章で仕様を固定します。年齢、性別、体型、髪型、髪色、瞳の色、肌のトーン、服装、小物、雰囲気。この段階で曖昧な表現を排除します。「ナチュラルな雰囲気」ではなく「落ち着いた表情で、眉はやや太め」と書きます。

ステップ2:参照画像を生成または収集する

画像生成モデルで参照用の静止画を作る場合、いきなり動画に進まず、まず顔を固めます。同じプロンプトと同じシードで数十枚出し、その中から識別性の高いものを選びます。角度違いを作るときは、シードを固定したまま構図だけを変えると崩れにくくなります。

ステップ3:参照を固定してテスト生成する

参照セットを登録したら、いきなり本番シーンを作らず、短いテストクリップを5本ほど生成します。同じ人物が同じ顔で出ているか、髪の長さが一定か、肌のトーンが一定かを確認します。

ステップ4:シーン記述と外見記述を分離する

プロンプトは「固定ブロック」と「可変ブロック」に分けて書きます。固定ブロックには人物の外見と画作りを書き、可変ブロックにはシーンの行動、場所、時間、感情を書きます。この分離ができていると、シーンを差し替えても人物が崩れません。

ステップ5:カットを量産する

同じ参照セットと同じ固定ブロックを使い、可変ブロックだけを入れ替えてカットを増やします。1カットにつき3〜5テイク生成し、よいものを残す運用が現実的です。

ステップ6:検証と差し戻し

生成したカットを並べて見比べます。差分が出たカットは、そのまま使わず参照の再確認をします。原因は多くの場合、参照画像の不足、プロンプトの矛盾、解像度や比率の変更の3つです。

ステップ7:アセットとして保存する

うまくいった参照セット、固定ブロック、シード値、使用モデル、解像度をセットで記録します。次回の制作で同じ人物を出したいとき、この記録があれば数分で再現できます。

プロンプト設計の実務テクニック

固定ブロックと可変ブロックを分ける

固定ブロックの例:人物の外見、髪、瞳、肌、衣装の基本形、レンズ感、色温度、フィルムルック。可変ブロックの例:場所、時間帯、天候、動作、感情、カメラワーク。

重要なのは、固定ブロックの語順と語彙を毎回まったく同じにすることです。言い換えは厳禁です。「白いシャツ」と「ホワイトのシャツ」は、モデルにとって別の指示になり得ます。

順序と重み

一般的に、プロンプトの前半は影響が強く、後半は弱くなります。人物の識別に効く要素は前半に置きます。逆に、シーンの雰囲気づくりは後半に回します。

ネガティブ指定の使いどころ

避けたい要素はネガティブ側に書きます。ただし、書きすぎると出力が硬くなります。まずは「顔の崩れ」「余分な指」「透かし文字」程度に絞り、必要になったら足す運用が安全です。

参照との矛盾を避ける

参照画像に帽子がないのにプロンプトで帽子を指定すると、モデルは帽子を足しつつ顔も作り直そうとします。これがもっとも多い崩れの原因です。参照にない要素を足したい場合は、参照側を先に更新します。

シード・解像度・アスペクト比の管理

一貫性は地味な設定にも左右されます。

シード。 同じシードは同じノイズから生成を始めるための出発点です。人物を固定したいときは、まずシードを固定して構図だけを変えるのが定石です。ただし、シードを固定しすぎると構図の自由度が落ちます。シリーズ全体では固定、カット内のバリエーション出しでは変更、という使い分けが現実的です。

解像度。 途中で解像度を変えると顔の描き込み量が変わります。低解像度でテストしたものを高解像度で本番化すると、顔が微妙に変わります。テスト段階から本番と同じ解像度で確認するのが安全です。

アスペクト比。 縦横比の変更は構図の再計算を伴います。横長で作った顔を縦長で出すと、頬の幅や顎のラインが変わることがあります。縦横の両方が必要な作品では、両方の比率で参照セットを検証しておきます。

フレームレートと尺。 長い尺ほど後半で崩れやすくなります。まずは短いカットで顔を確認し、問題なければ長いカットに進む順序が効率的です。

よくある失敗と対処法

顔だけが変わる

参照画像のバリエーション不足が最有力です。正面1枚だけを使っているケースが多く、斜めと横を追加するだけで改善します。次に疑うのは、プロンプト内で髪型や年齢の記述が二重に書かれていることです。

衣装が毎回変わる

衣装をテキストだけで指定していると起こります。色名はモデルごとに解釈が違います。衣装専用の参照画像を用意し、色は具体的な色名と明度で指定します。

背景と人物が分離して見える

人物と背景を別々のタイミングで生成し、合成している場合に起こります。照明の方向と色温度をプロンプトで統一し、人物に落ちる影の向きを揃えます。

手や小物が崩れる

顔の固定を優先すると、手や小物の一貫性は後回しになりがちです。手を使うカットでは、手元が見える参照を1枚追加すると安定します。小物は単体の参照を用意し、毎回同じ形状を参照させます。

動きが不自然になる

参照を強く効かせすぎると、動きが硬くなります。参照の強度とモーション指定のバランスを取り、必要なら動きの大きいカットだけ参照強度を下げます。

色がカットごとに変わる

これは生成ではなく編集で解決できる問題です。カットごとにホワイトバランスとカラーグレーディングを揃え、LUTを共通化します。生成側で完璧を目指すより、仕上げで揃えたほうが早いことが多いです。

長編・シリーズ制作への応用

複数話のシリーズでは、キャラクターの一貫性がブランド資産になります。視聴者は顔を覚えて戻ってくるからです。

エピソードをまたぐ管理

エピソードごとに参照セットを新規作成すると、少しずつ顔が変わります。必ず同一の参照セットを使い回し、変更する場合は全エピソードへの影響を確認します。

成長・変化の表現

物語でキャラクターが年を取る場合、参照セットを段階的に作ります。10代、20代、30代の3セットを用意し、どのエピソードでどれを使うかを決めておきます。1セットを少しずつ改変する方法は、どこかで必ず破綻します。

群像劇での優先順位

主要人物3人を同時に固定しようとすると難易度が跳ね上がります。まず主役1人を完成させ、その参照セットが安定してから次の人物に移ります。

ストーリーボードとの連携

カット割りを先に決め、各カットに必要な参照(人物、衣装、小物、背景)を書き出します。撮影でいう準備リストと同じです。この工程を飛ばすと、後半で参照不足に気づきます。

ツール選定の判断基準

ツールは流行ではなく、自分のワークフローに合うかで選びます。

参照画像の扱い方

何枚まで参照できるか、参照の強度を調整できるか、参照の登録を再利用できるか。この3点を最初に確認します。参照が毎回リセットされるツールは、長編制作には向きません。

モーション制御

カメラワークと人物の動きを別々に指定できるかどうかは、演出の幅に直結します。動きの指定が苦手なツールは、静止に近いカット向きと割り切るのも手です。

出力の安定性と再現性

同じ設定で同じ結果が出るかは、シリーズ制作では決定的です。テストとして、同じプロンプトとシードで3回生成し、どれだけ揃うかを確認します。

ワークフロー連携

生成した素材を編集ソフトにどう渡すか、命名規則をどう統一するかも重要です。ファイル名にキャラクター名、シーン番号、テイク番号を入れておくと、後工程が楽になります。

コストと時間のバランス

1カットあたりの生成時間と、やり直しの回数はトレードオフです。参照設計に時間をかけるほど、生成のやり直しは減ります。逆に、参照を軽視して大量生成すると、選別に時間を取られます。

よくある質問

Q. 参照画像は何枚が最適ですか。

A. まず5枚前後から始めてください。正面、斜め2枚、横、表情違いが基本構成です。崩れが残る場合に追加し、安定したら減らして検証します。

Q. 1枚の写真からでも一貫性は出せますか。

A. 短いカットなら可能ですが、角度が変わると崩れやすくなります。同じ人物の別角度を生成して参照に加えるだけでも安定度は上がります。

Q. 実写風とアニメ調、どちらが安定しますか。

A. 一般にアニメ調のほうが輪郭が単純なため安定しやすい傾向があります。実写風は肌の質感や照明の影響を受けやすく、参照の品質がより重要になります。

Q. 無料のツールでも同じことはできますか。

A. 参照画像を使えるツールであれば基本は同じです。ただし参照の枚数制限や強度調整の有無が使い勝手を大きく左右します。

Q. どれくらいの頻度で参照を見直すべきですか。

A. 新しい衣装、新しい時代設定、新しい共演者が入るタイミングで必ず見直します。それ以外は固定し、むやみに触らないのが原則です。

Q. 顔がどうしても安定しないときの最終手段は。

A. 顔が見えない構図に逃がす、後ろ姿やシルエットを使う、寄りのカットを減らすという演出上の解決策もあります。技術で解決できない部分は演出でカバーするのも立派な判断です。

まとめ:一貫性は「設計」でつくる

キャラクターの一貫性は、モデルの性能だけでは決まりません。参照画像の設計、プロンプトの分離、シードと解像度の管理、そして検証の習慣。この4つを仕組みとして持っているかどうかが結果を分けます。

最初から完璧を目指す必要はありません。まず主役1人の参照セットを5枚で作り、固定ブロックを書き、短いテストを回す。この小さなサイクルを1回転させるだけで、シリーズ制作の景色はかなり変わります。そして一度作った参照セットは、次の作品でも資産として使えます。一貫性は制約ではなく、長く使える土台です。

Alexander

Alexander