Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

マルチ画像参照で実現するAI動画のキャラクター一貫性ガイド

Oct 4, 2026

カットが変わると別人になる:動画生成の最も根深い課題

AIによる動画生成は、ここ数年で驚くほど速く進歩した。ライティング、質感、肌のディテール、カメラワークの再現性といった要素は、単体のカットを見る限り実写と見分けがつかない水準に達している。ところが、5カット、10カットとつなげた瞬間に、多くの制作者が同じ壁にぶつかる。主人公の顔つきが変わり、髪の分け目が逆になり、ジャケットのボタンの数が増減し、瞳の色がわずかにずれる。視聴者は「何かがおかしい」と感じるが、その正体を言葉にできない。この違和感の正体こそ、キャラクターの一貫性の欠如である。

静止画生成であれば、1枚の完成度がすべてだ。しかし動画は時間軸を持つメディアであり、同じ人物が複数のショットをまたいで存在し続けなければならない。ここに、テキストから映像を生成するパイプラインの構造的な弱点が現れる。モデルは「その瞬間の絵」を作ることは得意だが、「時間をまたいで同一の存在」を保持することは苦手なのだ。

この記事では、その弱点を埋めるための実践的な方法として、複数の参照画像を統合してキャラクターの本質的な定義を抽出するアプローチを扱う。単一の参照画像に頼る従来のやり方がどこで破綻するのかを整理し、参照セットの設計、プロンプトの書き分け、モデルごとの相性、ショット設計、そして失敗したときの原因切り分けまでを順に解説する。読み終えたときには、短編を最後まで一貫したキャラクターで作り切るための、再現可能な手順が手元に残っているはずだ。

単一参照画像が限界を迎える理由

もっともよく使われる手法は、キャラクターの立ち姿を1枚用意し、それを参照として各ショットを生成するやり方だ。手軽ではあるが、この方法には構造的な問題がある。モデルは参照画像を「その人物の定義」ではなく「その瞬間のスナップショット」として解釈しやすい。つまり、参照画像に写っているポーズ、光の当たり方、背景、レンズの歪みまで含めて、ひとつの場面として丸ごと学習してしまう。

その結果、次のような現象が起きる。参照画像が正面の立ち姿であれば、正面のショットは安定する。しかし、横顔、見上げる構図、走っている姿、座っている姿を生成しようとすると、モデルは参照から大きく逸脱した補完を行う。顔の骨格が変わり、鼻の高さが変わり、服のシルエットが別物になる。参照画像に含まれていない角度の情報を、モデルが「もっともらしく埋めてしまう」からだ。

さらに厄介なのは、テキストプロンプトを詳細にしても解決しない点である。「茶色のショートヘア、そばかす、緑の瞳、赤いジャケット」と書き込んでも、それは言語的な記述であって視覚的な同一性の保証ではない。モデルは「茶色のショートヘア」という一般的な概念に寄っていき、結果として参照画像の人物ではなく「その特徴を持つ平均的な人物」に収束する。

つまり単一参照は、参照画像と似た条件のショットでは強いが、条件が離れるほど急速に弱くなる。カメラアングル、距離、表情、照明、衣装の状態——これらが少しずつ変わっていくのが動画の常である以上、単一参照は本質的に不安定な土台なのである。

参照画像が「場面」として解釈される罠

この問題を理解するには、モデルが画像をどのように扱うかを想像するとよい。1枚の画像には、人物の特徴と、その場の状況が混ざっている。背景の色、光源の方向、体の向き、手の位置。モデルにとってこれらは分離されたパラメータではなく、ひとつのまとまりとして入力される。だから「人物だけを引き継ぎ、状況は捨てる」という器用な芸当が苦手なのだ。参照画像を増やして、共通部分と可変部分を分離させる発想が必要になる。

一貫性の破綻はどこで起きるか

破綻はたいてい、ショットの条件が大きく変わる地点で起きる。会話ショットからアクションショットへ切り替わる瞬間、屋内から屋外へ出る瞬間、正面から背面へ回り込む瞬間。逆に言えば、条件の変化が小さいカットの連続では、単一参照でもそれなりに見えてしまう。問題が表面化しないまま制作が進み、終盤の山場で崩壊するというパターンが非常に多い。

マルチ画像フュージョンは何をしているのか

複数参照のアプローチは、単純に「参照を増やして精度を上げる」という話ではない。狙いは、複数の画像に共通して現れている要素を取り出し、それをキャラクターの恒久的な定義として扱うことにある。

たとえば、同じ人物の正面、斜め45度、横顔、笑顔、無表情、全身の5枚を用意する。この5枚に共通して現れているのは、顔の骨格、目の間隔、鼻筋の形、髪の生え際、体型の比率といった、角度や表情に依存しない特徴である。一方、5枚の間で異なっているのは、ポーズ、表情、照明、背景、服装の状態だ。マルチ参照の処理は、この「共通部分」と「可変部分」を統計的に分離し、前者を固定パラメータとして扱おうとする。

この分離がうまく働くと、新しいショットを生成するときに、モデルは共通部分をそのまま維持し、可変部分だけをプロンプトに従って動かす。結果として、走るシーンでも、見上げるシーンでも、夜の照明でも、同じ人物として認識できる出力が得られやすくなる。

「平均化」と「抽象化」の違い

ここで誤解しやすい点がある。複数画像を混ぜると、特徴が薄まって無難な顔になるのではないか、という懸念だ。実際には、設計の仕方によって結果は正反対になる。似た角度・似た表情の画像ばかりを集めると、情報が重複しているため共通部分の抽出精度が上がらず、単に平均化された印象の薄い顔になりやすい。逆に、角度・表情・距離に意図的な幅を持たせると、変動要因が明確になり、共通部分がくっきりと浮かび上がる。

参照の「質」より「幅」が効く

高解像度の画像を1枚足すより、異なる角度の中解像度画像を1枚足すほうが、一貫性の改善に効くことが多い。動画生成において必要なのは、ディテールの情報量ではなく、三次元的な構造の手がかりだからだ。正面と横顔があれば、モデルは頭部の奥行きを推論できる。斜め上からと斜め下からの2枚があれば、顎のラインと首の付け根の関係が推論できる。この「推論の手がかり」を増やすことが、複数参照の本質である。

参照画像セットの設計:5枚から8枚で定義を作る

実務では、5枚から8枚程度の参照セットが扱いやすい。多すぎると管理が煩雑になり、互いに矛盾する情報が混ざるリスクも上がる。以下は、汎用性の高い構成の例だ。

1枚目は正面のバストアップ。顔の比率を決める基準になる。2枚目は斜め45度のバストアップ。奥行きの手がかりを与える。3枚目は横顔。鼻筋、顎、耳の位置を固定する。4枚目は笑顔、5枚目は無表情または真剣な表情。表情の可変幅をモデルに教える。6枚目は全身の立ち姿。頭身と体型の比率を与える。7枚目はやや引きの構図で、服装の全体像がわかるもの。8枚目は斜め後ろまたは横向きの全身。動きのあるショットへの耐性が上がる。

やってはいけない参照セット

避けるべきなのは、次のような構成だ。すべてが同じ日、同じ照明、同じレンズで撮られたセット。これは共通部分と可変部分の分離が難しくなる。極端に高解像度な1枚と、粗い数枚の混在。モデルがどちらの情報を優先すべきか判断できず、出力が不安定になる。生成AIで作った画像と実写風の画像の混在。描画スタイルの差が「別人物の特徴」として解釈されることがある。そして最も危険なのは、互いに矛盾する情報を含むセットだ。瞳の色が画像ごとに違う、髪の長さが違う、年齢が違って見える。この状態で生成すると、モデルは矛盾を平均化し、どの画像とも似ていない人物を出力する。

アニメ調・イラスト調のキャラクターの場合

アニメ調のキャラクターでは、参照セットの考え方を少し調整する。線の太さ、目の形状、髪のハイライトの配置といった「作画記号」が同一性の核になるため、これらがはっきり写っている画像を優先する。また、表情差分が豊富にあると強い。一方で、デフォルメの度合いが画像ごとに違うセットは避けたい。等身が変わると、モデルは別のキャラクターとして扱ってしまう。

プロンプトと参照画像の役割分担

参照画像を増やしたからといって、プロンプトが不要になるわけではない。むしろ役割分担が重要になる。原則はシンプルで、参照画像に「誰であるか」を任せ、プロンプトに「何をしているか」を任せる。

参照画像に含まれる情報をプロンプトで繰り返すと、かえって出力が不安定になることがある。たとえば参照セットで髪色が明確なのに、プロンプトで「明るい茶髪」と書くと、モデルは参照の髪色とテキストの「明るい茶髪」の間で調整を行い、結果としてどちらでもない色になる。参照で固定できる要素は、テキストで触らないのが原則だ。

逆に、プロンプトで必ず指定すべきなのは、次の項目である。ショットのサイズ(バストアップ、ミディアム、フルショット)、カメラの高さと角度(アイレベル、見上げ、見下ろし)、動作(歩く、振り向く、座る)、表情の方向性(微笑、無表情、驚き)、照明の状況(逆光、室内の拡散光、夜の街灯)、そして背景の内容。これらは参照画像から読み取れない、そのショット固有の情報である。

ポジティブ指定より「除外」が効く場面

一貫性が崩れるとき、原因の多くは参照にない要素をモデルが勝手に補完することにある。したがって、ネガティブ指定が有効な場面も多い。顔の輪郭を変えない、年齢を変えない、髪型を変えない、別人にしない——こうした指定は、モデルが参照から逸脱しようとする動きを抑える働きをする。すべてのモデルが同じように反応するわけではないので、同一のプロンプトで数回試し、効果を確認してから本番に使うとよい。

プロンプトの再利用と差分管理

ショットを量産するときは、共通ブロックと差分ブロックを分けて管理する。共通ブロックには、作品全体のトーン、画質の方向性、カメラの質感などを書く。差分ブロックには、そのショットだけの動作とカメラワークを書く。テキストファイルやスプレッドシートで管理しておけば、後から「このショットだけ表情が硬い」と気づいたときに、差分だけを差し替えて再生成できる。

モデル選定:リアル系・アニメ系・スタイル系の相性

複数参照の効果は、モデルの種類によって大きく変わる。すべてのモデルが同じように参照を扱えるわけではないため、作品の方向性とモデルの相性を最初に見極めることが、後の手戻りを減らす。

リアル系のモデル、たとえばFlux系やRunway、Kling、Soraのような高精細な映像生成を得意とする系統は、肌の質感や照明の再現に強い。人物の同一性を保つ仕組みも比較的充実しており、参照セットの幅を広げるほど効果が出やすい。一方で、参照に含まれる照明や背景まで強く引き継いでしまう傾向があるため、ショットごとに環境が大きく変わる作品では、環境の記述をプロンプトで明示的に上書きする必要がある。

アニメーションやスタイル特化の系統、たとえばPixVerse、Vidu、Pikaのようなモデルは、作画的な記号の再現に強い。線の質感や色のフラットさを維持したままキャラクターを動かせるため、イラスト調の作品では頼りになる。ただし、実写寄りのディテールを持つ参照画像を渡すと、スタイルの解釈がぶれることがある。参照セットのトーンをモデルの得意な方向に合わせて整えるのが得策だ。

ハイブリッド運用という現実解

ひとつのモデルですべてのショットをまかなおうとすると、どこかで無理が生じる。会話シーンは表情の繊細さが重要なモデル、アクションシーンは動きの破綻が少ないモデル、情景カットは光の表現が美しいモデル、というように分担するほうが最終的な品質は上がる。ただしその場合、モデル間でキャラクターの見た目をそろえる必要がある。ここで効くのが、共通の参照セットを全モデルに渡す運用だ。参照セットを「キャラクターの唯一の定義書」として扱い、モデルはあくまで描画エンジンとして切り替える。この発想にすると、モデルを増やすことが一貫性の敵ではなくなる。

選定の判断基準

モデルを選ぶときは、次の順で確認すると迷いが少ない。第一に、参照画像を複数受け付けるか、またその上限はいくつか。第二に、参照の影響がどのくらい持続するか(1カット内で収まるか、複数カットにまたがるか)。第三に、動きの大きいショットでの破綻の出方。第四に、出力の一貫性を保つために必要な試行回数。第五に、処理にかかる待ち時間と、やり直しのしやすさ。この5点を小さなテストで比較すれば、作品ごとの最適解は自然に見えてくる。

ショット設計とキャラクターの連続性

一貫性は生成技術だけで決まるわけではない。むしろ、編集段階の設計で大きく改善できる。視聴者が「同一人物だ」と認識するために必要な情報は、案外少ない。顔の全体像が毎回必要というわけではなく、髪型、シルエット、服装の一部、歩き方といった特徴が連続していれば、脳が補完してくれる。

この性質を利用すると、制作はぐっと楽になる。たとえば、条件の変化が大きいショットでは、顔を大きく映さない。後ろ姿、手元、肩越しの構図、影、遠景のシルエット——これらは一貫性のリスクが低く、なおかつ映像的なリズムを作れる。逆に、顔をしっかり見せるショットは、条件の変化が小さいカットの前後に置く。

つなぎ目の設計

カットの切り替わりでは、視聴者の注意が一瞬だけ緩む。この隙間を利用して、条件の変化を吸収させることができる。たとえば、屋外の会話ショットから屋内のシーンに移るとき、間に一枚、手がドアノブに触れるカットを挟む。すると視聴者は髪型や服の細部のわずかな差を気にしなくなる。逆に、正面のバストアップから正面のバストアップへ直接つなぐと、顔のわずかな差がもっとも目立つ。同じ画角の連続は、一貫性のチェックが最も厳しくなるポイントだと心得ておきたい。

動きの量と崩れやすさ

キャラクターが大きく動くショットは、それだけで崩れやすい。走る、跳ぶ、振り向く、髪をかき上げる。こうした動作は、顔の向きが大きく変わるため、参照画像に含まれていない角度の情報をモデルが補完する必要がある。対策は2つある。参照セットに該当する角度を追加しておくこと、そして動作を短いカットに分割し、1カットあたりの変化量を小さくすること。3秒のカットを1.5秒ずつに分けるだけで、破綻は目に見えて減る。

よくある失敗と対処法

一貫性の問題は、症状から原因を逆算できる。ここでは頻出するパターンと対処を整理する。

顔が毎回わずかに違う

もっとも多い症状だ。原因は多くの場合、参照セットの矛盾か、プロンプトによる上書きである。まず参照セットを見直し、瞳の色、髪の長さ、年齢感がそろっているかを確認する。次に、プロンプトから外見の記述を削る。参照で固定できる要素をテキストで二重に指定すると、かえってぶれる。

服のディテールが勝手に変わる

ボタンの数、ロゴの有無、柄の向き。これらは解像度が足りないと発生しやすい。参照セットの中に、衣装がはっきり写ったカットを1枚以上入れる。加えて、衣装の変化が物語上重要な場合は、ショットごとに衣装の状態をプロンプトで明示する。

全カットが同じ構図に見える

参照の影響が強すぎる場合に起きる。参照画像がすべて同じ構図だと、出力もその構図に引っ張られる。参照セットにバリエーションを持たせることで解決する。カメラワークの指定を強めるのも有効だ。

特定のカットだけ急に別人になる

そのカットだけ条件が極端に違う可能性が高い。照明、時刻、場所、動作。原因を特定するには、問題のカットを参照セットと同じ条件に近づけて一度生成し、崩れるかどうかを確認する。崩れなければ条件の差が原因、崩れれば参照セット側に問題がある。

スタイルが混ざる

実写調とイラスト調の参照が混在していると、出力のタッチが分裂する。参照セットは描画スタイルの面でも統一する。どうしても異なるスタイルが必要な場合は、作品内で「回想シーン」など明確な理由を持たせ、視聴者に意図として伝わる形にする。

実践ワークフロー:短編を最後まで一貫させる

ここまでの内容を、実際の制作手順に落とし込む。3分程度の短編を、ひとりの主人公で作り切る流れを想定する。

ステップ1:キャラクター定義書を作る

最初に参照セットを5枚から8枚そろえる。同時に、テキストで定義書を書く。年齢、身長、体型、髪型、瞳の色、特徴的な小物、服装の基本構成、声の印象。この定義書は生成には直接使わないが、参照セットの選定基準として機能する。矛盾に気づくのは、たいていテキストに書き出したときだ。

ステップ2:ショットリストを作る

物語を30から50のショットに分解する。各ショットについて、サイズ、角度、動作、照明、背景、必要な小道具を書き出す。このとき、同じ画角の連続を避けるように並べ替える。一貫性のリスクが高いショット(正面のアップ、大きな動作)が隣り合わないようにするだけでも、最終的な印象は大きく変わる。

ステップ3:テスト生成で基準を作る

本番前に、条件の異なる3種類のショットを試す。正面の会話、横を向いた動作、引きの全身。この3つが同じ人物に見えれば、参照セットは機能している。ひとつでも崩れる場合は、参照セットの段階に戻る。ここで時間をかけるほど、後の工程が速くなる。

ステップ4:ブロック単位で生成する

ショットを物語のブロック(導入、展開、転換、結末)に分け、ブロック単位で生成する。ブロックごとに参照の重心を少し変えると、物語の進行に合わせた変化を出しやすい。たとえば前半は表情豊かな参照を多めに、後半は陰影のある参照を多めにする。

ステップ5:つなぎと修正

生成したカットをつなぎ、崩れが目立つ箇所を洗い出す。修正は、参照セットの変更ではなく、ショットの分割、画角の変更、前後カットの入れ替えで対応できることが多い。生成をやり直すより、編集で解決したほうが速く、結果も自然になる。

品質チェックリストとFAQ

最後に、公開前の確認項目と、よくある質問をまとめる。

公開前チェックリスト

同じ人物が全カットで同一に見えるか。髪型、瞳の色、服装の基本構成が連続しているか。顔のアップが連続していないか。大きな動作のカットが連続していないか。照明の変化が物語上の理由を持っているか。つなぎ目に注意をそらすカットが入っているか。冒頭30秒と終盤の山場で、キャラクターが最もよく見えるように設計されているか。これらを確認するだけで、視聴者の違和感は大幅に減る。

FAQ:参照画像は多いほうがよいのか

多くすれば強くなるわけではない。5枚から8枚が実務的な上限の目安だ。それ以上増やすと、矛盾する情報が混ざる確率が上がり、管理コストも増える。増やすなら枚数ではなく角度の幅を意識する。

FAQ:参照画像に背景が写っていてもよいか

問題ないが、背景が毎回同じだと出力もその背景に引っ張られやすい。人物に注目させたい場合は、背景がシンプルな画像を混ぜると扱いやすくなる。

FAQ:生成した画像を参照に使えるか

使える。ただし、生成を重ねるごとに微妙なドリフトが蓄積する。元になる参照セットは常に固定し、生成物はあくまで追加の材料として扱うのが安全だ。

FAQ:一貫性と動きの自然さはどちらを優先すべきか

ショットの役割で決める。物語の要となるカットでは一貫性を優先し、動きの量を抑える。テンポを作るカットでは動きを優先し、顔を大きく映さない。すべてのカットで両方を最大化しようとすると、どちらも中途半端になる。

FAQ:うまくいかないときの切り分け手順

まず参照セットの矛盾を疑う。次にプロンプトによる上書きを疑う。次にショットの条件差を疑う。それでも解決しなければモデルとの相性を疑い、別系統のモデルで同じ参照セットを試す。この順番で確認すれば、原因の特定に無駄な時間を使わずに済む。

キャラクターの一貫性は、魔法のような機能で解決するものではない。参照セットの設計、プロンプトの役割分担、ショットの並べ方、そして失敗の切り分け手順。この4つを丁寧に積み上げたとき、視聴者は「同じ人物が物語を生きている」と感じる。技術がどれだけ進んでも、この積み上げの価値は変わらない。

Alexander

Alexander