Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画でキャラクターがブレない!マルチ画像参照で同一性を保つ実践ワークフロー完全ガイド

Oct 5, 2026

なぜAI動画でキャラクターが「ブレる」のか

テキストから動画を生成するモデルは、入力された言葉を手がかりにフレームを組み立てる。だが「同じ人物であり続ける」という概念は、モデルにとって本質的にあいまいだ。同じプロンプトを入力しても、乱数の種が変われば、顔の輪郭、目の間隔、鼻の高さ、髪の分け目、衣装のステッチの位置まで少しずつ変化する。これは不具合ではなく、生成モデルが持つ確率的な性質そのものである。

1カットだけの短い動画なら、この揺らぎはほとんど気にならない。問題は、複数のカットをつないで一つの物語や広告、解説動画を作るときに表面化する。人間の脳は、顔のわずかな違いを驚くほど敏感に検出する。眉の角度が数度変わっただけでも「別人だ」と感じ取ってしまう。視聴者が違和感を覚えた瞬間、映像の説得力は失われる。

一貫性が崩れる主な原因

原因は大きく四つに分けられる。第一に、プロンプトだけで人物を指定していること。第二に、参照画像の情報量が不足していること。第三に、カットごとに構図や照明条件が変わることでモデルが別人として解釈してしまうこと。第四に、モデルごとに得意な表現が異なるのに、同じ指示で使い回していることだ。

特に見落とされやすいのは第三の原因である。同じ人物でも、逆光で撮られたカットと正面からの柔らかい光のカットでは、肌のトーンも影の落ち方もまったく違う。モデルはそれを「別の人物」として処理してしまうことがある。つまり一貫性の問題は、モデルの性能だけでなく、制作側の設計にも大きく依存している。

ブレが許されるケース、致命的になるケース

すべての制作で厳密な一貫性が必要なわけではない。夢の中のシーン、回想、抽象的な表現では、顔が揺らぐことに演出上の意味を持たせられる。一方で、シリーズ物の主人公、企業広告に登場するキャラクター、教育コンテンツの案内役などは、1カットでも別人に見えた時点で信頼を損なう。

判断の基準はシンプルだ。「視聴者がこの人物を名前で呼ぶかどうか」を自問してみる。名前で呼ぶ存在であれば、顔・髪・体型・衣装の四点は最低限固定しなければならない。逆に、その場限りのモブや背景の人物であれば、厳密な固定に時間をかける必要はない。

マルチ画像参照という解決アプローチ

一貫性を守るための最も実用的な方法は、テキストだけで人物を説明するのをやめ、複数の参照画像を組み合わせて人物像を固定することだ。ここではこれを「マルチ画像参照」と呼ぶ。1枚の写真をそのまま使うのではなく、角度・表情・照明の異なる複数枚を組み合わせ、共通する特徴を浮かび上がらせる考え方である。

単一参照の限界

1枚の参照画像だけで生成を始めると、モデルはその1枚に写っていない情報をすべて想像で埋める。横顔のライン、後ろ髪の長さ、耳の形、首の太さ、立ち姿のバランスなど、見えていない部分は毎回の生成で変わってしまう。結果として、正面のカットは似ているのに横を向いた瞬間に別人になる、という典型的な失敗が起きる。

複数参照が効く理由

複数の画像を渡すと、モデルはそれらの間で共通する要素を手がかりに人物の「核」を推定しやすくなる。正面・斜め・横の三方向があれば立体感が補完され、表情のバリエーションがあれば骨格の特徴が安定する。衣装違いの画像を混ぜると、逆に衣装が固定されなくなるので注意が必要だ。あくまで同一条件のもとで撮影・生成された画像群をそろえたい。

参照画像セットの設計原則

理想的な参照セットは、次の条件を満たす。同一人物であることが一目で分かる。解像度が十分に高い。顔がはっきり写っている。照明条件が極端に違わない。背景がシンプル、または人物と明確に分離できる。そして、生成したいカットの構図に近い角度が含まれている。

この最後の条件は特に重要だ。正面のカットを作りたいなら正面の参照を、横顔のカットを作りたいなら斜め45度の参照を必ず入れておく。モデルは参照にない角度を苦手とする傾向があるため、必要な角度を先回りして用意するのが定石である。

参照画像セットの作り方

参照画像は、いきなり本番の生成に使うのではなく、事前に丁寧に整えておく。ここでの投資がそのまま最終的な一貫性の質になる。

選定チェックリスト

  • 顔のサイズが画面の一定以上の割合を占めているか
  • 目・鼻・口の形が判別できる解像度があるか
  • ピントが顔に合っているか(背景ボケは問題ない)
  • 髪型がはっきり分かるか(帽子やサングラスで隠れていないか)
  • 極端な逆光や強い色被りがないか
  • 表情がニュートラル、または用途に合った感情か
  • 同じ人物だと第三者が判断できるか

前処理と解像度の考え方

アップロード前に、画像のトリミングと明るさの調整を行っておく。人物を中央に配置し、余白を詰める。色温度が極端に異なる画像は、同じ方向に寄せておくと安定しやすい。拡大による解像度の水増しは逆効果で、ぼやけた輪郭をモデルが忠実に再現してしまう。

また、参照画像の枚数は多ければよいというものではない。方向性の違う画像を10枚混ぜるより、同じ方向性の画像を4〜6枚そろえるほうが結果は安定する。迷ったら「この1枚を基準に、残りは補助」という主従関係を意識して選ぶとよい。

ワークフロー全体像:企画から書き出しまで

ここからは、実際の制作手順を順番にたどる。重要なのは、生成を始める前に決めることを決めきることだ。思いつきで生成を繰り返すと、似たような失敗を何度も再生産することになる。

ステップ1:キャラクター定義書をつくる

一枚のドキュメントに、人物の設定を書き出す。年齢感、骨格、髪色と髪型、瞳の色、肌のトーン、体型、基本の衣装、小道具、性格、話し方。文章で書くことが目的ではなく、カットをまたいで判断に迷ったときに立ち返る基準を持つことが目的である。

この定義書は、プロンプトの材料にもなる。たとえば「落ち着いた印象の30代、面長、黒髪のショートボブ、切れ長の目」といった具体的な言葉は、そのまま生成指示に流用できる。抽象語だけを並べた定義書は役に立たない。

ステップ2:参照セットを固定する

定義書に沿って参照画像を選び、フォルダにまとめて「確定版」として扱う。以後、このセットを変更したくなったら、その理由を必ず記録する。参照セットの差し替えは、作品全体の見た目を変える大きな変更だからだ。

ステップ3:ショットリストを設計する

カットごとに、誰が、どこにいて、何をしていて、どの角度から撮るのかを一覧にする。同じ人物が連続するカットでは、可能な限り照明と時間帯をそろえる。昼のシーンと夜のシーンが交互に切り替わる構成は、一貫性の維持という意味では難易度が高い。

ショットリストを作る際は、同じ人物が登場するカットを固めて生成するのが効率的だ。モデルやパラメータを切り替える回数が減り、結果のばらつきも抑えられる。

ステップ4:生成と検証のループ

生成したカットは、その場で次工程に進めず、必ず検証する。検証の観点は、顔の同一性、髪型、衣装のディテール、体型のバランス、手指の破綻、背景の論理的な整合性の六つ。一つでも大きく崩れていれば、そのカットは作り直す。

検証では、直前のカットと並べて見ることが欠かせない。単体で見ると気づかない差異も、並べると一目で分かる。この「並べる」作業を省いたために、編集段階で大量の作り直しが発生するケースは非常に多い。

ステップ5:編集と最終チェック

編集ソフトに取り込み、カットをつないだ状態で通しで視聴する。このとき、色調補正やグレインなどの共通処理を全カットに適用すると、細かな差異が視覚的に吸収され、一貫性が高まって見える。逆に、カットごとに色がばらついていると、それだけで別世界のように感じられる。

音を入れた状態での確認も忘れない。BGMや効果音が加わると、視聴者の注意は分散し、映像の細部への視線は弱まる。ただし、それは修正を怠る口実にはならない。音を入れてもなお気になる箇所は、必ず直すべき箇所である。

プロンプト設計のコツ

参照画像を使う場合でも、プロンプトは依然として重要だ。役割分担を明確にすると、結果が安定する。

固定する要素、動かす要素を分ける

プロンプトの中で、人物の特徴は参照画像に任せ、プロンプトでは動き・カメラ・ライティング・感情を指定する。人物の説明をプロンプトに長々と書き込むと、参照画像の情報と衝突し、かえって揺らぎが大きくなる。

たとえば「参照の人物が窓辺で振り返る、ゆっくりした首の動き、柔らかい午後の光、肩までのミディアムショット」のように、動きと構図に集中する。人物そのものの説明は最小限にとどめる。

衣装・小道具・背景の管理

衣装をカットごとに変える作品では、どのカットでどの衣装かを先に表にまとめておく。同じ衣装のカットは連続して生成し、衣装を切り替えるタイミングで参照セットも切り替える。中途半端に混ぜると、袖の長さや襟の形がカットごとに揺れる。

小道具も同じ扱いだ。メガネ、帽子、鞄、スマートフォンなど、持ち物が変わる場面では参照画像にもその状態を反映させる。背景についても、屋内と屋外を往復する構成では、色温度と光の方向をできるだけ統一する。

モデル選定の判断基準

現在の動画生成モデルは、実写寄り、アニメ調、スタイライズドなど、得意な画風が分かれている。一貫性の維持しやすさもモデルによって差があるため、作品の性質に合わせて選ぶ必要がある。

画風と用途で選ぶ

実写風の人物を扱うなら、肌の質感と顔の立体感を得意とするモデルが向く。アニメ調やイラスト調であれば、線の安定性とキャラクターの記号性を重視する。広告や製品紹介のように短い尺で強い印象を与えたい場合は、映像の質感を優先し、長尺の物語では一貫性とカット間のなめらかさを優先する。

一貫性・動き・コストのトレードオフ

どのモデルにも得手不得手がある。一貫性が高いモデルは動きが控えめなことが多く、動きが派手なモデルは顔が崩れやすい傾向がある。料金や生成時間も含めて、三つの軸のどこを優先するかを決めておく。

実務的には、主人公のアップは一貫性重視のモデルで、風景カットやアクションの遠景は動き重視のモデルで、というように同一作品内で使い分けるのが現実的だ。ただし、同じ人物が登場するカットでモデルを混ぜると差異が目立つため、切り替えは人物が映らないカットに限定するとよい。

よくある失敗と修正方法

顔だけが変わる

最も多い症状である。原因はほぼ参照セットの不足か、プロンプトに人物説明が過多なこと。斜め・横の参照を追加し、プロンプトの人物記述を削る。それでも不安定な場合は、参照のうち最も似せたい1枚を明示的に優先指定する。

衣装が変わる

参照画像に複数の衣装が混ざっていると起こる。衣装ごとに参照セットを分割し、生成時は対象のセットだけを使う。小物も同様に、シーン単位でセットを切り替える。

年齢や体型が変わる

照明条件の急変や、引きの構図が原因になりやすい。顔が小さく写るカットでは、モデルが体格を推測し直す。対策として、同じ人物のバストアップ参照を常にセットに含め、引きのカットでも人物の比率を明示する。

モーフィングと手指の破綻

カットの途中で顔が別の顔に溶けていく現象は、動きの指示が大きすぎる場合に起きる。動きを小さく分割し、1カットあたりの変化量を減らす。手指の崩れは、手を画面の主要素にしない構図を選ぶことで回避できることも多い。

チーム運用とバージョン管理

複数人で制作する場合、属人的な判断が一貫性を壊す最大の要因になる。仕組みで防ぐ。

命名規則とフォルダ設計

参照画像、生成結果、書き出し済みカットを明確に分ける。ファイル名にはシーン番号、カット番号、リテイク回数を入れる。「final」「final2」「本当のfinal」といった命名は、後から必ず混乱を招く。

レビュー観点の標準化

チェックリストを共有し、誰が確認しても同じ結論になるようにする。顔、髪、衣装、体型、手指、背景の六項目を順に確認するだけで、見落としは大幅に減る。修正が必要な場合は、どのカットのどの要素が基準から外れているかを具体的に記録する。

長尺・シリーズ展開のための設計

一貫性は、1本の動画の中だけでなく、シリーズ全体で考えると効果が大きい。

カット割りの工夫

人物のアップと引きを交互に配置すると、視聴者は細部の違いに気づきにくくなる。逆に、似た構図のアップを連続させると、わずかな差異が強調されてしまう。編集段階で構図のリズムを設計することは、一貫性対策としても有効である。

シリーズで再利用する

確定した参照セットと定義書を保存しておけば、次回作で同じキャラクターを再登場させられる。衣装違いのバリエーションも、基本セットを土台にすれば短期間で準備できる。長期的には、これが制作コストを下げる最も確実な方法になる。

よくある質問

参照画像は何枚あれば十分か

用途によるが、4〜6枚が実用的な出発点になる。正面、斜め、横、表情違いを各1〜2枚そろえると安定しやすい。10枚以上を混ぜると、かえって情報が衝突して揺らぎが増えることがある。

1枚の画像しか手元にない場合は

まず、その1枚から別角度の画像を生成して参照セットを疑似的に作る方法がある。あるいは、その1枚を最も優先する参照として指定し、カット数を絞って撮影する。1枚しかない状態で長尺に挑むのは避けたい。

生成したカットを後から修正できるか

部分的な修正は可能だが、根本的な別人化は修正では直らないことが多い。迷ったら作り直すほうが結果的に速い。修正の連鎖は、作品全体の画質を下げる原因にもなる。

実写素材とAI生成を混ぜてもよいか

混在自体は問題ないが、色調とグレインを統一する処理を必ず行う。実写と生成の質感差は、視聴者にとっては人物の同一性以上に目立つことがある。

どのくらいの頻度で参照セットを見直すべきか

作品単位で固定し、シリーズをまたぐときだけ見直すのが基本である。制作中に参照を差し替えると、前半と後半で別人になる。

一貫性より動きを優先したい場合は

動きの激しいカットでは、顔のアップを避け、シルエットや後ろ姿で見せる演出に切り替える。動きの量と顔の露出は反比例すると考えておくとよい。

まとめ

キャラクターがブレない動画を作る鍵は、モデルの性能を過信せず、制作側で情報を設計することにある。参照画像を複数そろえて人物の核を固定し、プロンプトでは動きと構図に集中する。生成したら必ず前のカットと並べて検証し、崩れがあれば早い段階で作り直す。この流れを仕組みとして定着させれば、長尺でもシリーズでも安定した映像を作り続けられる。特別な才能は必要ない。決めるべきことを先に決め、確認すべきことを毎回確認する。それだけで、視聴者を物語に引き込む映像の質は大きく変わる。

Alexander

Alexander