Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画でキャラクターの一貫性を保つ方法|マルチ画像参照ワークフロー完全ガイド

Oct 10, 2026

AI動画制作で最も厄介な問題は、モデルの性能でもレンダリング速度でもありません。同じ人物が3カット目までは本人なのに、7カット目では別人になっている——この「一貫性の崩れ」です。企業研修、製品紹介、SNS向け縦動画、ブランドのシリーズ企画など、複数カットをまたぐプロジェクトでは、顔立ち・衣装・体格・声のトーンが少しずつズレるだけで、視聴者は無意識に違和感を覚え、伝えたいメッセージが届きにくくなります。

この記事では、単一の基準画像やテキストプロンプトだけに頼る従来の作り方を出発点に、複数の参照画像を組み合わせてキャラクターを固定する「マルチ画像参照」の考え方を整理します。あわせて、キャラクター設計書の作り方、ショット分解、プロンプトの型、ツール選定の判断基準、失敗パターンの対処法まで、実際の制作フローに沿って解説します。

なぜAI動画でキャラクターが崩れるのか

単一の基準画像とテキストプロンプトの限界

多くのツールは、1枚の基準画像(シード画像)とテキストプロンプトを起点に動画を生成します。短い1カットの制作ではこれで十分です。しかしショットが増えるほど、モデルは「どこを固定し、どこを自由に変えてよいか」を判断できなくなります。結果として、髪の分け目、目の間隔、顎のライン、肌の質感といった同一性の核になる要素が、カットごとに少しずつ再解釈されていきます。

テキストプロンプトによる指定も万能ではありません。「30代の男性、短髪、紺のスーツ」と書いても、モデルが思い描く「30代の男性」は毎回同じではありません。プロンプトは方向性を示す指示であり、同一性を保証する鍵ではないのです。

崩れが起きる3つの典型パターン

1つ目は顔貌ドリフトです。正面カットでは問題なくても、カメラが横を向いた瞬間に鼻筋や輪郭が別の人物に寄ります。2つ目は衣装・小物の変化です。襟の形、ボタンの数、ロゴの位置がカットごとに変わり、ブランドの統一感を壊します。3つ目は体型・年齢のドリフトです。全身カットが増えると身長の比率が変わり、近景では若く、遠景では老けて見えることがあります。

これらは単独で起きるとは限りません。顔が少しズレ、衣装も少し変わり、声のトーンも変わる。それぞれは小さな誤差でも、掛け合わさると「別の番組の映像をつないだような」印象になります。

照明・レンズ・アングルの差が一貫性を壊す

同じ人物でも、順光と逆光では顔の立体感が変わります。広角レンズと望遠レンズでは顔の比率が変わり、見上げるアングルと見下ろすアングルでは印象が反転します。生成モデルはシーンごとに最適な絵を作ろうとするため、前後のカットとの整合性よりも、そのカット単体の見栄えを優先しがちです。

つまり一貫性の問題は、モデルの性能だけではなく、制作者側が「固定すべき変数」を明示していないことにも起因します。逆に言えば、固定すべき変数を設計段階で決めておけば、同じモデルでも結果は大きく変わります。

マルチ画像参照という解決アプローチ

参照画像を「セット」として設計する

発想の転換点は、1枚の画像を渡すのではなく、人物の異なる角度・表情・距離感を写した画像群を渡すことです。複数の視点から同一人物の情報を与えることで、モデルは「この人物の不変な特徴」を推定しやすくなります。

最低限そろえたいのは次の6種類です。正面のバストアップ、左右30度の斜め、横顔、笑顔と真顔の表情違い、全身の立ち姿、上半身の手振りカット。これだけの情報があれば、多くのモデルは顔の骨格と髪型を安定させられます。

参照画像の品質チェックリスト

参照画像の質は、そのまま出力の質に直結します。撮影または生成の時点で、次の点を確認してください。解像度は顔のパーツが判別できる程度に十分か。背景はシンプルで、人物以外の要素が混ざっていないか。照明は顔に強い影や色かぶりが出ていないか。衣装は参照セット内で統一されているか。圧縮ノイズや過度なフィルター加工がないか。

特に見落としやすいのが、参照画像同士の矛盾です。正面は黒髪なのに横顔が茶髪、といった不整合があると、モデルはどちらを信じるべきか迷い、結果として平均化された別人が出力されます。

参照の優先順位と重み付け

すべての参照画像を同じ強さで扱う必要はありません。顔の同一性を最優先するなら正面と斜めを強め、動きの自然さを優先するなら全身と手振りカットを強めます。ツールによっては参照ごとに影響度を調整できるため、まずは顔優先の設定で固定し、動きが硬いと感じたら全身カットの比率を上げる、という順序で調整すると迷いません。

プリプロダクション:キャラクター設計書を作る

キャラクターシートに書くべき項目

一貫性は撮影前に決まります。テキストでよいので、キャラクターシートを1枚作りましょう。年齢と性別、身長と体型、髪の長さ・色・分け目、瞳の色、肌のトーン、眉の形、特徴的なパーツ(ほくろ、眼鏡、傷跡)、基本の衣装と色、声質と話す速さ、歩き方や癖。これらを文章と参照画像の両方で固定します。

ポイントは、形容詞ではなく数値や固有名詞で書くことです。「明るい色のシャツ」ではなく「生成りに近いアイボリーのオックスフォードシャツ」、「短髪」ではなく「耳が半分隠れる長さの黒髪」と書きます。曖昧な表現は、カットごとに別の解釈を生む余地になります。

衣装バリエーションのルールを決める

シリーズ動画では、衣装を変えたい場面もあります。その場合は「シーン単位で1着」というルールを守ると崩れにくくなります。カットごとに着替えると、視聴者は時間の経過を誤解し、モデルも前後の整合性を保てなくなります。衣装ごとに色コードや素材感を設計書に追記しておけば、後から別のカットを追加するときも迷いません。

小道具と世界観の固定

背景、机の上の小物、照明の色温度、ロゴの位置まで設計書に含めると、シリーズ全体の統一感が一段上がります。特に企業コンテンツでは、背景の変化がブランドの印象を左右します。同じ会議室、同じ窓の位置、同じ照明といった「舞台の固定」が、キャラクターの一貫性を補強します。

ショット設計:長尺でも崩れない分解の仕方

ショットリストと連続性メモ

撮影前のショットリストには、カット番号、内容、尺、カメラワーク、登場人物、衣装、参照画像の番号を並べます。さらに重要なのが連続性メモです。前のカットから何が継続しているか(服装、時間帯、感情、手に持っている物)を1行で書き添えます。

たとえば「カット4:同上着、感情はやや困惑、右手に資料」と書いておけば、カット5を生成するときのプロンプトに必要な情報が明確になります。連続性メモがないまま生成すると、右手の資料が消え、感情が朗らかに戻る、といった事故が起きます。

カメラワークと動きの語彙を固定する

モーションの一貫性も見落とされがちです。同じ人物がカットごとに歩幅や身振りの大きさを変えると、別人のように見えます。動きの語彙をあらかじめ決めておきましょう。歩く速度は一定、身振りは胸の高さまで、うなずきは小さく1回、といった具合です。

カメラワークも同様です。手持ち風の揺れを全カットに使うのか、三脚固定の安定した映像にするのかを決めておくと、カットをまたいだときの印象がそろいます。

アバター型と生成型を組み合わせる

決まった人物が決まった内容を話す場面は、アバター型のツールが得意です。一方、動作や情景を伴うナラティブなカットは、画像参照に対応した生成型モデルが向いています。両者を組み合わせ、「顔のアップと発話はアバター型」「情景カットは参照画像ベースの生成型」と役割分担すると、品質と効率のバランスが取れます。

プロンプト設計の実践テクニック

構造化プロンプトの型を決める

一貫性を高めるには、プロンプトの順序を毎回そろえることが効果的です。おすすめの型は、被写体(キャラクターIDと特徴)→衣装→動作→カメラワーク→照明→背景→スタイル→禁止事項の順です。順序が固定されていると、変更点が見つけやすく、再現も容易になります。

同じ人物を別カットで出すときは、被写体部分の記述を一字一句同じにします。「20代後半の女性、肩までの黒髪、左目の下に小さなほくろ」という固定ブロックを作り、それを毎回コピーする運用が有効です。

ネガティブ指定で崩れを予防する

避けたい要素を明示するのも有効です。顔の変化を防ぐなら「別人の顔、顔の輪郭の変化、年齢の変化」、衣装の変化を防ぐなら「衣装の変更、ロゴの変形、色の変化」、体の歪みを防ぐなら「余分な指、変形した手、不自然な関節」を指定します。

ただしネガティブ指定は増やしすぎると画そのものが硬くなります。実際に崩れた要素だけを追加し、リストを育てていく運用が現実的です。

感情と表情を段階で定義する

「笑顔」という一言は、モデルにとって幅が広すぎます。感情の語彙を3段階程度に分解しておきましょう。たとえば喜びなら、控えめな微笑み/自然な笑顔/声を出して笑う、怒りなら、眉をひそめる/強い口調/静かな怒り。段階を決めておけば、カット間の感情のつながりが自然になります。

ツール選定の判断基準

アバター型・画像参照型・テキスト型の違い

アバター型のツール(Synthesia、HeyGen など)は、登録した人物の顔と声を安定して使い回せる点が強みです。発話中心の研修・解説コンテンツと相性がよく、顔の一貫性はほぼ自動で担保されます。一方、自由な情景や大げさな動きは苦手です。

画像参照型の生成モデル(Luma、Kling、Runway、Pika など、参照画像に対応するもの)は、情景を含むナラティブ表現に強く、複数の参照画像を渡すことで人物を固定できます。ただし設定の腕前によって結果が大きく変わります。

テキスト型は手軽ですが、長尺の一貫性維持には最も向いていません。短い単発カットや背景素材の生成に割り切るのが賢明です。

用途別の選び方

社内研修や製品の使い方解説など、話者が固定でよい場合はアバター型を軸にします。ブランドの世界観を見せるショートフィルムや、SNS向けの連作ストーリーは画像参照型を軸にします。広告の商品カットのように、人物よりも物が主役の場合はテキスト型や画像生成を組み合わせると効率的です。

小さなテストで相性を測る

本番に入る前に、3カットのテストを作ることを強くおすすめします。正面のアップ、斜め45度の会話カット、全身の動作カット。この3つで顔が保てるか、衣装が変わらないか、手が破綻しないかを確認します。ここで崩れるツールは、本番の20カットでも必ず崩れます。テスト段階で見切ることが、結果的に最も時間を節約します。

実践ワークフロー:6つのステップ

ステップ1:企画と尺の決定

まず動画の目的、想定視聴者、配信先、尺を決めます。尺が決まればカット数と必要な参照画像の数が逆算できます。30秒なら6〜10カット、3分なら20〜30カットが目安です。

ステップ2:キャラクター設計書の作成

前述のキャラクターシートを作り、参照画像セットを用意します。この段階で衣装を1着に絞り、色と素材を確定させます。

ステップ3:ショットリストと連続性メモ

カットごとの内容、尺、カメラワーク、感情、小道具を表形式で整理します。表の右端に「前カットからの継続事項」を書く列を必ず設けてください。

ステップ4:プロンプトのテンプレート化

固定ブロック(人物記述)と可変ブロック(動作・カメラ・感情)を分けて管理します。表計算ソフトで管理すると、コピー漏れや表記ゆれを防げます。

ステップ5:生成と選別

各カットは3〜4案を生成し、最も崩れの少ないものを選びます。選ぶ際は「単体で美しいか」ではなく「前後のカットと並べて自然か」を基準にしてください。

ステップ6:編集と最終チェック

つなぎ合わせた状態で通しで視聴し、顔・衣装・照明・音声のつながりを確認します。必要ならつなぎ目に短いトランジションを入れ、違和感を緩和します。

よくある失敗と対処法

顔がカットごとに変わる

原因は参照画像の不整合か、人物記述の表記ゆれです。参照セットを見直し、人物記述を完全に同一のテキストに統一してください。それでも改善しない場合は、参照画像の枚数を増やすより、品質の高い正面と斜めの2枚に絞ったほうが安定することがあります。

衣装の細部が変わる

ロゴや柄は、生成モデルが最も苦手とする要素です。解決策は2つあります。1つは衣装を無地に近いデザインにすること。もう1つは、ロゴ部分を後工程で合成することです。生成に任せるより、編集で重ねるほうが確実で速い場面も多くあります。

手や指が崩れる

手は多くのモデルで弱点です。手を画面に入れるカットは、手を小さく写す、物を持たせる、ポケットに入れるなど、破綻しにくい構図に寄せます。どうしても必要な場合は、手元だけ別カットとして生成し、編集でつなぐ方法も有効です。

声と口の動きがずれる

音声のリップシンクは、発話スピードと休止の入れ方で精度が変わります。原稿を読み上げるときは、一文を短くし、句読点でしっかり間を取ります。早口の原稿は、どんなツールでもズレが目立ちます。

カット間で明るさが変わる

照明条件の記述を統一し、編集段階で色調整を行います。生成時点で完璧を目指すより、最後にまとめてトーンをそろえるほうが現実的です。

品質チェックと効率化のコツ

チェックリストを固定する

目視チェックは属人的になりがちです。顔、髪、衣装、小道具、照明、音声、リップシンク、画面比という8項目を毎回同じ順序で確認するチェックリストを作り、作業を機械的に進めます。

素材を再利用できる形で保存する

参照画像、プロンプトのテンプレート、キャラクター設計書、ショットリストは、次回のプロジェクトでも使える資産です。フォルダ構成と命名規則を最初に決めておくと、シリーズ展開が格段に楽になります。

すべてをAIに任せない

編集、色調整、テロップ、音声の仕上げは、既存の編集ソフトで行うほうが速く、品質も安定します。生成は素材作成、編集は人間の判断、という役割分担が現実的です。

よくある質問

参照画像は何枚あれば十分ですか?

最低3枚、理想は6枚です。正面、斜め、横顔の3枚で顔の骨格はかなり安定します。全身の動きが必要な場合は全身カットを追加してください。枚数を増やせば良くなるわけではなく、矛盾のない画像を選ぶことが重要です。

アバター型ツールと生成型モデル、どちらから始めるべきですか?

発話が中心で顔の安定を最優先するなら、アバター型から始めるのが安全です。情景や動作を含む映像を作りたい場合は、参照画像に対応した生成型モデルを試し、3カットテストで安定性を確認してから本番に進んでください。

一度作ったキャラクターは別の動画でも使えますか?

使えます。設計書、参照画像セット、固定プロンプトを保存しておけば、次回は同じ人物を短時間で再現できます。シリーズ化を想定しているなら、最初のプロジェクトから資産として整理しておくことを強くおすすめします。

生成に時間がかかりすぎる場合は?

解像度を下げてテストし、構図が決まってから最終解像度で再生成します。また、全カットを同じ日に作るのではなく、顔のアップを先に固めてから情景カットに進むと、手戻りが減ります。

無料のツールだけでも一貫性は保てますか?

短尺であれば可能です。ただし参照画像の枚数制限や解像度制限があることが多く、長尺では限界があります。まずは短い動画で運用を固め、必要になった時点で上位のプランや別ツールを検討するのが現実的です。

まとめ:一貫性は「設定」で決まる

キャラクターの一貫性は、特別な魔法ではなく、固定すべき変数をあらかじめ決めておくことで生まれます。参照画像をセットで用意し、設計書で数値と固有名詞を確定し、ショットリストに連続性メモを書き、プロンプトの型をそろえる。この4つを守るだけで、同じモデルでも出力の安定感は大きく変わります。

逆に、これらを省略してカットごとに思いつきで生成すると、どれほど高性能なモデルを使っても人物は揺れ続けます。まずは3カットのテストから始め、崩れた要素だけを記録して改善していく。この小さな反復が、長尺でも崩れないキャラクター制作への最短ルートです。

Alexander

Alexander