Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画でキャラクターの一貫性を保つ方法:ショット別ワークフローと失敗対策

Oct 4, 2026

AI動画でキャラクターの一貫性が崩れる理由

生成AIで動画を作り始めた人が最初にぶつかる壁は、モデルの操作ではなく「同じ人物を同じ人物として描き続ける」という課題です。1カット目は完璧に見えても、3カット目で顔の輪郭が変わり、5カット目では別人になっている。この現象は決して珍しいものではありません。原因は生成モデルの性能不足だけではなく、参照情報の渡し方、ショット設計、プロンプトの粒度、編集段階での扱いという4つの設計要素が噛み合っていないことにあります。

拡散モデルが持つ「解釈の自由度」

テキストから映像を生成するモデルは、与えられた条件を満たす解を無数に持っています。似顔絵師に「黒髪でショートカットの人物」とだけ伝えたら、毎回違う人物が描かれるでしょう。指示が曖昧なほど、モデルは学習データの中から「それらしい平均」を選び取ります。この性質は単発の画像では魅力として働きますが、連続する動画ではアイデンティティの揺らぎとして表面化します。つまり一貫性の問題は、モデルを乗り換えれば解決する類のものではなく、条件の与え方の問題です。

よくある失敗パターン

制作現場で頻繁に見られる崩れ方は、おおむね次の5つに分類できます。

  • 顔の輪郭、目の間隔、鼻や顎の形がショットごとに変わる
  • 服の色は合っているのに、素材感やステッチ、柄の位置が変わる
  • 身長や肩幅のバランスが変わり、同じ人物に見えなくなる
  • 照明の色温度やコントラストがショットごとに変わり、別作品のように見える
  • 手、持ち物、ロゴ、画面内の文字が崩れる

これらは独立した問題ではなく、連鎖します。顔がわずかにずれると観客は違和感を覚え、衣装が変わると「別の人物」と認識し、光が変わると「別の時間帯・別の作品」と感じ取ります。視聴者は言語化できないまま離脱するため、制作者側も改善の手がかりを得にくくなります。数字として表れないからこそ、チェック項目を先に決めておくことが重要です。

事後修正が難しい理由

「生成後に顔だけ差し替えればよい」と考えるのは自然ですが、実際にはフレーム単位のマスク処理、追従、再合成、そして再びのカラー合わせが必要になります。動きの大きいショットや髪が揺れるカットでは追従が破綻しやすく、修正にかかる手間は最初から作り直すよりも大きくなります。だからこそ、生成の前に「崩れにくい設計」を用意することが最も費用対効果の高い判断になります。

ブロック単位のキーフレーム設計という考え方

ここで紹介するのは、キャラクターを「1枚の完成画像」としてではなく、複数のブロックの集合として扱う考え方です。顔、体型、衣装、小物、配色といった要素を分解し、それぞれを固定すべき参照として定義します。ブロックを積み上げるように画面を組み立てるため、ここでは仮に「ブロックキーフレーム方式」と呼びます。

全体を似せるのではなく、部品を固定する

従来のやり方は、キャラクターの全身が写った1枚の画像を参照として渡し、「これと同じ人物を描いて」と指示するものでした。しかしこの方法では、モデルは画像全体をぼんやりと模倣しようとし、結果として「雰囲気は似ているが別人」という出力になりがちです。ブロックキーフレーム方式では、参照を細分化し、顔は顔の参照、衣装は衣装の参照というように、役割を明確にして渡します。モデルにとっての制約条件が具体的になるほど、出力のばらつきは小さくなります。

ピクセルレベルの整合性とは何か

「ピクセルレベルの整合性」という言葉は難しく響きますが、意味はシンプルです。キャラクターの決定的な特徴、たとえば目の間隔と輪郭、眉毛の角度、髪の分け目、衣装の柄の配置といった要素を、テキストの形容ではなく画像データとして固定するという発想です。テキストは解釈の幅を持ちますが、画像は具体的な配置情報を持っています。形容詞に頼る部分を減らし、画像に任せる部分を増やすほど、ショット間の差は縮まります。

複数の参照を統合する処理は何をしているのか

複数の参照画像を同時に扱う機能は、一般に次のような役割を担います。第一に、参照から人物の特徴ベクトルを抽出する。第二に、抽出した特徴を新しいショットの生成条件に注入する。第三に、背景やライティングなど、シーン由来の情報と人物由来の情報を分離して合成する。この分離が上手く機能すると、「同じ人物が、まったく違う場所・違う光の中に立っている」という自然な出力が得られます。逆に分離が不十分だと、人物の色が背景に引きずられ、シーンごとに肌の色が変わります。

この分離の精度は、参照画像のトーンが揃っているかどうかに強く依存します。暖色の照明で撮られた参照と、寒色の照明で撮られた参照を混ぜると、モデルはどちらの光を基準にすべきか判断できず、結果として中間の濁った色を出力します。参照を集めるときは「画角」よりも「ライティングの統一」を優先してください。

参照画像は多いほど良いわけではない

参照を増やせば精度が上がるように思えますが、実際には矛盾する情報が混ざると品質が下がります。たとえば正面の顔と斜め45度の顔を同時に強く参照すると、モデルは中間の角度を平均化し、特徴の薄い顔を出力することがあります。参照は3〜6点程度に絞り、角度・表情・衣装の役割を重複させないことが実務的な目安になります。

キャラクターシートの作り方

一貫性の大部分は、生成を始める前の準備で決まります。ここでは、制作の最初に用意したいキャラクターシートの構成を整理します。

三面図と表情差分

正面、斜め45度、横顔の3方向を最低限そろえます。可能であれば全身のシルエットも加えます。表情は無表情、微笑み、驚き、怒りの4種類があると、後のショットで感情を動かすときに安定します。重要なのは、これらを同じライティング、同じ背景、同じ画角で作ることです。シート内ですでにトーンがばらついていると、その後すべてのショットにそのばらつきが伝播します。

衣装バリエーションの作り方

シリーズものでは衣装替えが発生します。ここでやりがちな失敗は、衣装ごとにゼロから生成することです。正しい手順は、基準となる衣装を1着作り、色・素材・シルエットのうち変更する要素を1つか2つに限定して派生させることです。すべてを変えると、たとえ顔が同じでも「別人が同じ服を着ている」ように見えます。逆に、靴やバッグだけを変えるといった小さな差分は、視聴者に変化を感じさせながら同一性を保てるため効果的です。

色と光の基準を持つ

キャラクターの肌、髪、瞳、主要な衣装の色を、可能ならカラーコードで記録します。加えて「基準となるライティング」を1パターン決めます。屋外の昼光なのか、室内の暖色なのか、夜のネオンなのか。この基準をプロンプトの共通部分として固定し、シーンごとに変えるのは時間帯と場所だけにする。これだけで、作品全体のトーンが揃います。

記録を残す習慣

採用した参照画像、使用したモデル名、参照の強度、シード値、そして「どのショットでどの設定を使ったか」を簡単な表にまとめておきます。数ショットの作品では不要に感じますが、カット数が20を超えると必ず必要になります。記録がない状態で追加撮影を行うと、以前と同じ設定を再現できず、結果として作品の前半と後半で質感が変わります。

実践ワークフロー:6つのフェーズ

ここからは、実際の制作を6つのフェーズに分けて説明します。短編でも長編でも同じ流れが使えます。

フェーズ1:企画と参照の棚卸し

まず尺、カット数、登場人物、必要な衣装の数を決めます。同時に、参照として使える素材を集めます。自前で描いた設定画、以前のプロジェクトで使った画像、写真素材などが候補になります。この段階で「どの要素を固定し、どの要素をシーンごとに変えるか」を表にしておくと、後の判断が速くなります。あわせて、作品のルック(写実的か、イラスト調か、フィルム風か)を1行で言語化しておくことをおすすめします。この一文が、モデル選びのたびに迷わないための基準になります。

フェーズ2:マスターキーフレームの確定

キャラクターの基準となる1枚を生成します。この1枚には時間をかけてください。顔のパーツ配置、髪の質感、体型、衣装のディテールが納得いくまで調整し、採用した時点で「以降のすべてのショットはこの画像を参照する」と決めます。マスターが曖昧なまま先に進むと、後戻りが発生します。判断に迷ったときは、少し離れて縮小表示で見てください。縮小しても人物の印象が残る画像は、動画の各カットでも安定しやすい傾向があります。

フェーズ3:ショットリストと難易度分類

各ショットを、顔アップ、バストアップ、全身、アクション、群衆の中の1人、といった種類に分類します。さらに難易度を3段階で見積もります。一般的に、顔が大きく写るカットは一貫性の維持が最も難しく、逆に遠景や後ろ姿は比較的安定します。難易度の高いカットは数を絞り、必要なら尺を短くする調整も有効です。また、同一人物が同じ画角で連続するカットは、モデルにとっては有利ですが、観客にとっては退屈です。一貫性の難しいアップと、安定しやすい引きのカットを交互に配置すると、負荷を分散できます。

フェーズ4:生成と採用判定

ショットごとに使用モデルを選び、参照を適用して生成します。ここで重要なのは、1ショットにつき複数案を出し、判定基準を統一して選ぶことです。判定項目は「顔の一致」「衣装の一致」「光の一致」「動きの自然さ」の4つで十分です。気に入った1案だけでなく、その前後のフレームも確認し、揺れがないかをチェックします。生成の順番は、難易度の高いカットから着手するのが合理的です。最初に難しいカットで成功パターンを見つけておけば、以降のカットはその設定を流用できます。

フェーズ5:編集・音・カラー調整

生成素材を並べた時点で、色温度とコントラストを揃えます。多くの場合、一貫性の違和感は人物ではなく色調の差から生まれています。編集ソフトのカラー調整で全カットに共通のルックを適用し、必要なら人物だけをマスクして微調整します。音声は臨場感を大きく左右するため、環境音とセリフのバランスもここで整えます。とくにショット間で音量が大きく変わると、映像のつながりが悪く感じられます。

フェーズ6:書き出しとシリーズ運用

完成したら、縦型と横型、字幕ありとなしなど、配信先に応じた書き出しを用意します。シリーズ化する場合は、今回使ったマスターキーフレームとプロンプトの共通部分をテンプレートとして保存します。次回の制作時間は大幅に短縮され、作品間の一貫性も保たれます。

モデル選択とプロンプト設計の判断基準

実写寄りかイラスト寄りか

使用するモデルによって得意な表現は異なります。写実的な人物を得意とするモデルは肌の質感や光の再現に強く、イラスト調のモデルは線の安定性やデフォルメに強いという傾向があります。作品のルックを最初に決め、それに合う系統のモデルを選ぶことが基本です。途中で系統をまたぐと、たとえ顔が一致していても質感が変わります。

動きの大きさでモデルを分ける

同じ作品内でも、静的な会話シーンと激しいアクションでは求められる特性が違います。前者は顔の安定性、後者は動きの自然さが優先されます。ショット単位でモデルを切り替えるのは有効な戦略ですが、切り替えたショットでは参照の強度を上げ、顔の一致を優先させます。切り替える際は、必ず両方のモデルで同じ参照画像を使って比較テストを行い、肌の色と輪郭の傾向が近いことを確認してから本番に進んでください。

固定する要素と変えてよい要素

プロンプトは「固定ブロック」と「可変ブロック」に分けて書きます。固定ブロックには、人物の特徴、髪型、衣装、基準のライティングを含めます。可変ブロックには、場所、時間帯、カメラワーク、感情を含めます。この分離を守るだけで、シーンが変わっても人物がぶれにくくなります。固定ブロックはテンプレートとして保存し、コピーして使うのが最も確実です。手入力で毎回書き直すと、語順や語彙が変わり、モデルへの条件も変わってしまいます。

参照強度・シード・モーション量

参照の強度が高すぎると動きが硬くなり、低すぎると別人になります。まず中程度で生成し、顔がずれるなら強度を上げ、動きが不自然なら下げるという往復で調整します。シード値は、同じ構図の別案を出すときの手がかりになります。モーション量は、歩行や振り向きなど動きの大きいショットで特に影響が大きく、上げすぎると顔が崩れます。

ネガティブ指定の使いどころ

避けたい要素を明示する指定は、崩れの予防に役立ちます。たとえば、顔の歪み、指の本数の誤り、不要な文字、透かし、二重の輪郭などです。ただし指定を増やしすぎると、モデルが萎縮して動きが乏しくなります。優先度の高い3〜5項目に絞るのが実務的です。

小さなテストで傾向をつかむ

新しいモデルを試すときは、いきなり本編を生成せず、同じ参照画像と同じプロンプトで3ショットだけテストします。正面のアップ、斜めのバストアップ、歩行の全身。この3つを並べれば、そのモデルが顔を保つ力、動きの自然さ、色の再現性を短時間で把握できます。テストの結果は必ず記録し、モデルごとの特徴を自分の言葉でまとめておくと、次の企画で迷わなくなります。

品質管理チェックリストとよくある失敗

顔と骨格

目と眉の間隔、顎のライン、耳の形を確認します。特に横顔と斜めのカットは崩れやすいため、マスターと並べて比較します。首の長さや肩の位置も、見落とされやすい一貫性の要素です。確認は等倍と縮小の両方で行うと、細部のズレと全体の印象の両方を捉えられます。

衣装と小物

柄の位置、ボタンの数、ロゴの形を確認します。アクセサリーは揺れるため、フレームごとに形が変わりやすい項目です。小物は数を絞るほど安定します。逆に、どうしても必要な小物がある場合は、その形状を参照画像として別途用意し、ショットごとに同じ参照を使い回すのが有効です。

色・光・質感

肌の色がショットごとに変わっていないか、影の方向が物理的に矛盾していないかを確認します。この2点は視聴者の違和感に直結します。とくに影の方向は、同じシーン内で光源の位置が変わっていないかを示す重要な手がかりです。

動きとリズム

カットの長さと動きの速度が極端に違うと、同じ人物でも別の作品のように感じられます。前後のカットと並べて再生し、テンポの連続性を確認します。

レビューの手順を固定する

チェックは感覚に頼らず、手順として固定します。第一に、全カットを無音で通しで再生し、人物の印象が途切れないかを見る。第二に、気になったカットを前後と並べて比較する。第三に、色調の波形やヒストグラムを確認する。この順番を毎回守るだけで、見落としが大幅に減ります。

応用シーン別の実践

連続ショートシリーズ

毎回同じ主人公が登場する形式では、マスターキーフレームの管理が最重要になります。話ごとに1枚の基準画像を共有し、衣装替えは最小限に留めます。冒頭と結びのカットを固定の構図にすると、シリーズとしての認知が強まります。更新頻度を上げたい場合は、背景と小物だけを差し替える「同一人物・別状況」の設計が効率的です。

ブランド広告

商品と人物が同時に写る場合、人物の一貫性と商品の再現性を両立させる必要があります。商品は別撮り・別生成して合成する方が安全なことも多く、その場合は人物のライティングに合わせて商品の光を調整します。商品の形状は参照として固定し、人物と同様に「マスター画像」を1枚決めておきます。

教育・解説コンテンツ

ナレーター役の人物が毎回登場する形式では、長時間の視聴に耐える自然さが求められます。表情のバリエーションを事前に用意し、説明パートと実演パートでカメラ距離を変えると単調さを避けられます。話者の顔が延々と映り続けると集中力は下がるため、図解や画面収録を挟む構成も合わせて設計してください。

よくある質問

参照画像は何枚用意すればよいですか。 顔の角度3点、表情2点、全身1点の計6点程度が実用的な出発点です。役割が重複する参照は減らしてください。

途中でモデルを変更しても大丈夫ですか。 可能ですが、変更後のショットでは参照強度を上げ、色調を編集で揃える作業を前提にしてください。事前にテスト生成で比較しておくと安全です。

顔だけが毎回変わる場合、最初に何を見直すべきですか。 プロンプトの固定ブロックが守られているか、参照画像のトーンが揃っているかを確認します。この2点で多くの問題が解決します。

生成後の修正で対応すべき範囲は。 数フレームの軽微な揺れは編集で吸収できますが、顔の構造が変わる場合は再生成した方が速く、結果も良くなります。

一貫性を保つために避けるべきことは。 シーンごとにプロンプトの書き方を変えること、参照を増やしすぎること、色調を揃えずに編集へ進むことの3つです。

作業時間はどの程度見積もればよいですか。 15秒・5カットの作品で、準備に1〜2時間、生成と選定に2〜4時間、編集に1〜2時間が目安です。準備を丁寧に行うほど、生成と選定の時間は短くなります。

スマートフォンだけで完結できますか。 短い作品であれば可能ですが、カラー調整と細かい比較作業は大画面の方が正確です。最終確認のみPCで行う運用でも十分効果があります。

まとめ:一貫性は設計で作る

キャラクターの一貫性は、特別な機能を1つ導入すれば解決する問題ではありません。参照を分解して固定し、ショットの難易度を見積もり、プロンプトの固定部分を守り、最後に色調を揃える。この一連の工程を丁寧に回すことが、最も確実な方法です。逆に言えば、どのツールを使っていても、この設計さえ整っていれば作品の品質は安定します。

まずは短い1本、たとえば15秒・5カットの作品で流れを一周してみてください。マスターキーフレームを1枚作り、3つのショットで使い回し、最後に色調を揃える。この小さな成功体験が、長編やシリーズ制作へ進むための土台になります。作品を作りながら、自分なりのチェックリストと設定表を育てていくことが、結果として最も強い武器になります。

Alexander

Alexander