長編AI動画でキャラクターが崩れる本当の理由
短いクリップなら、多少顔つきが変わっても「雰囲気が合っていれば」許容されます。ところが3分、5分、10分と尺が伸びるほど、視聴者は同じ人物の顔を何十回も見ることになります。そこで瞳の色がわずかに変わり、顎のラインが変わり、髪の分け目が左右反転したらどうなるでしょうか。物語への没入は一瞬で切れ、「さっきと別人では」という違和感だけが残ります。
AI動画の一貫性が崩れる原因は、おおむね次の6つに整理できます。
- 参照情報の不足:テキストだけで人物を説明しているため、モデルが毎回ちがう解釈をする。
- プロンプトの揺れ:カットごとに書き方を変えてしまい、「同じ人物」を表す記述が微妙に変化する。
- パラメータの未固定:シード値、サンプラー、解像度、縦横比、フレーム数がシーンごとに変わる。
- モデルとスタイルの混在:写実系とイラスト系、異なるバージョンの生成モデルを同じ作品内で混ぜてしまう。
- 後処理の差:アップスケール、ノイズ除去、色調整、手ぶれ補正の設定がカットごとに違う。
- 照明とレンズの差:夜と昼、広角と望遠、逆光と順光で顔の見え方が大きく変わる。
重要なのは、これらが「モデルの性能不足」ではなく「設計と運用の問題」だという点です。同じ生成エンジンを使っても、参照画像の渡し方、プロンプトの書き方、検品の順番を整えるだけで、長編でも破綻しにくくなります。つまり一貫性は、生成のたびに運に任せるものではなく、工程として管理するものだと考えてください。
以下の章では、設定づくりから参照画像の準備、ショット設計、生成、音声、編集までを一本の流れとして整理します。読み終えたときには、自分の制作にそのまま当てはめられるチェック項目が手元に残るはずです。
キャラクター設定を「再現可能なデータ」に変換する
一貫性の出発点は、絵を描くことではなく、資料を整えることです。頭の中のイメージを、第三者が同じ結果を再現できる形に落とし込む作業だと考えてください。ここを飛ばすと、後工程のすべてが「なんとなく」で進み、カットごとに人物がずれていきます。
三面図と表情差分を用意する
まず用意したいのは、正面・斜め45度・真横の三面図、そして喜怒哀楽の表情差分です。正面だけでなく斜めの情報があると、モデルは立体としての顔の構造をつかみやすくなります。横顔があると、鼻筋や顎のラインが安定します。
表情差分は、単に感情を伝えるためだけのものではありません。「笑ったときの目尻の下がり方」「怒ったときの眉間の寄り方」といった、その人物固有の癖を固定する役割があります。これがあると、同じセリフでもキャラクターらしい表情になり、視聴者は「この人物だ」と認識しやすくなります。
設定シートに落とすべき項目
次に、画像だけでは伝わらない情報をテキストの設定シートにまとめます。長編では数十ショットをまたぐため、口頭のメモでは必ず抜けが出ます。少なくとも次の項目は言語化しておきましょう。
- 基本情報:名前、年齢感、性別、身長の相対感、体型、骨格の特徴
- 髪:長さ、質感、分け目、色、後ろ姿や結び方のバリエーション
- 顔:輪郭、眉の形、瞳の色と形、まつげ、肌のトーン、ほくろや傷などの目印
- 衣装:素材、色、柄、アクセサリー、季節感、汚れや摩耗の有無
- 性格と口調:語尾の癖、早口かゆっくりか、敬語かタメ口か
- 動作の癖:歩き方、座り方、手をどこに置くか、視線の動かし方
- 感情の表出:嬉しいとき、怒ったとき、悲しいときの反応パターン
これらを「キャラクターブロック」として一つのテキストにまとめ、生成時のプロンプトに毎回同じ文言で貼り付ける運用にします。コピー&ペーストの元を一つにすることが、揺れを防ぐ最短の方法です。
言葉にできない部分は画像で補う
文章で書けない細部、たとえば「この質感の瞳」「この素材の光沢」は、画像で示すしかありません。テキストと画像の役割を分け、テキストは構造と性格、画像は質感と造形を担当させると、情報の重複が減り、生成側も解釈しやすくなります。
リファレンス画像セットの設計
参照画像の質は、そのまま出力の一貫性に影響します。数だけ増やせばよいわけではなく、用途の異なる画像を意図的に組み合わせることが大切です。
枚数の目安
実務では、次の組み合わせが扱いやすいバランスです。
- 顔の基準:正面、斜め45度、横顔の3枚
- 表情:ニュートラル、笑顔、怒り、悲しみの4枚
- 全身:立ち姿の正面と横の2枚
- 衣装違い:物語で実際に着る服を2〜3パターン
合計10〜12枚程度が目安です。多すぎると情報が衝突し、少なすぎるとモデルが空想で補います。まずは10枚前後で試し、崩れる箇所が出たらそこを補う画像を追加する、という増やし方が効率的です。
選定の5条件
- 同じ照明であること:昼と夜、暖色と寒色が混ざると肌の色が安定しません。
- 同じレンズ感であること:広角の顔は歪み、望遠は平面的に見えます。基準を一つに揃えます。
- 背景が単純であること:人物以外の要素が少ないほど、特徴が抽出されやすくなります。
- 解像度が十分であること:顔が小さい画像では、細部の情報が失われます。
- 過度な加工がないこと:強い美肌補正やフィルターは、実際の造形を隠してしまいます。
避けたい参照画像
極端な逆光、顔の半分が影の写真、ピントが甘い写真、他人と並んで写っている写真は避けてください。また、アニメ調と実写調を混ぜた参照セットは、どちらつかずの出力を生みます。作品のトーンを一つに決めてから揃えるのが鉄則です。
命名規則とバージョン管理
参照画像には必ず規則的な名前を付けます。たとえば「キャラ名_正面_基準」「キャラ名_笑顔_基準」「キャラ名_衣装A_全身」のように、人物名・役割・状態を並べます。長編では衣装替えや年齢変化もあるため、どの画像が最新かを即座に判断できることが、作業時間の短縮とミス防止につながります。
ショット設計と生成ワークフロー
長編は、シーンの連続ではなくショットの集合です。ショット単位で管理することが、一貫性を守る実務の基本になります。
ショットリストを作る
まず台本を、カットごとの表に分解します。列は「カット番号」「場所」「時間帯」「登場人物」「セリフ」「カメラ(寄り/引き/移動)」「尺」程度で十分です。この表があると、どのカットで誰が何を着ているかを一覧で確認でき、生成前に矛盾に気づけます。
シード値とパラメータを固定する
同じキャラクターを出すカットでは、シード値、サンプラー、ステップ数、解像度、縦横比を揃えます。シードを固定すると構図の自由度が下がるため、構図はプロンプトと参照画像で変え、人物の造形はシードと参照で守る、という役割分担が実用的です。
派手なアクションシーンだけは自由度を上げたい、という場合でも、まずは固定で生成し、後から動きを足す順番にすると崩れを最小化できます。
バッチ生成と検品の順番
生成はカット単位で少しずつ進めるより、同一シーンのカットをまとめて出すほうが揺れに気づきやすくなります。検品では次の順番で見ていきます。
- 顔の造形が基準と一致しているか
- 髪と瞳の色が同じか
- 衣装の細部(ボタン、柄、汚れ)が一致しているか
- 照明の方向と色温度がシーン内でつながっているか
- 動きの速度と方向が自然か
この5項目を毎回同じ順番で確認すると、見落としが減ります。
プロンプト設計:固定する部分と変える部分を分ける
長編制作で最も多い失敗が、カットごとにプロンプトを一から書き直すことです。文章が変われば、モデルの解釈も変わります。解決策は単純で、プロンプトをブロックに分割し、固定部分と可変部分を明確に分けます。
キャラクターブロック
人物の外見と性格を記述する部分です。全カットで完全に同じ文言を使います。語順を変えるだけでも出力が変わることがあるため、コピー以外の方法で編集しないようにします。
シーンブロック
場所、時間帯、天候、周囲の状況を書く部分です。ここはカットごとに変わります。ただし、同じシーン内では語彙を揃えます。「夕暮れ」と「日没間際」を混在させると、光の色がカットごとに変わります。
カメラとレンズの指定
寄り、引き、俯瞰、肩越し、手持ち風など、カメラの指定も語彙を統一します。レンズの焦点距離を指定できる場合は、人物が登場するカットである程度揃えると、顔の歪み方が一定になります。
ネガティブ要素の共通化
「顔が崩れる」「指が多い」「左右が反転する」といった問題への対策は、カットごとに書くのではなく、共通のネガティブブロックとして一箇所にまとめます。作品全体で同じ禁止事項を適用することで、品質のばらつきが減ります。
ツール選定の判断基準
一口に動画生成といっても、用途によって向き不向きがあります。長編のキャラクター一貫性という目的では、次の指標で比較すると判断しやすくなります。
見るべき7つの指標
- 参照画像の入力数:複数枚を同時に渡せるか。多いほど造形が安定します。
- 一貫性の再現度:同じ設定で複数回生成したとき、顔がどれだけ保たれるか。
- 解像度と尺の上限:長編では1カットの秒数と解像度が効いてきます。
- 生成速度と待ち時間の予測しやすさ:反復できるかどうかが品質を左右します。
- 音声・リップシンク連携:別工程に分けるか、同じ流れで扱えるか。
- 編集ソフトへの書き出し形式:フレームレートと色空間の扱いを確認します。
- やり直しのしやすさ:特定カットだけを再生成できるか。
用途別の選び方
短尺のテストやアイデア出しでは、軽くて速いツールが有利です。一方で、同じ人物が何十カットも登場する長編では、参照画像を複数受け取り、設定を保存して呼び出せる仕組みのあるツールが向いています。最初から長編用を選ぶ必要はありません。絵コンテ段階は軽いツールで試し、本番だけ一貫性重視の環境に移す、という二段構えが現実的です。
音声・リップシンク・編集での一貫性
映像だけ揃えても、声や色がカットごとに変われば同じ問題が起きます。仕上げ工程まで一貫性の管理対象だと考えてください。
声を固定する
音声合成を使う場合、話者は最初に一つ決めて、最後まで変えません。話速、ピッチ、間の取り方も数値として記録しておきます。同じ台本でも読み上げ設定が変わると、視聴者は「声優が変わった」と感じ取ります。
リップシンクとセリフの尺
リップシンクは、セリフの長さとカットの尺を先に決めてから合わせます。日本語は英語より情報密度が高く、同じ内容でも音節数が多くなります。字幕を後から足す前提でも、口の動きの尺は変えないほうが自然に見えます。
色と質感の統一
編集段階では、全カットに同じカラーグレーディングを適用します。カットごとに露出やホワイトバランスを個別調整すると、人物の肌の色が変わって見えます。基準となるカットを1つ決め、それをリファレンスにして統一する方法が安全です。
フィルムグレインや軽いぼかしなどのエフェクトも、強度を統一します。カットによって粒状感が違うと、別の日に撮影したように見えてしまいます。
よくある失敗と対処法
顔は合っているのに別人に見える
多くの場合、原因は髪型と衣装のディテールです。顔の造形が同じでも、前髪の分け目や上着の色が変われば印象は変わります。参照画像に衣装のバリエーションを追加し、カットごとにどの衣装かをショットリストに明記してください。
途中のカットだけ急に崩れる
そのカットに固有の条件が原因です。極端な俯瞰、強い逆光、顔が画面の端にある構図、動きの速いアクションなどが典型です。該当カットを分割して尺を短くする、カメラを寄りにする、照明条件を緩めるといった調整で改善します。
色がカットごとに違う
照明の記述が揺れているか、後処理の設定が違うかのどちらかです。シーンブロックの語彙を統一し、カラー調整を全カット共通のプリセットにします。
動きが不自然で一貫性が崩れて見える
動きの滑らかさは、体の造形の認識に影響します。フレーム補間を強くかけすぎると輪郭がにじみ、人物が別物に見えます。補間の強度は控えめにし、必要ならカットを短く切ってつなぐほうが安定します。
アップスケールで顔が変わる
高解像度化の工程で、モデルが顔を「描き直す」ことがあります。アップスケール専用の設定で顔の補正を弱め、必要なら元の生成解像度を上げる方向で対応します。
参照画像を増やしたら余計に崩れた
情報が衝突しています。照明条件の違う画像、別人に近い画像、加工の強い画像を外し、まずは基準となる3〜5枚に絞り直してください。
実践ワークフロー例:3分の短編を仕上げる
ここまでの内容を、実際の作業順に並べます。3分程度の短編を想定しています。
- 企画と台本:登場人物を2〜3人に絞り、シーン数を5〜8に抑えます。人数が増えるほど一貫性の管理コストは跳ね上がります。
- 設定資料の作成:三面図、表情差分、衣装バリエーションを用意し、設定シートに文章でまとめます。
- 参照画像セットの確定:10枚前後に絞り、命名規則に従って整理します。
- ショットリストの作成:カット番号、場所、衣装、セリフ、カメラ、尺を表にします。
- テスト生成:各シーンの代表カットを1つずつ生成し、顔・髪・衣装・照明を確認します。ここで崩れる場合は、参照画像かプロンプトブロックを見直します。
- 本生成:シーン単位でまとめて生成し、5項目の検品を同じ順番で実施します。
- 音声の収録または合成:話者と読み上げ設定を固定し、セリフの尺をカットに合わせます。
- リップシンク:カットごとに適用し、口の動きと音のタイミングを確認します。
- 編集とカラー調整:基準カットを決めて全体を統一し、エフェクトの強度も揃えます。
- 最終確認:全体を通して視聴し、人物の印象が途切れる箇所をメモして再生成します。
この流れの要点は、テスト生成の段階で問題を潰すことです。本生成の後に設定を変えると、それまでのカットとの整合が取れなくなり、やり直しの量が膨らみます。
仕上げ前チェックリストとよくある質問
仕上げ前チェックリスト
- 参照画像セットは最新版に更新されているか
- キャラクターブロックの文言は全カットで同一か
- シーン内で照明の語彙が統一されているか
- シードと生成パラメータは記録されているか
- 衣装の切り替わりはショットリストと一致しているか
- 声の話者と読み上げ設定は固定されているか
- カラー調整は共通プリセットで適用されているか
- 再生成が必要なカットは番号で管理されているか
よくある質問
Q. 参照画像は何枚あれば安心ですか。
A. まずは10枚前後で始めてください。顔の基準3枚、表情4枚、全身2枚、衣装1〜3枚が扱いやすい構成です。崩れる箇所が出たら、その条件に近い画像を1枚ずつ足すほうが、まとめて増やすより効果的です。
Q. 同じ人物でもシーンごとに服装を変えたい場合は。
A. 顔の参照画像は共通のまま、衣装だけを差し替えます。衣装ごとに参照セットを分けて管理し、ショットリストにどの衣装かを明記します。衣装の色が大きく違う場合でも、髪型と顔の基準は変えないでください。
Q. アニメ調と実写調を同じ作品で混ぜられますか。
A. 同じ人物で混ぜるのは避けたほうが安全です。どうしても必要な場合は、回想シーンなど物語上の理由づけを用意し、視聴者が「演出」と理解できる形にします。
Q. 生成のたびに毎回同じ結果にならないのは故障ですか。
A. 仕様です。確率的な生成である以上、完全な再現は前提にできません。だからこそ、参照画像、プロンプトブロック、パラメータの記録という三つの管理で揺れを小さくします。
Q. 長編にするほど品質が落ちる気がします。
A. 尺が伸びるほど、シーンの数と照明条件が増えるためです。シーン数を絞る、時間帯をまとめる、登場人物を減らすといった脚本側の工夫が、そのまま品質の安定につながります。
Q. どの工程に最も時間をかけるべきですか。
A. 設定資料とショットリストです。ここに時間をかけると、生成とやり直しの回数が減り、結果的に総作業時間は短くなります。逆に、生成から始めると、後半で膨大な修正が発生します。
Q. 音声だけ別のツールで作っても大丈夫ですか。
A. 問題ありません。ただし話者と読み上げ設定を最初に固定し、全カットで同じ条件を使うことが条件です。ツールを途中で変えると、声質の違いが一貫性の破綻として目立ちます。
一貫性は、特別な機能を一つ導入すれば解決するものではありません。設定をデータとして残し、同じ記述と同じパラメータを繰り返し使う。この地味な運用の積み重ねが、長編でも崩れないキャラクターを作ります。まずは短い作品で一連の流れを試し、自分の制作に合ったチェック項目を育てていくのが、最も確実な近道です。


