AI動画でキャラクターが崩れる本当の理由
AI動画生成は、1フレームごとにノイズを除去しながら映像を組み立てる技術です。モデルはテキストや参照画像を手がかりにしますが、フレーム間で人物の同一性を自動的に保証しているわけではありません。そのため、最初のカットでは自然だった主人公が、次のカットでは顔の輪郭、髪の質感、瞳の色、年齢感、体型までも変わってしまうことがあります。これは生成AIの性能不足というより、キャラクターの不変特徴をモデルに伝える設計が不足していることが原因です。
キャラクターが崩れる主な原因は、参照情報の不足、プロンプトの揺れ、シード値の未固定、カットごとのライティングや背景の違い、そしてモデルごとの学習傾向の違いです。特に長編では、1カットだけを見ると許容できても、10カット並べたときに別人物に見えるという問題が起こります。視聴者は顔の比率、髪の分け目、眉の形、目の間隔、首の長さ、肩幅、服装のシルエットといった細部を無意識に記憶しているため、わずかな差でも別人として認識します。
解決の方向性は、魔法のモデルを探すことではなく、キャラクターを「制作物」として管理することです。複数の参照画像を統合し、不変の特徴と可変の要素を分け、プロンプトとアセットライブラリを整える。この前処理と運用の質が、最終的な映像の一貫性を大きく左右します。
多画像フュージョンの基本原則:参照画像を設計図にする
多画像フュージョンとは、複数の参照画像から人物の共通特徴を抽出し、新しいカットに反映させる考え方です。1枚の画像だけでは正面の情報しかなく、斜めや横、背面、表情、衣装ディテールが不足します。複数角度の参照を組み合わせることで、モデルが人物を立体的に理解しやすくなります。
何を固定し、何を変えるか
固定すべき要素は、顔立ち、髪型、髪色、瞳の色、肌のトーン、体型、年齢感、特徴的なアクセサリー、衣装の基本シルエットです。一方で、変えてよい要素は、ポーズ、表情、背景、ライティング、カメラアングル、レンズ感、モーションです。この切り分けを曖昧にすると、モデルはすべてを可変と解釈し、キャラクターが揺れます。
参照画像は「なんとなく似ている画像」ではなく、役割を決めて集めます。正面の顔アップは顔の比率を固定するため、左右斜めは立体感を伝えるため、全身は体型と衣装のバランスを伝えるため、表情違いは感情表現の範囲を定義するために使います。背景はできるだけ単純化し、ライティング条件を揃えると、モデルが人物以外の情報に引っ張られにくくなります。
参照画像セットの最小構成
実務では、正面顔アップ、左右斜め45度、全身正面、全身斜め、笑顔、驚き、悲しみの表情、衣装アップ、小物アップの9枚前後を基本セットにすると安定します。アニメ調なら線の太さと瞳のハイライト、実写調なら肌の質感とシワの出方を揃えてください。解像度は低すぎないほうがよく、顔がぼやけた参照は避けます。ファイル名は「キャラ名_正面_基本衣装」のように規則化し、どの画像が何の役割かをチーム全員が追えるようにします。
キャラクターシートの作り方:制作前の30分が後工程を救う
キャラクターシートは、文章と画像をセットにした人物設計書です。これがあると、担当者が変わってもプロンプトの書き方がぶれにくくなります。最初に目的とトーンを決め、次にテキスト定義、ビジュアル定義、禁止事項、プロンプトテンプレートの順で埋めます。
テキスト定義には、年齢感、職業、性格、話し方、髪型、髪色、瞳の色、肌の色、身長、体型、衣装、持ち物、特徴的な癖を書きます。抽象語だけでなく、「肩までの黒髪を左分け」「琥珀色の瞳」「右眉に小さな傷」のように、生成モデルが再現できる具体語に変換することが重要です。
ビジュアル定義には、参照画像、カラーパレット、許可する表情、禁止する服装、世界観に合わない要素をまとめます。プロンプトテンプレートは、人物記述、衣装記述、ライティング、カメラ、スタイル、ネガティブ指定の順で固定します。テンプレートを変えるときはバージョン番号を付け、変更理由を残してください。
チーム制作では、キャラクターシートを共有ドライブに置き、参照画像の最新版を明確にします。古い参照が混ざると、生成結果も古いデザインに引っ張られます。レビューでは「似ているか」ではなく、「別人に見える要素がないか」をチェックします。
実践ワークフロー:企画から書き出しまでの10ステップ
一貫したキャラクター動画は、思いつきでプロンプトを打つだけでは作れません。次の10ステップを繰り返すと、再現性が高まります。
- 企画とカットリストを作る。各カットの目的、尺、感情、必要な人物を書き出す。
- キャラクター定義を固める。テキスト定義と参照画像の役割を決める。
- 参照画像を収集または生成する。角度、表情、衣装、小物を揃える。
- ベース画像を確定する。もっとも本人らしい1枚を基準にする。
- ショット設計を行う。アングル、距離、動き、背景をカットごとに決める。
- プロンプトを組み立てる。固定情報と可変情報を分けて書く。
- 短尺テスト生成を行う。まず2秒から4秒で確認する。
- 一貫性チェックをする。顔、髪、衣装、体型、年齢感を比較する。
- 本生成を行う。同じ設定を保ち、必要なカットだけ再生成する。
- 編集と最終確認を行う。色調整、音、テンポ、フレーム補間を整える。
この流れで重要なのは、最初から長い動画を作らないことです。短いテストで問題を発見し、参照画像やプロンプトを修正してから本生成に進みます。修正コストは工程が進むほど膨らむため、最初の30分から1時間の準備が全体を救います。
カット別テクニック:表情・衣装・アングルを固定する
同じキャラクターを別アングルで見せるときは、基準となる正面画像をプロンプトの先頭に置き、角度情報を追加します。斜め顔では耳や顎のラインが変わりやすいため、左右斜めの参照を用意します。背面カットでは髪の長さと衣装の背中側を参照に入れます。
表情変化では、目と口の動きだけを変え、顔の骨格は固定します。笑顔、怒り、驚き、悲しみをそれぞれ別カットで作る場合も、同じベース画像と同じ人物記述を使います。衣装チェンジでは、基本シルエットを維持しつつ、色、素材、装飾だけを変えると同一人物感が残ります。
アクションシーンでは、動きの大きさに引っ張られて顔が崩れやすくなります。モーション強度を上げすぎず、必要なら顔アップのカットを挟んで人物を再確認させます。ライティングを変えるときは、光源の方向と色温度をカットリストに書き、極端な逆光や暗闇を避けると安定します。背景を変える場合は、背景参照を別に用意し、人物と背景をレイヤー的に考えると整理しやすくなります。
モデルとツールの選び方:用途別の判断基準
AI動画ツールは、フォトリアル、アニメ、イラスト調、シネマティック、SNS向けショートなど、用途によって得意分野が異なります。選定では、参照画像対応、キャラクター一貫性機能、シード固定、プロンプト追従性、生成速度、解像度、編集連携を確認します。
| 用途 | 重視する点 | 向くワークフロー |
|---|---|---|
| 実写風ドラマ | 肌、髪、照明の自然さ | 画像生成で顔を固めてから動画化 |
| アニメーション | 線、瞳、髪の再現性 | キャラクターシートと参照画像を厳密に統一 |
| 商品PR | 人物と商品の接触 | 商品参照を別レイヤーで管理 |
| SNSショート | テンポと量産性 | テンプレート化と短尺テスト |
| 長編シリーズ | アセット管理 | 台帳、命名規則、レビュー工程 |
画像生成モデルでキャラクターを固め、動画生成モデルで動かし、編集ソフトで仕上げる分業がもっとも安定します。Flux、Runway、Sora、Kling、Luma、Pika、Vidu、Midjourney、Stable Diffusion、ComfyUIなどの名前は、あくまで役割の例です。大切なのは、モデルを増やしすぎないことです。複数モデルを混ぜるとスタイルが混線し、一貫性が下がります。
よくある失敗とトラブルシューティング
顔が毎カット変わる場合、まず参照画像不足、シード未固定、人物記述の揺れを疑います。正面だけでなく斜め参照を追加し、プロンプトの人物記述をテンプレート化し、同じシードで比較します。衣装が変わる場合は、衣装アップと素材感の参照を追加し、色名を具体的に書きます。
手や指が崩れる場合は、手が画面に大きく映る構図を避ける、解像度を上げる、生成後に修正するという順で対処します。背景が勝手に変わる場合は、背景参照を固定する、人物をマスクする、カットごとに背景プロンプトを分けると改善します。動きが不自然な場合は、モーション強度を下げ、フレーム補間を確認し、カットを短く分割します。
スタイルが混ざるときは、参照画像のタッチを揃え、モデルを1つに絞り、ネガティブ指定で不要な質感を除外します。修正の優先順位は、顔、髪、衣装、背景、動きの順です。すべてを一度に直そうとすると、別のカットが崩れます。
長編・シリーズ制作の運用設計
長編やシリーズでは、キャラクター台帳を作ります。登場人物ごとに、参照画像、テキスト定義、衣装バリエーション、許可する表情、禁止事項、使用モデル、プロンプトテンプレートを記録します。エピソードが増えても、台帳を見れば同じ人物を再現できます。
アセットライブラリは、キャラクター、衣装、背景、小物、モーション、効果音に分けます。ファイル名にはキャラクター名、衣装名、角度、バージョンを含めます。メタデータに生成モデル、シード、プロンプトの要点を残すと、再生成が容易になります。
複数人で制作する場合は、レビュー工程を固定します。ラフ生成、短尺テスト、本生成、編集前、書き出し前の5段階で確認し、別人に見えるカットを早期に除外します。週次でよくある崩れを共有し、プロンプト集を更新します。
品質チェックリストと改善ループ
書き出し前のチェックリストには、顔の比率、髪の分け目、瞳の色、肌のトーン、体型、衣装の色と素材、アクセサリー、年齢感、カット間のライティング、背景の連続性、動きの自然さ、音との同期を含めます。各項目を5段階で評価し、3以下のカットは再生成します。
改善ループは、生成、比較、修正、再生成の4段階です。比較では、基準画像と並べて見る、前後のカットを並べる、一時停止して顔を拡大するという方法が有効です。修正では、参照画像を1枚追加する、プロンプトの人物記述を短くする、シードを固定する、ライティングを揃える、といった小さな変更を1つずつ試します。
再生成の判断基準は、視聴者が一瞬でも別人と感じるかどうかです。主観に迷う場合は、第三者に見せて人物同定テストを行います。同じ人物だと即答できなければ、そのカットは修正対象です。
FAQ
Q. 参照画像は何枚必要ですか。
A. 最低でも正面、左右斜め、全身、表情違いを含む6枚から9枚が目安です。長編では衣装違いと小物アップを追加します。
Q. アニメと実写ではどちらが難しいですか。
A. 実写は肌や髪の質感、アニメは線と瞳の再現性が課題です。どちらも参照画像の統一とプロンプトの固定が重要です。
Q. 同じ顔を別モデルで再現できますか。
A. 完全な同一再現は難しいですが、キャラクターシートと参照画像を揃え、モデルごとに微調整すれば近づけられます。モデルを混ぜるより、1つを主軸にします。
Q. 長尺動画でも一貫性は保てますか。
A. 保てますが、カット分割、台帳、レビュー工程が必須です。一度に長く生成せず、短いカットの積み上げで作ります。
Q. プロンプトには何を書くべきですか。
A. 不変の人物特徴、衣装、ライティング、カメラ、スタイル、禁止事項を順番に書きます。抽象語より具体語を使います。
Q. 権利や同意で注意することはありますか。
A. 実在人物に似せる場合は同意と利用規約を確認し、架空キャラクターでも既存作品に似すぎないよう注意します。
まとめ:一貫性は魔法ではなく設計
キャラクターの一貫性は、特別な1回の生成で手に入るものではありません。参照画像を設計図として整理し、キャラクターシートで定義し、カットごとに固定情報と可変情報を分け、短尺テストとレビューを繰り返すことで安定します。
最初にやるべきことは、モデルを増やすことではなく、人物の不変特徴を言語化し、複数角度の参照を揃えることです。次に、プロンプトテンプレートと命名規則を作り、チームで共有します。最後に、品質チェックリストで崩れを早期発見し、修正ループを回します。
このワークフローは、短いSNS動画から長編シリーズまで応用できます。派手な新機能を追う前に、地味な準備を徹底することが、結果として最短距離になります。視聴者が物語に没入できる映像は、キャラクターが最初から最後まで同じ人物として存在していることから始まります。



