画像から動画への変換でキャラクターが崩れる根本原因
画像から動画(I2V)生成は、1枚の静止画に動きを与える技術として制作現場に定着した。しかし実際に難しいのは、動きの派手さではなく「同じ人物が同じ人物に見え続けるか」という一点である。最初のカットは完璧でも、次のカットで髪の色が変わり、服のディテールが消え、顔の輪郭がわずかに別方向へずれていく。この現象を本記事ではアイデンティティ・ドリフトと呼ぶ。
ドリフトの原因は大きく三つに分けられる。第一に、モデルが各フレームを比較的独立に生成し、時間方向の依存関係を十分に保持できないこと。第二に、参照画像が1枚だけの場合、その画像に含まれる照明・角度・表情が「その瞬間の状態」として扱われ、別角度や別照明に移ったときの情報が欠落すること。第三に、動きの指示を増やすほど、モデルが動きの記述に注意を割き、見た目の同一性を保つための手がかりが相対的に弱くなること。
つまり一貫性は、モデルの性能だけで決まる問題ではない。入力設計と指示設計の問題である。ここを整理しないまま再生成を繰り返すと、時間だけが消費され、再現性のある解決策が手元に残らない。反対に、入力と指示の型を一度作れば、同じ設計を別のキャラクターや別のシーンへ流用できる。
さらに見落とされやすいのが視聴者の知覚である。人間は顔の比率の変化には敏感だが、布地の細かな質感の変化には比較的鈍い。限られた工数で品質を上げたいなら、守るべき層に優先順位をつけ、顔と輪郭にリソースを集中させるのが合理的だ。本記事では、この考え方を出発点に、入力設計・指示設計・ショット設計・検証の順で実務手順を組み立てていく。
ブロック固定方式の全体像:パーツを分けて同一性を守る
従来のI2Vは「1枚の画像+動きの指示」という単純な構造だった。これに対しブロック固定方式は、キャラクターを複数の再利用可能なパーツに分解し、それぞれを固定したまま動きだけを差し替える。ブロックを組み替えて別のポーズを作る感覚に近いことから、こう呼ばれている。
実務では次の4層に分けると扱いやすい。
- アイデンティティ層:顔立ち、骨格、髪型、肌のトーン、年齢感
- 衣装層:服の形、素材感、色、柄やロゴの位置
- 小道具層:持ち物、アクセサリー、楽器、道具
- 環境層:背景、照明の方向、色温度、天候
層を分けて管理すると、変更したい層だけを差し替えられる。同じキャラクターを昼から夜へ移す場合、変更するのは環境層だけで、アイデンティティ層と衣装層は固定する。すると「変わってはいけない部分」がモデルに対しても明確になり、ドリフトが大きく減る。
ブロックを固定するとは具体的に何をすることか
固定とは、参照画像を闇雲に増やすことでも、プロンプトを長くすることでもない。生成のたびに同じ特徴記述と同じ参照条件を与え、変わってよい変数だけを動かすことである。具体的には、基準となる参照画像、特徴を表す短い記述、乱数シード、カメラワークの指示をセットで保存し、カットごとに環境層だけを書き換える。この運用なら、問題が起きたときに「どの変数を変えたから崩れたのか」を追跡できる。
固定しすぎると起きる弊害
すべてを固定すると、今度は動きが硬くなる。同じ表情、同じ姿勢、同じ構図が続き、動画として退屈になる。固定すべきは同一性であり、固定してはいけないのは感情表現、姿勢、カメラだ。この境界を意識するだけで、一貫性と表現力のバランスが取れる。
参照画像セットの設計:1枚では足りない理由
1枚の参照画像は、その瞬間の照明と角度に強く縛られる。別の角度のカットを作ると、モデルは見えていない側面を推測で埋めるため、結果として別人に近づく。参照セットを設計する目的は、この推測の余地を減らすことにある。
最低限そろえたいアングル
- 正面のバストアップ
- 斜め45度のバストアップ
- 横顔または斜め後ろ
- 全身(衣装のシルエット確認用)
- 表情違いを1〜2点
すべてを本番用の高精細画像にする必要はない。重要なのは角度と照明の情報で、解像度よりも「一貫した条件で作られていること」が優先される。低解像度でも条件が揃っていれば、モデルは安定して特徴を掴む。
参照画像の品質チェック
同じ人物に見えるか、照明の方向が揃っているか、背景がシンプルか、髪の輪郭が背景に溶けていないかを確認する。逆光で輪郭が飛んでいる画像は参照として弱い。また、強いフィルターや過度な肌の平滑化がかかった画像は特徴が失われており、生成側も特徴を掴めない。
参照セットを増やしすぎない
参照を増やすほど一貫性が上がるとは限らない。条件の異なる画像を混ぜると、モデルはどの特徴を採用すべきか判断できず、平均化された別の顔が生まれる。実務では5〜8点程度に絞り、照明条件と画角を揃えるほうが安定する。迷ったら「同じ日の同じ場所で撮った写真」のつもりで揃えるとよい。
一貫性ベクトルを作る:特徴を固定する実務手順
一貫性ベクトルとは、要約すれば「このキャラクターはこれである」という情報を、毎回同じ形でモデルに渡すための手順セットだ。特別な機能の名前ではなく、運用の型だと考えてよい。型があるから、担当者が変わっても結果が揃う。
手順1:基準画像を決める
最初に、もっとも素の状態に近い1枚を基準画像として選ぶ。正面、自然光、表情はニュートラル。ここを起点にすべてのカットを派生させる。基準画像はファイル名の先頭に印をつけるなど、一目で分かる運用にしておくと、チーム制作で迷いが消える。
手順2:特徴記述を言語化する
基準画像から、変わらない特徴を短い言葉に落とす。髪の長さと色、顔の輪郭、瞳の色、印象的なアクセサリー、衣装の素材感。長文は逆効果で、モデルが細部に引っ張られて動きが鈍る。10〜20語程度に圧縮するのが扱いやすい。形容詞を重ねるより、目立つ特徴を一つずつ並べるほうが伝わる。
手順3:シードと参照条件を固定する
同じキャラクターを続けるカットでは、乱数シードを固定し、参照の強度も一定に保つ。ここを毎回変えると、どれだけ記述を揃えても結果は揺れる。カットごとに記録を残し、変化させた変数が一つだけになるようにする。変更が一つの変数に絞られていれば、崩れた原因の特定は数分で終わる。
手順4:特徴を数値ではなく比較で検証する
固定がうまくいっているかは、前のカットと並べて確認する。単体で見て「なんとなく違う」と感じても、並べなければ判断できない。検証用に静止画を書き出し、顔の位置と大きさを揃えて比較するのが最も確実だ。
モーションと外見を分離するプロンプト設計
一貫性が崩れる最大の原因は、動きと外見を同じ文に混ぜてしまうことだ。モデルは両方を同時に満たそうとし、結果としてどちらも中途半端になる。分離は、文章を分けるだけでも効果がある。
動きだけを書く
「ゆっくり振り返る」「左手で扉を押す」「髪が風に流れる」のように、動きの記述は短く具体的に書く。外見の記述は参照画像と一貫性の記述に任せ、動きの文には入れない。動きは一つか二つに絞る。三つ以上を同時に指示すると、モデルは優先順位を決められず、動きが濁る。
外見の記述は最小限にして固定する
外見の記述は毎カット同じ文をコピーして使う。ここを創作して毎回書き換えると、揺れの原因になる。人間にとっては言い換えでも、モデルにとっては別の指示である。テンプレートを一つ作り、挿入する変数だけを切り替える運用が安全だ。
ネガティブ指定の使いどころ
不要な要素を打ち消す指定は、輪郭の破綻、指の増殖、顔の変形など、明確に困っている現象に対して絞って使う。何十行も並べると、本来の指示まで弱くなる。まずは現象を一つ選び、それに対応する指定を一つ足して比較する。
動きの強さは段階的に上げる
動きの大きさを一度に倍にするのではなく、少しずつ上げて許容範囲を探る。一貫性が崩れる閾値は、キャラクターのデザインによって違う。閾値が分かれば、その範囲内で演出を設計できる。
カット間のつなぎを破綻させないショット設計
一貫性は1カット内だけでなく、カット間でも問われる。切り替わりの瞬間に髪型が変わる、服の色がわずかに変わる、といった揺れは視聴者に強く印象づく。映画の編集でカットを重ねる理由の一つは、こうした揺れを隠すことにある。
対策は撮影設計に近い。同じシーンは同じ照明条件でまとめて生成し、極端な画角変更を避ける。どうしても必要な場合は、切り替えを別の要素で隠す。動きのピーク、暗転、寄りのカット、効果音などでつなぐと、揺れは目立たなくなる。
また、カットの順番を生成順と一致させると比較しやすい。前後を並べて見比べ、揺れが許容範囲かどうかを判断する。この比較を工程に組み込むことが、属人的な感覚頼みから抜け出す近道になる。
切り替えを隠す具体例
- 手前を人物が横切る瞬間にカットを変える
- 明るさが急変する場面(照明の点滅、雷、花火)を利用する
- 画面いっぱいの寄りから引くカットへ切り替える
- 動作の途中で切る(振り向きの最中など)
ツール選定の判断基準
作業を分解すると、必要なツールの種類は4つに整理できる。画像生成、動画生成、モーションの制御、編集と仕上げである。それぞれに求められる能力が違うため、先に自問してから選ぶと失敗が減る。
| 工程 | 判断の軸 | 向いているケース | 注意点 |
|---|---|---|---|
| 画像生成 | 参照画像をどこまで忠実に再現できるか | キャラクター設定を固める段階 | 過度な美化は特徴を失わせる |
| 動画生成 | 参照の効き方と動きの安定性 | 短尺のカット制作 | 長尺は分割前提で考える |
| モーション制御 | 動きの指定方法が直感的か | ダンスやアクション | 参照との競合に注意 |
| 編集・仕上げ | 色調整とノイズ処理のしやすさ | カット間の揺れ隠し | 揺れを消しすぎると不自然 |
単発の高品質より再現性を優先する
一つの見事なカットが作れることより、同じ品質を繰り返し出せることのほうが商用では価値が高い。テストは同じ指示で3回生成し、結果がどれだけ揃うかで判断する。バラつきが大きいツールは、たとえ最高品質が高くても、シリーズ制作には向かない。
縦型と横型の相性を確認する
配信先によってアスペクト比が異なる。縦型で構図が破綻しないか、横型で背景が広がりすぎないかを最初に確認する。ここを見落とすと、後工程でトリミングが増え、結果として画質が落ちる。
よくある失敗とトラブルシューティング
顔が少しずつ変わる
原因は参照条件の揺れか、動きの指示過多である。まずシードを固定し、次に動きの記述を半分に減らす。それでも改善しない場合は、参照画像の中に照明条件の異なるものが混ざっていないか確認する。
服の色がシーンごとに揺れる
色は照明の影響を強く受ける。衣装の色を一貫させたいなら、環境層の色温度を固定し、夜のシーンでも色の記述を変えない。編集段階で色を揃える運用も有効で、こちらは後戻りが容易だ。
動きが不自然に固まる
固定すべきでない要素まで固定している可能性が高い。姿勢、表情、カメラの指示に自由度を与える。動きの指示を一つに絞り、速度や方向を具体的に書くことでも改善する。
背景だけが溶け合う
背景が複雑すぎるか、参照画像の輪郭が背景に溶けている。参照画像の背景を整理し、必要なら人物だけを切り出して使う。背景は別レイヤーとして後から合成する前提で作ると、破綻が減る。
指や小物の形が崩れる
手や小物は面積が小さく、情報量が足りない。アップのカットを1枚用意して参照に加えるだけで改善することが多い。どうしても崩れる場合は、その部分を画面外に出す構図へ変更する。
30秒ショートを1本作る実践パイプライン
ここまでの内容を、実際の制作順に並べる。題材は「雨の街を歩く少女が振り返る」という30秒の縦型ショートとする。
工程1:設計(30分)
キャラクターの4層を文章で定義する。アイデンティティ層は髪型・瞳の色・年齢感、衣装層はレインコートの色と素材、小道具層は傘、環境層は夜の雨と街灯。この時点で、カットごとに何を変えるかを決めておく。
工程2:参照セットの準備(1時間)
基準画像を選び、正面・斜め・横顔・全身を揃える。照明条件を統一し、背景をシンプルにする。表情違いは1点だけ用意する。
工程3:カット設計(30分)
6カットに分ける。歩行の引き、足元の寄り、傘のアップ、振り返りのミディアム、顔のアップ、ラストの引き。各カットの動きは一つに絞り、外見の記述は共通テンプレートを使う。
工程4:生成と選別(2〜3時間)
各カットを3回生成し、最良のものを選ぶ。選ぶ基準は見栄えではなく、前後のカットとの連続性である。単体で最も美しいカットが、並べると浮くことがある。
工程5:つなぎと仕上げ(1〜2時間)
切り替えを動作の途中に置き、色温度と明るさを揃える。効果音と雨の環境音を入れ、揺れが目立つ箇所は寄りのカットで隠す。最後に全カットを通して再生し、ドリフトがないか確認する。
工程6:検証と記録(30分)
使用したシード、参照画像、特徴記述をテンプレートとして保存する。次の作品ではこのテンプレートを複製して使う。記録が資産になる。
納品前の品質チェックリスト
仕上げの段階で見落としやすい点を、確認項目としてまとめておく。
- 同一キャラクターが全カットで同一に見えるか
- 髪の長さと色が全カットで一致しているか
- 衣装の柄やロゴの位置がずれていないか
- 照明の方向がシーン内で矛盾していないか
- 指や小物の破綻がないか
- カットの切り替わりで視線が不自然に飛ばないか
- 縦型・横型それぞれで構図が成立しているか
- 音と動きのタイミングがずれていないか
- 冒頭3秒で題材が伝わるか
- 記録用テンプレートが更新されているか
チェックは目視だけでなく、書き出した静止画を並べて行うと精度が上がる。特に顔の比率と髪のシルエットは、並べた瞬間に差が分かる。
FAQ
一貫性を最優先するなら、参照画像は何枚必要ですか
題材にもよるが、5〜8点が実務的な落としどころだ。正面、斜め、横顔、全身、表情違いを含め、照明条件を揃える。枚数を増やすより、条件を揃えるほうが効果が大きい。
動きを大きくすると必ず崩れます。諦めるしかないですか
動きの強さには閾値がある。まず小さな動きから段階的に上げ、崩れ始める点を記録する。その範囲内で演出を組み、大きな動きが必要なカットは別の要素(寄り、暗転、効果音)で補うとよい。
キャラクターの設定を後から変えたくなったら
変更する層を一つに限定する。顔を変えるなら衣装と環境は固定し、変更前後のカットを並べて影響範囲を確認する。複数の層を同時に変えると、崩れの原因が分からなくなる。
生成ごとに結果がばらつきます。何を先に固定すべきですか
まず乱数シード、次に参照条件、最後にテンプレート化した外見記述の順で固定する。この順番なら、どこで揺れが減ったかを確認しながら進められる。
長尺の動画にも同じ方法が使えますか
使えるが、分割が前提になる。数秒のカットに分け、カットごとに検証する。長尺を一括生成しようとすると、途中でドリフトが蓄積し、修正範囲が広がる。
チームで作業するときの注意点はありますか
テンプレートと参照セットを共有の場所に置き、誰が触っても同じ条件になるようにする。担当者ごとに参照画像を差し替える運用は、揺れの最大の原因になる。
一貫性は才能ではなく設計で決まる。基準画像を決め、層を分け、変数を一つずつ動かす。この手順を繰り返せば、キャラクターが別人になる問題は、再現可能な作業として扱えるようになる。


