複数の参照画像を入力し、キャラクターの見た目や画風を保ったまま数秒の動画クリップを生成する。かつては実験的なデモンストレーションだったこの手法が、いまではSNS広告、ECの商品ページ、教育コンテンツ、短編映像のプリプロダクションまで幅広く使われるようになった。重要なのは生成の速さそのものではなく、「ショットをまたいでも同じ人物・同じ商品・同じ世界観に見えるか」という一貫性の設計である。本記事では、マルチ画像フュージョンという考え方を軸に、参照素材の作り方からプロンプト設計、ショット割り、失敗の切り分け、ツール選定の判断基準までを実務目線で整理する。特定のサービス名に依存しない形で書いているので、手元の環境に合わせて読み替えてほしい。
マルチ画像フュージョンとは何か
単一画像からの動画生成は、1枚の静止画に動きを与える技術だ。これに対してマルチ画像フュージョンは、複数の参照画像が持つ情報を統合し、1つの動画の中で矛盾なく扱うことを目指す。参照画像にはそれぞれ役割があり、たとえば正面の顔写真は「同一性」を、別角度の全身写真は「体型と衣装」を、ラフスケッチやコンセプトアートは「画風とライティング」を担当する。
この考え方が必要になる理由は単純で、生成モデルは与えられた情報のうち、足りない部分を確率で補完するからだ。1枚しか参照がないと、モデルは見えていない側面を勝手に想像する。結果として、ショットを切り替えるたびに顔の輪郭が変わり、髪の長さが変わり、服の色が微妙にずれる。複数の参照画像を渡すことは、この「勝手な想像の余地」を減らす作業だと言い換えられる。
マルチ画像フュージョンが向いているのは、次のようなケースである。
- 同一キャラクターを複数ショットに登場させる短編映像やシリーズ広告
- 1つの商品を角度や背景を変えて見せるEC動画
- 特定のイラストレーター風の画風を保ったまま動かしたいアニメーション
- 実写風の人物と、イラスト調の背景を同居させたいハイブリッド表現
- 建築パースやコンセプトアートを、カメラが動く映像へ展開するプレゼンテーション
逆に向いていないのは、参照画像が1枚しかない案件、参照ごとに別人が写っている案件、そして「毎回まったく違う絵が出てほしい」というランダム性を重視する案件だ。一貫性を求める機能と、多様性を求める使い方は、同じ設定では両立しにくい。
仕組みを分解する:キーフレーム・同一性・融合レイヤー
マルチ画像フュージョンの中身をブラックボックスのまま使うと、失敗したときに原因が分からなくなる。ここでは処理を4つの層に分けて整理する。すべてのツールが同じ名称を使っているわけではないが、おおよそこの流れで動いていると考えると理解しやすい。
キーフレーム抽出:どの特徴を残すか
最初の工程は、入力された複数の静止画から「残すべき特徴」を選び出す処理である。解像度、構図、表情、ポーズの情報を評価し、キャラクターの同一性を定義する要素を抽出する。ここで重要なのは、抽出されるのが「画素そのもの」ではなく「特徴のベクトル」だという点だ。
そのため、参照画像の枚数が多ければ多いほど良いわけではない。似た角度の写真を10枚入れても情報量はほとんど増えず、ノイズだけが増える。実務的には、角度・表情・距離感が異なる3〜6枚が扱いやすいバランスになる。
同一性埋め込み:キャラクターを数値化する
抽出された特徴は、モデルが扱える数値の並びに変換される。これが同一性埋め込みである。顔の骨格、髪の質感、肌のトーン、衣装のパターンなどが、動画全体で参照できる形で保持される。
この層が弱いと、動画の後半で顔が崩れる。逆に強すぎると、指定した動きや表情の変化をモデルが拒否し、のっぺりとした芝居になる。多くのツールには「参照の強さ」に相当するパラメータがあるので、まずは中程度から始め、崩れが出たら上げ、動きが硬ければ下げるという調整が基本になる。
融合レイヤー:環境と人物の衝突を解消する
テキストプロンプトは背景、照明、時間帯、天候などを指定する。参照画像は人物や商品を固定する。この2つはしばしば衝突する。たとえば参照写真が強い逆光で撮られていて、プロンプトが「正面からの柔らかい光」を要求している場合、どちらを優先するかを決めなければならない。
融合レイヤーは、この衝突を視覚的に自然な形で解消する役割を持つ。うまく機能しているときは、人物は参照どおり、照明はプロンプトどおりに近づく。機能していないときは、顔に元写真の影が残ったまま背景だけが明るくなり、合成写真のような不自然さが出る。
時間方向の安定化:フレーム間の揺れを抑える
動画生成特有の課題が、フレーム間の一貫性である。1枚ずつ見ると正しいのに、再生すると輪郭が細かく震える、いわゆるフリッカーが起きる。これは生成モデルが各フレームを独立に近い形で予測し、その結果を時間方向に滑らかにする処理が追いつかないときに発生する。
対策は2つある。1つは生成側の設定で、ショットを短く区切り、動きの少ない構図を選ぶこと。もう1つは編集側で、後処理として時間方向のノイズ除去をかけることだ。どちらか一方だけでは限界があるので、両方を組み合わせる前提で考えるとよい。
制作ワークフロー:企画から書き出しまで
ここからは実際の手順を順番にたどる。所要時間の目安は、短い広告クリップ1本あたり、素材準備に30〜60分、生成と選別に1〜2時間、編集に1時間程度である。ツールの待ち時間よりも、素材とショット設計に時間をかけたほうが最終品質は上がる。
ステップ1:目的と尺を決める
最初に決めるのは、動画の用途、公開先、尺、アスペクト比である。縦型のSNS広告なら9:16で3〜6秒のカットを4〜6本、横型の商品紹介なら16:9で5秒前後のカットを3〜4本、というように、必要なクリップ数を先に確定させる。
この段階で「何を固定し、何を変えるか」を言語化しておく。キャラクターの顔を固定して背景を変えるのか、商品を固定して照明を変えるのか、画風を固定して人物を変えるのか。固定対象が曖昧なまま生成を始めると、後から全部作り直すことになる。
ステップ2:参照画像セットを構築する
次に参照画像を集める。理想は同一条件で撮影・作成されたセットだが、現実には既存素材をかき集めることになる。その場合は、解像度と照明をできるだけ揃え、極端なフィルターや加工が入った画像は除外する。
参照画像は「キャラクター用」「スタイル用」「環境用」の3グループに分けて管理すると扱いやすい。どの画像がどの役割を担うかを明確にしておけば、生成結果が崩れたときに、どのグループを差し替えるべきかが判断できる。
ステップ3:ショットリストを作る
生成を始める前に、ショットリストをテキストで書き出す。各ショットについて、被写体、動作、カメラワーク、尺、背景、照明の6項目を一行でまとめる。
たとえば「主人公が振り返る/ゆっくりしたドリーイン/4秒/夕暮れの屋上/逆光気味」といった具合だ。この粒度で書いておくと、生成時のプロンプトにそのまま流用でき、複数人で作業しても解釈がずれない。
ステップ4:生成と選別を繰り返す
生成は1ショットにつき3〜5パターン出し、良いものを残す方式が効率的である。1パターンずつ完璧を目指すと、待ち時間ばかりが増える。複数案を並べて比較したほうが、どのプロンプト表現が効いたのかが掴みやすい。
選別の基準は、顔の崩れ、手指、輪郭のちらつき、背景の破綻、動きの自然さの5点。このうち1つでも明確に破綻しているものは、後処理で救うより再生成したほうが速い。
ステップ5:編集と仕上げ
生成したクリップは、そのまま繋ぐと動きの勢いが不自然になる。編集ソフトでカットの長さを微調整し、必要なら速度を5〜10%変えてリズムを整える。カラーマッチングでショット間の色温度を揃えると、一貫性の印象が大きく向上する。
音は後から載せる。生成動画は無音が基本なので、環境音、効果音、BGMを加えることで、映像の粗さがかなり目立たなくなる。ナレーションを入れる場合は、カットの尺を声の長さに合わせて調整する。
参照画像の準備が品質の8割を決める
生成結果の良し悪しは、プロンプトよりも参照画像で決まる。ここでは実務で効果の大きいポイントを挙げる。
- 解像度は短辺1024ピクセル以上を目安にする。低解像度はディテールを失い、顔が平均化する
- 顔は正面、斜め45度、横顔の3方向を揃えると、回転や振り向きのショットが安定する
- 照明条件を統一する。片方だけ強い色被りがあると、動画内で肌の色が揺れる
- 表情はニュートラルを基本にし、笑顔や真剣な顔はサブとして1枚ずつ加える
- 衣装は色と柄がはっきり分かる全身カットを用意する
- 背景は単色またはシンプルなものを選ぶ。背景が複雑だと、その要素が動画に混入しやすい
- 文字やロゴが写り込んだ画像は避ける。生成時に文字が溶けて不自然な模様になる
- コラージュや分割画像は使わない。1枚の画像に複数の人物が写っていると同一性が混ざる
- 参照の枚数は3〜6枚を基本とし、それ以上は厳選する
これらを満たす参照セットを一度作っておくと、以降の案件で使い回せる。シリーズ企画では、キャラクターの参照セットを資産として管理することが最も投資対効果の高い作業になる。
プロンプト設計:画像とテキストの役割分担
マルチ画像フュージョンを使うときのプロンプトは、単一画像生成のときとは書き方が変わる。原則はシンプルで、「見た目は画像に任せ、動きと状況はテキストで指定する」ことだ。
ありがちな失敗は、参照画像があるのにプロンプトで人物の外見を細かく描写してしまうケースである。テキストの記述と画像の情報が食い違うと、モデルはどちらかを優先し、結果として顔が揺れる。参照画像があるなら、人物の説明は最小限に留める。
もう1つの原則は、1ショット1動作にすることだ。「歩きながら振り返り、同時に帽子を押さえる」といった複合動作は破綻しやすい。動作を分け、カットを増やしたほうが結果は良くなる。
プロンプトの構造は次の順序で組み立てると安定する。
- 被写体(画像参照であることを明示する)
- 動作(1つだけ、動詞で簡潔に)
- カメラ(固定、パン、ドリー、手持ち風など)
- 環境と時間帯
- 照明と質感
- 除外したい要素
除外指定は地味だが効果が大きい。「顔の歪み、余分な指、文字、ロゴ、ちらつき」などを明示しておくと、破綻の発生率が下がる。ツールによってはネガティブプロンプト欄が別に用意されているので、そちらに入れてもよい。
ショット設計とカメラワーク
映像の一貫性は、画像とプロンプトだけでなく、カットの繋ぎ方でも作られる。ここでは生成AIと相性の良いショット設計を整理する。
まず尺である。生成モデルが得意とするのは3〜5秒の短いクリップだ。長回しを1本作るより、短いカットを繋いだほうが破綻が少なく、編集の自由度も高い。
次にカメラワーク。固定カメラは最も安定する。緩やかなドリーインやパンは次に安定し、被写体の動きと組み合わせやすい。手持ち風の揺れや急激なズームは、フレーム間の変化が大きくなり、ちらつきの原因になる。
カットの繋ぎ方では、動きの方向を揃えることが重要だ。左から右へ歩くショットの次に、右から左へ歩くショットを置くと、観客は方向を見失う。これを防ぐには、各ショットの動きの向きをショットリストの段階で書き添えておく。
同ポジションでの繋ぎ(マッチカット)も有効である。同じ構図で背景だけが変わる2つのショットを用意すると、時間経過や場所の移動を少ないカット数で表現できる。生成AIでは背景だけを差し替える指示が比較的安定するため、この手法は相性が良い。
よくある失敗と対処法
| 症状 | 主な原因 | 対処 |
|---|---|---|
| 途中で顔が別人になる | 参照の強度が不足、参照の角度が偏っている | 参照を追加し、強度を上げる。回転ショットは角度別の参照を用意する |
| 服の色や柄が変わる | 参照に全身カットがない、照明が不統一 | 全身の参照を追加し、色被りのある画像を除外する |
| 輪郭が細かく震える | 動きが大きい、尺が長い、設定が不適切 | ショットを短くし、動きを減らし、後処理で時間方向の平滑化をかける |
| 手指が溶ける | 手が画面内で大きい、動作が複雑 | 手を画面外に出す、手のアップを避ける、動作を単純化する |
| 背景が脈打つように変化する | 背景の情報量が多い、環境指定が曖昧 | 背景を単純化し、環境を具体的に指定する |
| 動きが速すぎる、遅すぎる | 尺と動作の不整合 | 生成尺を変える、編集で速度を微調整する |
| 画風が参照と合わない | スタイル参照が不足、テキストの画風指定と衝突 | スタイル参照を明示し、テキスト側の画風記述を削る |
| 文字やロゴが崩れる | 文字を含む参照、文字の生成要求 | 参照から文字を除去し、文字は編集で後載せする |
失敗の多くは、参照画像の不足か、プロンプトの詰め込みすぎに起因する。原因が分からないときは、いったんプロンプトを短くし、参照を減らして単純な条件で試すと切り分けが早い。
ツール選定の判断基準
生成ツールは多数あり、どれが最適かは用途によって変わる。選定時は次の観点で比較するとよい。
- 参照画像の同時入力数:3枚以上を実用的に扱えるか。役割を分けて指定できるか
- クリップ長:3秒で十分か、10秒以上が必要か。長尺は一貫性が落ちやすい点も考慮する
- 解像度とアスペクト比:縦型、横型、正方形に対応しているか。アップスケール手段があるか
- 制御機構:ポーズ指定、深度指定、カメラ軌道指定など、どのレベルの制御ができるか
- 一貫性の制御方法:参照の強度調整、シード固定、キャラクター登録機能の有無
- 反復速度:1本あたりの待ち時間。試行回数を稼げるかどうかが品質に直結する
- 出力形式:連番画像、動画、アルファ付きなど、編集ソフトに取り込めるか
- 実行環境:クラウドかローカルか。機密素材を扱う案件ではローカルが有利
- 商用利用の条件:生成物の権利と利用範囲を事前に確認する
- 学習コスト:チーム全員が使えるか、属人化しないか
代表的な選択肢として、Runway、Luma Dream Machine、Kling、Pika、Sora、Veoなどのクラウド型サービスがある。手軽さと品質のバランスが良く、まず試すには向いている。一方、ComfyUIのようなノードベース環境でStable Diffusion系のモデルを組み、ControlNetやIP-Adapter、LoRAを併用する構成は、制御の細かさと再現性で優れる。AnimateDiffなどを使ったローカル生成は、同じ参照セットで大量のショットを量産したい案件で力を発揮する。
編集側は、After EffectsやDaVinci Resolveのような定番ツールで問題ない。カラーマッチング、時間方向のノイズ除去、速度調整、音の合成ができれば十分だ。3Dのカメラワークを厳密に制御したい場合は、Blenderでレイアウトを作り、それを参照にして生成するワークフローも有効である。
活用シーン別の実例
用途ごとに、参照画像とプロンプトの設計は変わる。代表的な5つを見ていく。
EC商品の紹介動画では、商品を三脚で撮った正面・斜め・背面の3枚を参照にする。背景は単色、またはブランドカラーのスタジオ風に指定する。カメラは緩やかな回転かスライド、尺は3秒。動きを最小限にすることで、商品の形状が正確に保たれる。
教育コンテンツでは、講師の顔を固定し、背景だけをスライドや図解に差し替える。人物の動作は説明のジェスチャー程度に留める。参照画像は正面と斜めの2枚で足りることが多く、代わりに照明を均一に整えることが重要になる。
SNSの縦型ショートでは、同じキャラクターが異なる場所に現れる構成が効果的だ。参照セットを1つ作り、環境だけを変えて5〜6カット生成する。冒頭1秒で顔を見せ、以降は動きで惹きつける編集にすると離脱が減る。
短編ナラティブでは、キャラクターだけでなく小道具や衣装の参照も用意する。同じ小道具が複数ショットに登場すると、観客は物語の連続性を自然に感じ取る。逆に小道具の形がショットごとに変わると、それだけで作り物っぽさが際立つ。
建築や不動産のプレゼンテーションでは、パース図を参照にしてカメラをゆっくり進める。人が登場しないため一貫性の難易度は低いが、直線が歪むと違和感が大きい。歪みが出る場合は、生成よりも3Dレンダリングを土台にしたほうが早いこともある。
ゲームやアニメのキャラクター紹介では、設定画を参照にし、表情差分を複数用意する。参照が線画の場合は、彩色の指示をテキストで補う必要がある。線画と彩色済み画像を混ぜると一貫性が崩れるので、どちらかに統一する。
よくある質問
Q. 参照画像は何枚が最適ですか。
一般的には3〜6枚が扱いやすい。角度と表情を分散させ、同じような構図は重複させないことが重要である。10枚以上入れると、情報の衝突が起きて顔が揺れることがある。
Q. プロンプトは長いほうが良いですか。
短いほうが安定する。参照画像がある場合、人物の外見記述は不要に近い。動作、カメラ、環境、照明、除外要素を簡潔に書くだけで十分なことが多い。
Q. 生成した動画の顔が少しずつ変わるのですが。
参照の強度を上げる、参照の角度を揃える、ショットを短くする、動きを減らす、の順に試す。それでも改善しない場合は、顔のアップを避けた構図に変えるのが現実的である。
Q. 手持ち風のカメラワークは使えますか。
使えるが、破綻率は上がる。短い尺で、被写体の動きを小さくすれば実用範囲に収まる。安定した結果が必要な場面では、編集で手ぶれを後から加えるほうが制御しやすい。
Q. 同じキャラクターで大量のショットを作るコツはありますか。
参照セットを固定し、シード値も固定し、プロンプトの共通部分をテンプレート化する。変数は動作と環境だけに絞ると、ショット間の一貫性が保たれやすい。
Q. 生成物を商用利用できますか。
ツールごとに条件が異なる。利用規約と、入力した参照画像の権利の両方を確認する必要がある。特に実在の人物や他社のキャラクターに似た素材を使う場合は慎重に判断したい。
Q. 音声はどうしますか。
生成動画は無音が基本なので、別途用意する。環境音を薄く敷くだけでも臨場感が増し、映像の粗さが目立たなくなる。ナレーションを入れる場合は、先に音を作り、その長さに合わせてカットを調整すると手戻りが少ない。
Q. ローカル生成とクラウド生成、どちらを選ぶべきですか。
試行回数を重視するならクラウド、制御と再現性、機密性を重視するならローカルが向く。両方を使い分け、ラフはクラウド、本番はローカルという運用も現実的である。
品質チェックリストと次の一歩
最後に、書き出し前の確認項目をまとめておく。
- 参照セットは役割ごとに整理され、重複や矛盾がないか
- すべてのショットで、顔、髪、衣装、小道具が同じに見えるか
- カット間で動きの方向が揃っているか
- 色温度と露出がショット間で揃っているか
- 手指、輪郭、背景に破綻が残っていないか
- 再生速度が不自然でないか
- 音とカットのタイミングが合っているか
- 除外指定で消しきれなかった文字やロゴが残っていないか
- 商用利用の条件を確認したか
- 使用した参照画像とプロンプトを記録として残したか
最初から完璧な一貫性を目指す必要はない。まずは3ショットの短いテストを作り、どこで崩れるかを確認する。崩れた箇所が参照の不足によるものか、プロンプトの衝突によるものか、動きの大きさによるものかを切り分け、一つずつ潰していく。この反復を数回こなせば、自分の題材における「効く設定」が見えてくる。
大切なのは、ツールを乗り換え続けることではなく、参照セットとショットリストという再利用可能な資産を積み上げることだ。素材が整い、手順が決まれば、複数画像からの動画生成は特別な技術ではなく、再現性のある制作工程になる。


