Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Lego Pixel的発想でAI動画の一貫性を保つ実践ワークフロー|キャラクター固定とシーン継続のコツ

Sep 29, 2026

AI動画で同じ人物が崩れる本当の理由

生成AIを使った動画制作が身近になる一方で、多くの制作者が同じ壁に突き当たります。1カット目は理想的な顔立ちだったのに、2カット目では目の間隔が変わり、3カット目では髪の色がわずかに違う。衣装のディテールも、光の当たり方も、まるで別の人物が演じているように見えてしまう。この揺らぎは視聴者に強い違和感を与え、ストーリーへの没入を根本から損ないます。

原因はシンプルです。多くのテキストto動画モデルは、入力された言葉の集合から毎回ゼロベースで映像を組み立てています。前のカットで何が起きたかを記憶しているわけではなく、参照画像を渡したとしても「その画像のどの要素をどれだけ優先すべきか」という指示が曖昧であれば、モデルは足りない情報を自由に補間してしまいます。結果として、顔のパーツ配置、肌の質感、服装の縫い目、背景の小物の位置といった要素が、カットごとに少しずつずれていくのです。

ここで有効になるのが、映像を「ピクセルの集合」ではなく「再利用可能な部品の集合」として扱う考え方です。ブロックを組み替えて形を作る玩具のように、顔・髪・衣装・小物・背景・ライティングといった要素をそれぞれ独立したブロックとして定義し、カットをまたいで同じブロックを呼び出す。本記事ではこの考え方を「Lego Pixel的アプローチ」と呼び、実際の制作フローに落とし込みながら、一貫性を保つための具体的な手順を解説します。

重要なのは、これは特定のツールやサービスに依存した方法ではないという点です。考え方の骨格さえ理解してしまえば、複数の生成モデルをまたいでも、画像編集ツールを挟んでも、同じ原則を適用できます。まずは原則を押さえ、そのうえで自分の制作環境に合わせて具体化していきましょう。

Lego Pixel的アプローチの4つの原則

一貫性を保つための土台は、次の4つの原則に集約できます。どれか一つだけを実践しても効果は限定的ですが、4つを組み合わせると安定性が大きく変わります。

原則1:属性をブロック化する

キャラクターを「一人の人間」として漠然と捉えるのではなく、顔の輪郭、眉の形、瞳の色、髪の長さと質感、体型、衣装の素材、アクセサリーといった属性に分解します。それぞれを独立したブロックとして言語化し、数値や短い記述で固定します。たとえば「丸みのある輪郭」「太めの眉」「暗い茶色の瞳」「鎖骨までの黒髪ストレート」といった具合です。ブロック化の利点は、変更したい部分だけを差し替えられること。表情だけを変え、衣装だけを着替えさせ、背景だけを夜に変える、という操作が破綻なく行えます。

原則2:参照を固定する

ブロックを言語化しただけでは、モデルの解釈にばらつきが残ります。そこで参照画像を併用し、しかも「どの画像のどの部分を基準にするか」を明示します。顔は正面のアップ、衣装は全身の立ち姿、質感は手元のクローズアップ、というように役割を分けて渡すのが定石です。1枚の完璧な画像を探すより、役割ごとに分割した複数枚のほうが安定します。

原則3:レイヤーを分離する

キャラクター、背景、小道具、エフェクトを別々に生成し、後工程で合成するアプローチです。全部を一度に生成しようとすると、モデルは限られた計算資源をすべての要素に配分しなければならず、結果としてどの要素も中途半端になります。分離すれば、キャラクターの一貫性を保ったまま背景だけを差し替えることが容易になります。

原則4:状態をバージョン管理する

どのプロンプト、どの参照画像、どのシード値で生成したカットなのかを記録します。これは地味ですが決定的に重要です。後から「3カット目の雰囲気に戻したい」と思ったとき、記録がなければ再現できません。スプレッドシートでもテキストファイルでも構いません。カット番号、使用モデル、プロンプト全文、参照画像のパス、シード値、生成日時を一行で残す習慣をつけましょう。

制作前の準備:キャラクター仕様書を作る

撮影であれば、俳優の顔や衣装は物理的に存在するため、カットが変わっても自動的に一貫します。生成AIにはその前提がないので、仕様書という形で外部記憶を用意する必要があります。

三面図と表情差分

正面、斜め45度、横顔の3方向の画像を用意します。これがあると、カメラアングルが変わってもモデルが参照できる情報量が格段に増えます。さらに、無表情、微笑み、驚き、怒り、悲しみの5種類の表情差分を用意しておくと、感情の変化するシーンでも顔の骨格が崩れにくくなります。表情差分は高解像度である必要はありません。重要なのは骨格とパーツ配置が読み取れることです。

カラーパレットのコード化

髪、肌、瞳、衣装、背景の主要色をHEXコードで書き出しておきます。生成モデルが色指定を完全に理解するわけではありませんが、プロンプトに具体的な色名とコードを併記することで、カット間の色ズレが明確に減ります。また、編集ソフトで色調整を行う際の基準にもなります。

テキスト定義の作成

年齢感、骨格の印象、体型、髪質、服装のジャンル、時代背景、居住する世界の雰囲気などを文章で定義します。ここで注意したいのは、形容詞を積み上げすぎないことです。「美しい」「魅力的」「神秘的」といった主観的な語は、モデルにとって解釈の幅が広すぎます。「頬骨が高く、顎が細い」「肩幅は狭く、姿勢はまっすぐ」といった観察可能な記述に置き換えましょう。

世界観のルールブック

キャラクターだけでなく、世界そのもののルールも定義します。光源の方向、時間帯の色温度、建築様式、使用される道具の素材、天候の傾向などです。シリーズものでは、このルールブックがカット間の統一感を支える背骨になります。

ショットリストとキーフレーム設計

一貫性の問題は、実は撮影前の設計段階で半分決まります。行き当たりばったりでカットを増やすと、参照すべき基準が増えすぎて破綻します。

ショットリストに含めるべき列

カット番号、尺、カメラアングル、レンズ感(広角か望遠か)、キャラクターの位置、動作、感情、背景、ライティング、使用モデル、備考。この程度の列を用意しておくと、生成時のプロンプトを半自動的に組み立てられます。特に「レンズ感」は見落とされがちですが、同じ人物でも広角と望遠では顔の印象が大きく変わるため、シーンごとに統一しておく必要があります。

キーフレームを先に固める

各シーンの始点と終点となるフレームを先に生成し、承認してから中間を埋めます。最初から動画を一気に生成するのではなく、静止画の段階で一貫性を検証するほうが、修正コストが桁違いに低くなります。静止画で破綻しているものを動画にしても破綻は拡大するだけです。

カメラワークの統一

同一シーン内では、カメラの動きの種類を絞ります。固定、ゆっくりとしたパン、わずかなドリーイン程度に留めておくと、視聴者は揺らぎを「演出」として受け取ります。逆に、カットごとにまったく異なるカメラワークを混ぜると、たとえキャラクターが完璧でも全体として落ち着かない印象になります。

プロンプトを「固定ブロック+可変ブロック」で組み立てる

一貫性を保つ実践の中心はプロンプト設計です。ここでは、プロンプトを2つの層に分ける方法を紹介します。

固定ブロック

すべてのカットで一字一句変えない記述です。キャラクターの身体的特徴、衣装の主要素、世界観の基本設定、画風の指定が含まれます。この部分はテンプレート化して、コピー&ペーストで使い回します。文章を少し整えたい誘惑に負れないことが重要です。語順が変わるとモデルの解釈も変わります。

可変ブロック

カットごとに差し替える記述です。感情、動作、カメラアングル、背景の具体的な状況、ライティングの変化が含まれます。可変部分はできるだけ短く、具体的に。抽象的な感情語よりも、身体的な表現のほうが結果が安定します。「悲しんでいる」ではなく「視線を下げ、肩を落とし、口をわずかに結んでいる」と書くほうが、顔のパーツが崩れにくくなります。

記述の順序を固定する

モデルは入力の前半に強く反応する傾向があります。したがって、順序は「被写体 → 外見の詳細 → 衣装 → 動作・感情 → カメラ → ライティング → 背景 → 画風」のように固定します。毎回同じ順序で書くことで、どの要素が結果に効いているのかを検証しやすくなります。

ネガティブ指定の使い方

避けたい要素を指定する欄がある場合、キャラクターの一貫性に関わる項目だけを絞って書きます。たとえば「顔の左右非対称」「指の本数の異常」「衣服の模様の過剰な追加」などです。項目を大量に並べると、モデルが制約に圧迫されて動きが硬くなり、かえって不自然になります。

シード値の固定と再現性

多くのモデルはシード値を指定できます。同じシード値、同じプロンプト、同じ参照画像の組み合わせであれば、ほぼ同じ結果が再現できます。カットを追加するときは、まず基準カットのシード値を維持したまま可変ブロックだけを変え、崩れるようならシード値を再探索する、という順序で進めると効率的です。

ツール選定の判断基準

一貫性を重視する場合、ツールの選び方も通常とは異なります。派手なデモ映像の美しさよりも、再現性と制御性を優先してください。

確認すべき7つのポイント

1つ目は参照画像の同時入力数です。複数枚を役割別に渡せるモデルほど、キャラクター固定が容易になります。2つ目はシード値の指定可否と、その再現精度。3つ目は画像to動画の対応状況で、承認済みのキーフレームから動きを生成できるかどうかは作業効率を大きく左右します。4つ目は解像度と尺の上限。5つ目は音声やリップシンクの扱い。6つ目は編集機能の有無で、部分的な再生成やマスク編集ができると修正コストが下がります。7つ目は出力形式と商用利用条件です。

モデルを使い分ける

すべてのカットを同じモデルで生成する必要はありません。人物のクローズアップには顔の再現性に強いモデル、広い背景には空間表現に強いモデル、といった具合に役割分担させる方法もあります。ただし、モデルを切り替えると画風が変わるリスクがあるため、カットの繋がりが目立たない場所、たとえば場面転換の直後などで切り替えるのが安全です。

編集ツールを必ず挟む

生成だけで完結させようとすると、どうしても破綻が残ります。マスク処理、部分的な描き直し、色調整、合成ができる編集環境を用意しておきましょう。生成AIは「素材を作る工程」であり、最終的な一貫性は編集工程で担保される部分が少なくありません。

実践ワークフロー:8つのステップ

ここからは、実際の制作を8つのステップに分解して説明します。

ステップ1:企画と尺の確定

まず作品全体の尺とカット数を決めます。30秒の作品なら6〜10カット、3分なら30〜50カットが目安です。カット数が確定していれば、どのカットを重点的に作り込むべきかの優先順位も見えます。

ステップ2:キャラクター仕様書の作成

前述の三面図、表情差分、カラーパレット、テキスト定義を用意します。ここに時間をかけるほど、後の工程が楽になります。目安として、制作全体の2割の時間をこの段階に充てるのが理想です。

ステップ3:基準キーフレームの生成

キャラクターが最もはっきり見えるカットを1枚選び、納得がいくまで生成を繰り返します。この1枚がすべての基準になります。妥協しないでください。

ステップ4:ショットリストへの展開

基準フレームを起点に、各カットのプロンプトを固定ブロックと可変ブロックに分けて記述します。この段階ではまだ生成せず、テキストの設計に集中します。

ステップ5:静止画での検証

全カットを静止画として生成し、並べて比較します。顔のパーツ、衣装、色味、ライティングのズレを確認し、許容できないものはプロンプトを修正して再生成します。動画化する前にここで潰し切るのが鉄則です。

ステップ6:動画化

承認済みの静止画を起点に動きを生成します。動きの指示は控えめに。大きな動きを一度に指定すると、キャラクターの形状が崩れやすくなります。まず小さな動きで成功させ、必要なら後から合成で動きを足すほうが結果が安定します。

ステップ7:編集と合成

カットを繋ぎ、色調整を行い、必要に応じてマスク処理で破綻を修正します。カット間の色温度を揃えるだけでも、一貫性の印象は大きく向上します。

ステップ8:音声と仕上げ

ナレーション、効果音、音楽を加えます。音は視覚的な揺らぎを覆い隠す効果があります。逆に言えば、音を入れる前に映像の一貫性を確認しておくべきです。

よくある失敗とトラブルシューティング

顔がカットごとに変わる

最も多い症状です。原因の大半は、参照画像の役割が曖昧なこと、または固定ブロックの記述がカットごとに微妙に変わっていることです。まずプロンプトを一字一句比較してください。次に参照画像を顔のアップに絞り、衣装や背景の参照を外します。情報を減らすことで安定する場合が多くあります。

衣装のディテールが増殖する

モデルが模様や装飾を勝手に追加してしまうケースです。衣装の記述を「シンプルな黒のタートルネック」のように最小限にし、装飾に関する語をすべて削除します。ネガティブ指定に「余計な模様」「過剰な装飾」を加えるのも有効です。

背景だけが妙にリアルになる

レイヤー分離ができていない兆候です。背景を別途生成し、合成する方式に切り替えてください。また、背景の記述に具体的な固有名詞や細かい描写を入れすぎると、モデルが背景に計算資源を割き、人物がおろそかになります。

動きをつけると顔が崩れる

動画化の段階で崩れる場合、静止画の時点で既にギリギリの状態である可能性が高いです。静止画をもう一段安定させてから動画化しましょう。また、動きの指示を「わずかに首を傾ける」程度まで小さくするのも有効です。

色味がカットごとに違う

生成時の色指定だけでなく、編集工程でのカラーグレーディングでも解決できます。基準カットの色を目標値として設定し、他のカットをそれに合わせて調整するほうが、生成をやり直すより速い場合が多々あります。

手や指が破綻する

手の描写は現状でも難しい領域です。手が画面に入るカットは、手をフレーム外に出す構図に変更するか、編集で手の部分だけを差し替えるのが現実的です。どうしても必要な場合は、手のアップを別途生成して合成します。

シリーズ・長尺運用のための管理術

一貫性は、単発の作品よりもシリーズものや長尺でこそ重要性が増します。ここでは運用面の工夫を紹介します。

素材ライブラリを育てる

承認済みの顔、衣装、小物、背景をフォルダ分けして蓄積します。命名規則を統一しておくと、後から探す手間が激減します。たとえば「キャラ名_衣装名_アングル_連番」といった形式です。

変更履歴を残す

キャラクターの設定を途中で変更した場合、どのエピソードから変更したのかを記録します。視聴者は意外なほど細部に敏感で、突然の変化を指摘します。変更する場合は、物語上の理由づけと合わせて行いましょう。

テンプレートを資産化する

プロンプトの固定ブロック、ショットリストの雛形、編集プロジェクトのテンプレートをファイルとして保存します。次の作品では、これらを複製して中身だけを差し替えます。制作の立ち上がりが数倍速くなります。

外部レビューを挟む

制作者本人は細部のズレに慣れてしまい、気づかなくなります。第三者の目でカットを通しで見てもらい、違和感のある箇所を指摘してもらう工程を入れると、公開後の後悔を防げます。

定期的に一貫性を棚卸しする

シリーズが長くなったら、過去のカットと最新カットを並べて比較する機会を設けます。少しずつドリフトしている場合、早めに気づけば修正範囲を最小限に抑えられます。

よくある質問(FAQ)

参照画像は何枚まで渡すべきですか

役割が明確であれば2〜3枚で十分なことが多いです。顔、衣装、質感の3枚が基本形です。それ以上渡すと、モデルがどの情報を優先すべきか判断できず、かえって不安定になります。

同じプロンプトでも結果が変わるのはなぜですか

シード値が固定されていない、モデルのバージョンが更新された、あるいはサービス側の内部処理が変わったなどが原因です。重要なカットは、生成直後にファイル名とメタ情報を必ず保存しておきましょう。

静止画で完璧なのに動画で崩れるのはなぜですか

動画化の工程では、時間方向の一貫性という新しい制約が加わります。静止画で成立していても、動きの大きさが制約を超えると破綻します。まず動きを極端に小さくし、成功を確認しながら段階的に大きくしてください。

画風を統一するコツはありますか

画風の記述も固定ブロックに含め、一切変更しないことです。「シネマティック」「アニメ調」といった語だけでなく、光の質、彩度、コントラスト、質感の描写まで含めて固定します。編集段階での统一も効果的です。

手作業の修正と再生成、どちらを選ぶべきですか

判断基準は修正箇所の面積と頻度です。画面の1割以下で、他のカットに影響しないなら手作業が速いです。同じ問題が複数カットで発生しているなら、根本原因を直すために再生成すべきです。

複数のモデルを併用しても大丈夫ですか

可能ですが、切り替え地点には注意が必要です。場面転換や暗転の直後など、視聴者の注意がリセットされる箇所で切り替えると違和感が目立ちません。同一シーン内での混在は避けましょう。

初心者が最初に取り組むべきことは何ですか

キャラクター仕様書の作成と、固定ブロックのテンプレート化です。この2つを先に用意するだけで、制作中の迷いが大幅に減ります。技術的な工夫より、外部記憶を整えることが一貫性への最短ルートです。

まとめ:一貫性は技術ではなく設計で決まる

AI動画生成の一貫性は、モデルの性能だけに依存する問題ではありません。むしろ、制作の設計段階でどれだけ情報を構造化したかによって結果が大きく変わります。キャラクターを属性のブロックに分解し、参照画像の役割を明確にし、レイヤーを分離し、すべての判断を記録する。この4つの原則を守るだけで、カットをまたいだ揺らぎは目に見えて減ります。

そして大切なのは、完璧な一貫性を最初から目指さないことです。まずは基準となる1枚を丁寧に作り、そこから小さく展開していく。崩れたら原因を切り分け、記録に戻って修正する。この反復そのものが、あなた自身の制作ノウハウを形成していきます。ツールは今後も進化し続けますが、部品として捉えて再利用するという考え方は、どの技術世代でも通用する普遍的な資産になるはずです。

Alexander

Alexander