Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AIキャラクター動画の一貫性を守る制作ワークフロー:演技と演出の設計ガイド

Oct 6, 2026

連続ドラマ級の人物描写がAI動画の到達点になる理由

近年の生成AI映像は、短いループや単発のカットであれば驚くほど自然な出力を返すようになった。しかし、複数のショットをまたいで「同じ人物が同じ人格で存在し続けている」と視聴者に信じさせるのは、依然として難しい作業だ。豪華なリゾートを舞台にした群像劇が長く支持される理由は、映像の豪華さではなく、人物の内面が丁寧に描かれ、エピソードをまたいでも人格がぶれない点にある。視聴者が本当に見ているものは、ポリゴンの密度ではなくキャラクターの連続性なのだ。

AI動画制作における最大の壁もここにある。ショットごとに顔立ちが変わる、衣装の細部が揺れる、感情の起伏が平坦になる。こうした乱れは、解像度がどれほど高くても視聴者を瞬時に覚醒させ、物語への没入を壊してしまう。逆に言えば、一貫性さえ確保できれば、生成AIは低予算でも「人物ドラマ」を成立させられるだけの素材を出せる段階に来ている。

この記事では、市販の生成ツールを組み合わせて、人物の同一性を保ちながら演技を与えるための実務的なワークフローを整理する。特定のサービスに依存しない形で、設計・生成・選別・編集の各工程で何を決めるべきかを順に追っていく。

まず押さえる三つの用語:同一性・一貫性・連続性

制作の打ち合わせで話が噛み合わなくなる原因は、たいてい言葉の定義のずれにある。最初に三つを分けておくと、後の工程が格段に楽になる。

  • 同一性(アイデンティティ):その人物が誰か。骨格、顔の比率、髪型、肌の質感、年齢感など、変わってはいけない要素。
  • 一貫性(コンシステンシー):ショット間で同一性が保たれている度合い。技術的な指標として扱える。
  • 連続性(コンティニュイティ):時間の流れの中で状態が正しく引き継がれること。傷の位置、衣装の汚れ、手に持っている物、前のショットで開けたドアなど。

AI生成で破綻しやすいのは、実は同一性よりも連続性だ。顔は保てても、前のショットで右手に持っていたカップが次のショットで消える。こうしたミスは、視聴者に「作り物感」を強く印象づける。

AIキャラクター動画制作の基本ワークフロー

人物ドラマを狙う場合、思いついたプロンプトをいきなり動画モデルに投げる進め方はほぼ失敗する。以下の六段階を順に踏むと、手戻りが大幅に減る。

第1段階:キャラクター設計

文章だけで人物を定義する。名前、年齢、職業、性格、話し方、身体的特徴、常に身につけている物を箇条書きにする。この段階で「この人物は何を欲しがっているか」を一行で書けるようにしておくと、後の演技設計がぶれない。

第2段階:参照素材の作成

設計した人物を静止画として複数アングルで生成する。正面、斜め45度、横顔、背面、バストアップ、全身。表情は無表情を基準にし、笑顔・怒り・悲しみ・驚きの4種を追加する。この段階の画像が、以降すべての動画生成の基準点になる。

第3段階:ショット設計

シーンを絵コンテレベルで分解する。各ショットについて、フレーミング、カメラの動き、ライティング、尺、人物の感情、前のショットからの状態変化を表に書き出す。この表があるかないかで、生成の試行回数が3倍以上変わることが多い。

第4段階:生成

ショット単位で生成する。長回しを狙わず、2秒から5秒の短いカットを積み上げる方が、結果的に破綻が少なく編集自由度も高い。

第5段階:選別

生成結果をすべて並べ、連続性の観点で選ぶ。単体で美しいカットよりも、前後とつながるカットを優先する。

第6段階:編集と音

カットを繋ぎ、色調整し、環境音・効果音・音楽・台詞を載せる。音は映像の粗を隠す最大の武器であり、同時にリップシンクのずれを目立たせる諸刃の剣でもある。

キャラクター一貫性を守るための技術原則

ここからは、実際に手を動かす際の具体的な原則を整理する。

参照画像は「量より質」ではなく「角度の網羅性」

一貫性を高める鍵は、参照画像の枚数ではなく角度の網羅性にある。同じ人物の正面ばかり10枚持っていても、横を向いた瞬間に別人になる。正面、斜め、横、背面の4方向を最低ラインとし、可能なら見上げ・見下ろしのアングルも加える。

参照画像の背景は単色に統一する。背景に情報が多いと、モデルが人物以外の要素まで引き継ごうとしてノイズになる。衣装も基準となる一着に固定し、衣装違いの参照は別フォルダで管理する。

シード値とパラメータの記録

多くの動画生成ツールは、シード値を固定すると出力の揺らぎを抑えられる。すべてのカットについて、使用モデル、シード値、参照画像、プロンプト、解像度、尺を表計算ソフトかノートに記録する。これは面倒に見えるが、後から「なぜこのカットだけ顔が違うのか」を追跡できる唯一の手段だ。

記録項目の例は次のとおり。

  • カット番号とシーン番号
  • 使用モデルとバージョン
  • シード値
  • 参照画像のファイル名
  • プロンプト全文
  • ネガティブ指定
  • 生成尺と解像度
  • 採用/不採用の判定理由

状態管理表で連続性を担保する

シーンをまたぐ状態変化は、必ず別の表にまとめる。衣装の汚れ、髪の乱れ、手に持つ小道具、開閉している扉、時間帯による光量。各ショットの冒頭で「この時点でこの人物はどういう状態か」を一行で書く。生成プロンプトには、この状態記述をそのまま含める。

カメラ言語を数値化して固定する

演出の揺れは、カメラ言語の曖昧さから生まれる。「シネマティックに」という指示は、モデルにとって何も意味していない。焦点距離(24mm、50mm、85mm)、絞り(浅い/深い)、カメラの動き(固定、ゆっくり前進、横移動)、ライティング(キーライトの方向、色温度、コントラスト比)を数値と方向で指定する。

同じシーン内では、原則として焦点距離と照明設計を固定する。会話シーンでショットごとにレンズ感が変わると、視聴者は無意識に違和感を覚える。

感情表現をAIで設計する方法

人物ドラマの質を決めるのは、顔の一致よりも演技の説得力だ。AIに「悲しそうに」と指示しても、得られるのは記号的な表情である。演技を分解して渡す必要がある。

演技の三層構造

演技は次の三層に分けて考えると設計しやすい。

  • 目標:この瞬間、人物は何を得ようとしているか
  • 障害:それを妨げているものは何か
  • 行動:障害に対して取る具体的な身体的振る舞い

たとえば「別れを告げる」シーンなら、目標は「相手を傷つけずに去る」、障害は「相手が引き止める」、行動は「目を合わせずに荷物をまとめる手が止まる」。この行動を映像記述に変換する。

マイクロエクスプレッションの指定

感情は大きな表情ではなく、微細な動きで伝わる。まばたきの頻度、眉の内側のわずかな上がり、口角の片側だけの動き、喉の動き。プロンプトでは「感情語」ではなく「身体語」で書く。

弱い例:彼女は悲しんでいる

強い例:彼女はまばたきを止め、下唇を軽く噛み、視線を相手の肩のあたりに固定したまま息を浅くする

呼吸と重心の設計

立ち居振る舞いの説得力を左右するのは呼吸と重心だ。怒っている人物は重心が前がかりになり、呼吸が浅く速くなる。疲れた人物は重心が後ろに落ち、肩が下がる。プロンプトに「胸の上下動が速い」「重心が前方にかかる」といった物理記述を加えるだけで、演技の解像度が一段上がる。

視線のベクトル管理

会話シーンでは、誰がどこを見ているかを管理する。視線の先がショット間でずれると、会話が成立していないように見える。180度ラインを決め、各ショットで人物の視線方向をメモに残す。カメラ側の位置も同様に固定する。

モデル選定の判断基準

一口に動画生成モデルと言っても、得意分野は大きく異なる。選定は「有名かどうか」ではなく、用途との相性で決める。

判断軸を六つに絞る

  • 同一性保持:参照画像から顔と衣装をどこまで維持できるか
  • モーション品質:人体の動き、特に手と関節の自然さ
  • 尺と一貫性:長尺で崩れないか
  • 制御性:カメラワークや開始・終了フレームを指定できるか
  • 解像度と質感:肌、布、髪の描写
  • 生成速度と反復コスト:試行を何回まわせるか

人物ドラマでは、上から三つ、つまり同一性保持・モーション品質・制御性の比重が大きい。風景カットや抽象的なカットは別モデルに任せた方が効率的だ。

テキストから動画と画像から動画の使い分け

テキストから動画は、発想の探索に向く。一方、本番のカットは画像から動画で作る方が安定する。基準となるキーフレームを静止画として作り込み、それを動かす。この順序なら、顔の破綻は静止画の段階で発見できる。

リップシンクと音声の扱い

台詞のあるショットは、音声を先に確定させ、それに合わせて映像を生成する流れが現実的だ。生成した映像に後から音を合わせる作業は、口の動きと音素のずれを修正しきれないことが多い。ナレーション中心の作品なら、この問題はほぼ発生しない。

ツールの組み合わせ例

実際の制作では、単一のツールで完結させない方が品質が上がる。役割分担の一例を示す。

  • 静止画の基準作り:画像生成モデル(Flux系、Stable Diffusion系など)
  • 本番カットの動画化:Runway、Kling、Luma、Pika、Veo、Sora系など、制御性の高いモデル
  • スタイルを強く出したいカット:PixVerse系など様式化に強いモデル
  • アップスケールと補正:専用のアップスケーラとノイズ除去
  • 編集:一般的な動画編集ソフト

モデル名は流行で入れ替わる。重要なのは名前ではなく、上記の六つの判断軸で自分の案件を評価する習慣だ。

プロンプトを演出言語に翻訳する

動画生成のプロンプトは、願望を書く場所ではなく演出指示書である。五つの層に分けて書くと抜けが減る。

  1. 被写体:誰が、何を着て、どの状態か
  2. 動作:何をするか、どの順序で、どの速度か
  3. カメラ:焦点距離、アングル、動き
  4. 照明:光源の方向、硬さ、色温度
  5. 空気:粒子、湿度、風、背景の動き

この五層を一文にまとめようとすると崩れる。改行して層ごとに書くか、区切り記号で分ける。

具体的な記述例

弱い例:cinematic, beautiful woman, sad, 4K

強い例:

  • 被写体:30代女性、白いシャツ、髪は左側でまとめている、右手に冷めたコーヒーカップ
  • 動作:カップを置く、指が取っ手から離れるのが一拍遅れる、視線は窓の外へ
  • カメラ:50mm相当、目線の高さ、固定、浅い被写界深度
  • 照明:窓からの自然光が左頬に当たる、室内は暗め、コントラストは中程度
  • 空気:細かい埃が光の中を漂う、カーテンがわずかに揺れる

ネガティブ指定の使い方

除外指定は、現象を名指しする。指の本数の破綻、顔の溶け、急激なカメラの跳躍、テキストの混入、余分な人物の出現。ただし項目を増やしすぎると表現全体が硬くなる。まずは採用したカットで実際に起きた破綻だけを追加していく。

よくある失敗とトラブルシューティング

失敗の多くは再現性のある原因を持つ。症状別に整理する。

顔がショットごとに変わる

原因は参照画像の不足か、参照の重みが弱いこと。対策は角度を増やした参照セットの作り直し、シードの固定、顔のアップを挟んでから引きのカットへ戻す編集順の工夫。引きのショットでは顔の情報量が少ないため、多少の差は視聴者に気づかれにくい。

手が崩れる

手は生成モデルにとって今も難所である。対策は次の三つ。手を画面外に逃がす構図を選ぶ。手の動きを小さく速くする。手そのものを主役にしたカットは別モデルで生成し、複数回試して最良を選ぶ。

衣装や小道具が消える

連続性の管理表がない場合に起きる。前のショットの状態を次のプロンプトに必ず引き継ぐ。編集段階では、境界に短いリアクションカットを挟んで視線をそらす方法も有効だ。

動きが速すぎて不自然

生成モデルは動きを誇張しがちだ。プロンプトに「ゆっくり」「最小限の動き」と明示し、尺を長めに取る。速い動きが必要なカットは、編集で速度調整する前提で多めに生成する。

リップシンクがずれる

音声先行で作る。口元のアップを避け、横顔や後ろ姿、手前の人物をぼかす構図で会話を処理する。視聴者は意外なほど口の動きを見ていない。

全体が「AIっぽい」

質感の均一さが原因である。対策は、粒子やノイズを意図的に加える、レンズ特性を模す、色を完全には整えない、動きにわずかな手ぶれを入れる。過剰なクリーンさはかえって人工的に見える。

30秒シーンの実践パイプライン

抽象論だけでは動かないので、室内の会話シーン30秒を例に工程を追う。

前提

登場人物は二人。場所は夜のダイニング。テーマは「言い出せない別れ」。

ショットリストの設計

  • カット1(3秒):ダイニング全体の引き。窓の外は雨。人物は手前に背を向けて立つ
  • カット2(4秒):向かい合って座る二人のツーショット。会話が止まっている
  • カット3(2秒):女性の手元。フォークが止まる
  • カット4(3秒):男性の目元のアップ。まばたきが遅い
  • カット5(5秒):女性のバストアップ。視線が窓へ流れる
  • カット6(3秒):窓の外の雨。ピントは手前の人物に残る
  • カット7(4秒):二人のツーショット。女性が立ち上がる
  • カット8(3秒):空の椅子と残された皿
  • カット9(3秒):玄関のドアが閉まる音、暗転

合計30秒。アップと引きを交互に置くことで、顔の一貫性への負荷を分散している点が重要だ。

生成の順序

まずカット4とカット5、つまり顔のアップを生成する。ここで人物の基準が固まる。次にカット2、カット7のツーショット。最後にカット1、カット6、カット8、カット9の人物が小さく写るカットを生成する。この順序なら、難しいカットで得た知見を易しいカットに流用できる。

音の設計

雨音を最初から最後まで通す。会話は最小限にし、沈黙を音で埋める。効果音はドアの閉まる音だけを際立たせる。音があることで、映像の粗が視聴者の記憶から抜け落ちる。

品質管理チェックリスト

完成前に、次の項目を順に確認する。

  • 同一人物に見えるか(顔、髪、体型、肌の質感)
  • 衣装と小道具がショット間で連続しているか
  • 視線の方向が会話として成立しているか
  • 光源の方向がシーン内で矛盾していないか
  • カメラの焦点距離感がショットごとに揺れていないか
  • 動作の速度が全体的に自然か
  • 手と指に破綻がないか
  • 音と映像の同期が取れているか
  • 30秒を通して見たときに、感情の起伏が一本の線になっているか

最後の項目が最も重要だ。どれだけ各カットが完璧でも、感情の流れが途切れていれば作品として成立しない。逆に、技術的に少し粗があっても、感情の線が通っていれば視聴者は最後まで見る。

よくある質問

一貫性を保つには、どのくらいの参照画像が必要か

最低4方向(正面、斜め、横、背面)を推奨する。表情のバリエーションを加えるなら、無表情を基準に4感情で計8枚程度が現実的な出発点になる。枚数を増やすよりも、角度と照明条件を揃えることが効く。

長回しのショットは作れるのか

技術的には可能だが、人物ドラマでは推奨しない。短いカットを繋いだ方が破綻が少なく、演技のリズムも作りやすい。長回しを狙うなら、人物が画面外に出る瞬間や、背を向ける瞬間を挟んで同一性の負荷を逃がす。

実在の俳優に似せてはいけないのか

実在の人物の肖像を無断で再現することは、権利上の問題を招く。特定の俳優に寄せるのではなく、複数の特徴を組み合わせた架空の人物を設計する。名前、骨格、髪型、話し方を自分で決めれば、権利リスクを避けつつ十分な魅力を持つキャラクターが作れる。

どのモデルを選べばよいか

案件の優先順位で決める。顔の安定を最優先するなら同一性保持に強いモデル、動きの自然さを優先するならモーション品質に定評のあるモデルを選ぶ。複数のモデルを試し、同じ参照画像とプロンプトで出力を比較するのが最短の判断方法だ。

生成に何回くらい試行が必要か

顔のアップで5回から10回、人物が小さいカットで3回程度が目安になる。ただし参照素材の質が高ければ試行回数は大きく減る。試行回数が多いと感じたら、プロンプトではなく参照素材とショット設計を見直す方が効果的だ。

音声はどう作るか

台詞がある場合は音声を先に確定する。読み上げの速度、間、息遣いを決めてから映像を合わせる。ナレーション中心なら、映像を先に作り、後から尺に合わせて読み上げる方が自由度が高い。

編集で最も効果的な一手は何か

音を丁寧に作ることだ。環境音の連続性、効果音の配置、音楽の入り方。映像の粗は、音の説得力で大半が覆い隠される。逆に、音が薄いと技術的な破綻がすべて露出する。

初心者が最初に取り組むべき題材は

人物一人、場所一つ、台詞なしの30秒が最適だ。窓辺で手紙を読む、台所でコーヒーを淹れる、駅で電車を見送る。要素を絞ることで、一貫性の管理に集中できる。

まとめ:技術ではなく順序が品質を決める

AI動画制作で一貫性を保つ鍵は、高性能なモデルを探すことではない。設計、参照素材、ショット設計、生成、選別、編集という順序を守り、各段階で決めたことを記録し続けることだ。

顔の一致に悩んだら参照素材に戻る。動きに悩んだらショットの尺と速度指定に戻る。感情が平坦なら演技の三層構造に戻る。ほとんどの問題は、生成モデルの性能ではなく、前工程の曖昧さに起因している。

連続ドラマが視聴者を惹きつけるのは、特殊な技術ではなく、人物が一貫して存在し続けるという当たり前の信頼があるからだ。生成AIを使う場合も、目指すべき到達点は同じである。派手なカットを一つ作るよりも、地味なカットを十つ繋いで人物が生きていると感じさせる。その積み重ねが、結果として最も強い映像体験を生む。

Alexander

Alexander