Limited Time Offer: Get 50% OFF your first month of Pro & Ultra plans 🎉

AI動画生成ワークフロー完全ガイド|キャラクター一貫性を保つ実践手順

Sep 16, 2026

AI動画生成は「実験」から「制作工程」へ

生成AIによる動画制作は、この数年で性格を大きく変えた。少し前まで、AI動画は「どんな映像が出るか試してみる」ための遊びに近かった。プロンプトを投げ、数秒のクリップが出てきて、面白いけれど制御はできない。しかし今は、企画、絵コンテ、カメラワーク、演技、編集という従来の映像制作の工程の一部を、AIがかなり安定的に担えるようになっている。

背景には三つの技術変化がある。第一に、拡散モデルとTransformer系アーキテクチャの組み合わせにより、フレーム間の時間的一貫性が大きく改善した。人物の顔や衣装が、数秒のクリップの中で急に別物にならなくなったのだ。第二に、画像から動画を生成する方式が実用レベルに達した。一枚の参照画像で構図、人物、ライティングを固定し、その上で動きだけを生成できる。第三に、音声合成、リップシンク、アップスケール、背景除去、カラー調整といった周辺ツールが、APIやプラグイン経由でつながるようになった。単発の生成ではなく、パイプラインとして組めるようになったのである。

この変化が意味するのは、「AIで動画を作る」という問いが「どのツールを使うか」から「どの工程をAIに任せ、どこを人間が判断するか」へ移ったことだ。ツールは数か月単位で入れ替わる。だが、工程の分解の仕方、参照画像の設計、ショットの言語化、失敗の切り分け方は、ツールが変わっても再利用できる。本記事では、特定のサービスに依存しない形で、AI動画制作のワークフローを工程順に整理する。とくに、シリーズものや広告、解説動画で最も難しいとされる「キャラクターの一貫性」に重点を置いて解説する。

全体像:AI動画制作を6つの工程に分ける

最初にやるべきは、ツール探しではなく工程の分解だ。工程が分かれていれば、うまくいかなかったときに「どの段階で崩れたのか」を切り分けられる。逆に工程を意識しないと、完成品だけを見て「モデルのせいだ」と判断してしまい、無駄な試行を繰り返すことになる。基本形は次の6工程である。

  • 工程1:企画とスクリプト(誰に何を伝えるか、尺は何秒か)
  • 工程2:ルック開発(色、光、質感、テンポの方向性を決める)
  • 工程3:キャラクター設計(参照画像セットと識別子の定義)
  • 工程4:ショット生成(1カットずつ映像を作る)
  • 工程5:音声とリップシンク(ナレーション、セリフ、効果音)
  • 工程6:編集と仕上げ(つなぎ、色調整、書き出し)

工程1〜2:企画・スクリプト・ルック開発

AI動画は「とりあえず生成してから考える」ことが許されない。1カットの生成に試行錯誤が伴うため、方向性が定まっていないと試行回数が爆発する。まず尺を決める。15秒なのか、60秒なのか、3分なのか。次に、その尺の中で伝えることを一つに絞る。AI動画は情報量を詰め込むほど破綻しやすいので、1カット1メッセージを徹底する。

ルック開発では、完成イメージに近い静止画を数枚作る。ここで大事なのは「動かす前に決める」ことだ。色温度、コントラスト、被写界深度、質感、フィルムグレインの有無。これらを静止画で固めておけば、動画生成のプロンプトに一貫したスタイル記述をコピーできる。ルック開発を飛ばすと、カットごとに色味が変わり、編集で合わせる作業が膨大になる。

工程3〜4:キャラクター設計とショット生成

キャラクターが登場する案件では、工程3が成否を分ける。参照画像を何枚用意し、どの特徴を「識別子」として固定するかを決める。詳しくは後述するが、ここで手を抜くと、後の工程でどれだけプロンプトを工夫しても顔が安定しない。

ショット生成では、絵コンテを1カットずつ処理する。このとき、いきなり本番のカットから始めない。まず「テストカット」を3〜5本作り、モデル、プロンプト、参照の組み合わせが機能するかを確認する。テストで通った設定をテンプレート化し、残りのカットに展開するのが効率的だ。

工程5〜6:音声・リップシンク・編集

音声は後回しにされがちだが、実は先に決めたほうがよい。セリフの長さがカットの尺を決めるからだ。ナレーションを先に録り、その波形に合わせてカットを切る。リップシンクが必要な場合は、口の動きが映える構図(顔が大きすぎず、横を向きすぎない)を選ぶ。編集では、カット間の色と音量を揃え、必要ならモーションブラーやグレインを軽くかけて、生成カットごとの質感差をなじませる。

モデル選定の判断軸は4つに絞れる

モデルの種類が増えるほど選定は難しく見えるが、実務で効く判断軸は4つに絞れる。すべての軸を満たすモデルは存在しないので、案件ごとに優先順位をつけることが重要だ。

軸1:表現スタイルが用途に合うか

実写風、アニメ調、3Dレンダリング調、商品撮影風、レトロフィルム風。モデルごとに得意な領域がある。広告の商品カットなら、質感、反射、ロゴや文字の安定性が重要になる。キャラクターアニメなら、線の安定性と表情の可動域。風景やBロールなら、カメラワークの自然さとパン・ズームの滑らかさ。まず「どのルックに寄せたいか」を決め、それに合わないモデルは候補から外す。

軸2:入力形式(テキストのみか、画像も使えるか)

一貫性が必要な案件では、画像入力に対応していることがほぼ必須条件になる。テキストのみの生成は、初回のルック開発や抽象的なカット、エフェクト素材には向くが、同一人物を何カットも登場させる用途には向かない。画像入力があれば、構図と人物を固定し、動きだけを生成できる。

軸3:反復のしやすさ

生成速度、シードの固定可否、部分的な再生成、出力解像度の切り替え。これらは地味だが、制作時間に直結する。とくに「一部分だけやり直せるか」は重要だ。10秒のカットのうち2秒だけ手が崩れたとき、全体を再生成するのか、該当区間だけを修正できるのかで、作業量は数倍変わる。

軸4:ライセンスと商用利用の条件

生成物を広告や商品ページで使う場合、利用条件の確認は必須である。学習データの扱い、生成物の権利、商標や肖像の扱い、出力の透かしの有無。これらは後から変更できない前提になるため、企画段階で確認しておく。判断に迷う場合は、法務や顧客に確認する前提でスケジュールを組んでおくと安全だ。

キャラクター一貫性を守る設計と技術

ここが本記事の中心だ。AI動画で最も壊れやすいのがキャラクターの同一性である。結論から言えば、一貫性は「生成時の工夫」よりも「事前の設計」で決まる。プロンプトの言い回しを変えるより、参照画像セットを整えるほうが効果は大きい。

参照画像セットの作り方

理想は、同じ人物を複数角度から捉えた5〜8枚のセットだ。正面、斜め45度、横顔、やや見下ろし、やや見上げ。表情は無表情、笑顔、真剣な顔の3種。加えて、衣装のディテールが分かるカットと、小物やアクセサリーのカット。すべて同じ照明条件、同じレンズ感、同じ背景で揃える。背景はシンプルな無地か、ぼかしたグレーが扱いやすい。

さらに「識別子」を言語化してメモしておく。髪の分け目、瞳の色、眉の形、ほくろや傷の位置、イヤリングの形、上着の色と素材。これらをテキストで明記しておくと、参照画像から外れた構図を生成するときの指針になる。逆に、識別子が曖昧なまま生成を繰り返すと、カットごとに少しずつ別人へ寄っていく。

マルチイメージ融合という考え方

複数の参照画像から同一人物の特徴を抽出し、新しいポーズや構図に適用する手法は、一貫性維持の基本になる。コツは「矛盾のない参照を混ぜる」ことだ。角度違いの同一人物を混ぜると強い。しかし、髪型が違う、服装の季節が違う、年齢が違う画像を混ぜると、モデルは特徴を平均化してしまい、結果として誰でもない顔が出力される。参照セットは必ず同一セッションで揃える。

また、参照画像の解像度とアスペクト比も揃える。縦長と横長が混在すると、構図指定がぶれる原因になる。参照の枚数を増やしすぎると処理が重くなり、かえって特徴が薄まることもある。まず5枚で試し、不足を感じた特徴だけを追加するのが実践的だ。

動画融合とモーション転写

静止画の参照だけでなく、前のカットの動画を参照として使う方法も有効だ。直前のカットと同じ人物、同じ衣装、同じ光で次のカットを生成すれば、シリーズ全体の印象がそろう。さらに、動きの参照(モーション転写)を組み合わせると、歩行、振り向き、手を振るといった動作の癖まで引き継げる。

実務では、次の順序で固定していく。まずシードを固定して同じ人物の顔を安定させる。次に参照画像を追加して角度の再現性を上げる。最後にモーション参照で動きの癖を揃える。一度にすべてを変えると、どの要素が効いたのか分からなくなる。

破綻しやすいシーンと回避策

経験上、崩れやすいのは次の場面だ。手や指のアップ、横顔や後ろ姿、走る・跳ぶなどの高速移動、複数人の会話、鏡や窓への映り込み、飲食物を口に運ぶ動作、暗い室内。これらは「避ける」か「分解する」かのどちらかで対処する。手の動きが重要なら、手だけを別カットで撮り、編集でつなぐ。複数人の会話なら、1人ずつ別々に生成し、切り返しで構成する。鏡の映り込みは、映り込みが写らないアングルに変更する。

ショット設計とプロンプトの書き方

生成の品質は、プロンプトの情報設計で大きく変わる。ただし長ければよいわけではない。要素を整理して並べることが重要だ。

プロンプトの基本構造

実務で使いやすいのは、次の順序で要素を並べる形だ。被写体(誰が)、動作(何をする)、環境(どこで)、カメラ(どう撮るか)、光(どう照らすか)、スタイル(どんな質感か)、制約(避けたい要素)。日本語で考えてから英語に直すと、要素の抜けに気づきやすい。

たとえば「30代の女性が白いシャツを着て、朝の窓辺でコーヒーカップを持つ。ミディアムショット、ゆっくりしたプッシュイン、柔らかい逆光、浅い被写界深度、自然な肌の質感、手の指は5本、カメラは固定に近い動き」といった具合だ。カメラの指示を具体的にするほど、意図しない大げさな動きを抑えられる。

用途別の実例

会話シーンでは、上半身のミディアムショット、わずかな首の動き、まばたき、口の動きが重要になる。動きを大きくしすぎると口元が崩れるため、体の移動は最小限にする。アクションでは、1カットに1動作だけを入れ、開始と終了を明確にする。商品紹介では、ゆっくりした回り込みと、反射や質感の描写を優先する。風景のBロールでは、パン、ズーム、ドリーを一つだけ選び、速度を指定する。

ネガティブ指定と制御

避けたい要素は明示する。文字の崩れ、余分な指、急激なカメラ移動、過度な彩度、顔の歪み、余計な人物の出現。これらを制約として書いておくと、失敗の種類が減る。ただし、否定形ばかりを並べると全体の指示が弱くなるので、最後にまとめて数点に絞るのがよい。

音声・リップシンク・音響の統合

映像が整っても、音が弱いと完成度は大きく下がる。逆に、音が整っていれば映像の粗が目立ちにくくなる。

音声合成の選び方

ナレーション用の音声は、抑揚の自然さ、間の取り方、固有名詞の読み、話速の調整幅で選ぶ。同じ原稿を複数の音声で試し、30秒だけ聴き比べるのが最短の判断方法だ。シリーズものでは、一度決めた声を固定し、設定を記録しておく。

リップシンク精度を上げるコツ

精度を左右するのは、映像側の条件である。顔が小さすぎると口の動きが判別できず、横を向くと口元が見えなくなる。顔は画面の高さの3分の1程度、正面から15度以内の角度が扱いやすい。また、セリフの間に十分な間を入れると、口の動きが破綻しにくい。早口のセリフは分割し、カットを切り替える。

音響設計

BGMは映像のテンポを決める。カット割りが速いのに遅い曲を合わせると、不自然な間が生まれる。逆に、静かな映像に弱い環境音を足すと、生成映像のノイズが隠れる効果もある。環境音、足音、衣擦れ、効果音を薄く重ねると、AI生成特有の「無音の不自然さ」が消える。

よくある失敗と対処法

失敗は原因を切り分けられれば怖くない。代表的なパターンと対処を整理する。

  • 顔がカットごとに変わる:参照画像の矛盾、識別子の不足、シードの未固定が原因。参照を同一人物・同一照明で揃え、シードを固定する。
  • 手や指が崩れる:手のアップを避け、必要なら手だけ別カットで生成して編集でつなぐ。
  • カメラが勝手に大きく動く:プロンプトに動きの指定が複数入っている。カメラ指示を一つに絞り、速度を明記する。
  • 文字やロゴが崩れる:生成で文字を描かせず、編集でテキストを載せる。
  • 画面がちらつく:フレーム間の一貫性が弱い。解像度やフレームレートの設定を見直し、必要ならアップスケールと軽いグレインでなじませる。
  • 全体的にのっぺりする:ライティングの指定が弱い。光源の方向、硬さ、色温度を明示する。
  • 動きが速すぎる:動作の開始と終了を文章で区切り、尺を長めに取る。
  • 色味がカットごとに違う:ルック開発をやり直し、スタイル記述を全カットでコピーする。

品質管理チェックリスト

属人的な確認を減らすには、チェックリストを工程ごとに分けるのが効果的だ。

生成前

参照画像は同一人物・同一照明か。識別子はテキストで明記したか。プロンプトの要素は7項目そろっているか。カメラ指示は一つに絞ったか。アスペクト比と解像度は案件の仕様と一致しているか。テストカットで通した設定をテンプレート化したか。

生成後

顔が前後カットで一致しているか。手指、耳、首のラインに破綻はないか。背景の小物が勝手に増減していないか。動きの速度は意図と合っているか。色味は他のカットとそろっているか。

納品前

音声とリップシンクのずれは許容範囲か。カット間の音量差はないか。テロップの位置と安全領域は守られているか。書き出し設定は納品先の指定と一致しているか。プロジェクトファイルと参照素材を保管したか。

チーム制作とスケールの考え方

1本の動画なら個人でも回せるが、シリーズ化すると管理が課題になる。

命名規則とアセット管理

ファイル名には、案件、エピソード、シーン、カット、バージョンを含める。参照画像、プロンプト、生成設定、音声、書き出しを同じ階層にまとめる。プロンプトはテキストファイルで保存し、どのカットにどの設定を使ったかを記録する。これを怠ると、後から同じルックを再現できなくなる。

レビュー工程の分け方

レビューは「脚本」「ルック」「生成カット」「音声」「最終」の5段階に分ける。各段階で承認を得てから次へ進む。とくにルック段階での承認は重要で、ここを飛ばすと生成後の修正が高くつく。

予算と試行回数の管理

AI動画は、試行回数がそのまま作業時間になる。カットごとに試行の上限を決めておく。たとえば1カットあたり5回までとし、それを超えたらプロンプトか参照を見直す。上限を決めずに回し続けると、品質は上がらず時間だけが消える。計算資源や処理時間の予算も、カット数から逆算して先に見積もっておくと計画が崩れにくい。

よくある質問

AI動画だけで完結した作品は作れるのか

短尺のSNS動画やコンセプト映像なら可能だが、実務ではハイブリッドが現実的だ。AIで背景やBロールを作り、実写やモーショングラフィックス、テキストを編集で組み合わせる。すべてをAIで生成しようとすると、破綻の修正に時間がかかる。

キャラクターの一貫性はどの程度まで保てるのか

参照設計を丁寧に行えば、同一人物として認識できるレベルは十分に保てる。ただし、極端な表情変化や激しい動き、別人との並びでは揺らぐ。重要なカットは短く切り、正面寄りのアングルを選ぶのが安全だ。

生成が思い通りにならないときは何を疑うべきか

まず参照画像、次にプロンプトの要素の重複、最後にモデルの得意分野を疑う。多くの場合、原因は参照の矛盾か、指示の詰め込みすぎである。要素を一つずつ削って再生成すると、原因が特定しやすい。

商用利用で気をつける点は

利用条件の確認が最優先である。学習データの扱い、生成物の権利、透かしの有無、既存の商標や著名人に似ていないかの確認。加えて、実在の人物に似た出力は避ける設計にしておく。

音声と映像はどちらを先に作るべきか

音声を先に作ることを勧める。セリフの長さがカットの尺を決めるため、映像を先に作ると尺が合わず、編集で無理が生じる。

学習や独自モデルの活用は必要か

特定の画風や自社キャラクターを大量に作る場合は有効だが、汎用モデルと参照設計の組み合わせで足りる場面も多い。まず汎用モデルで限界を確認し、それでも再現できない特徴があるときに検討するのが順序として合理的だ。

生成速度はどこまで気にするべきか

反復回数に直結するため、品質と同じくらい重要である。1カットを5回作り直す前提なら、1回の生成時間が半分になれば作業時間もほぼ半分になる。テスト段階では高速な設定を使い、最終カットだけ高品質設定に切り替える運用が現実的だ。

どこから学び始めればよいか

企画、参照画像の設計、ショット設計、音声、編集という工程の流れを一通り体験することが最短の近道である。1本の短い作品を完成させると、どの工程が自分のボトルネックなのかが見える。そこから必要な技術だけを深掘りすればよい。

まとめ:工程を制する者がAI動画を制する

AI動画生成の品質は、モデルの性能だけでは決まらない。工程を分解し、参照を設計し、ショットを言語化し、失敗を切り分ける。この地味な積み重ねが、安定した出力を生む。ツールは今後も入れ替わるが、ワークフローの考え方は残る。まずは短い1本を作り、6つの工程を一通り回してみてほしい。その経験が、次の作品の品質と速度を確実に引き上げる。

Alexander

Alexander