生成AI動画は「単一モデル」から「ワークフロー設計」の時代へ
生成AI動画の議論は、数か月ごとに「どのモデルが最も優れているか」というランキング形式に収束しがちです。しかし、実際に商用案件を継続して回している制作現場では、問いの立て方そのものが変わっています。重要なのは「最強のモデルはどれか」ではなく、「限られた素材・人員・納期の中で、破綻の少ないカットを安定して量産するには、どの工程をどう組み合わせるか」という設計の問題です。
ひとつのモデルだけに制作工程を依存させると、次のような壁にぶつかります。第一に一貫性。同じ人物を別カットで登場させようとすると、顔立ち・髪型・衣装・肌の質感・照明の向きが微妙にずれ、視聴者に「別人に見える」という違和感を与えます。第二に制御性。カメラワークや尺、アスペクト比、被写体の位置を細かく指定しても、出力が指示どおりにならないことがあります。第三に予測不能性。納得のいくカットが出るまで再生成を繰り返すと、工数見積もりが崩れ、スケジュールが押します。
プロの現場が取っている現実的な解は、役割分担です。絵コンテ検討のような試行錯誤の段階では高速で軽いモデル、決定稿のディテールには質感描写に強いモデル、キャラクターの同一性が求められるカットには参照画像の扱いに長けたモデル、というように、ひとつの作品の中で複数のモデルを意図的に併用します。
制作の成否を分けるのは「モデル選び」より「工程設計」
同じモデルを使っていても、成果物の安定度には大きな差が出ます。その差を生むのは、プロンプトの書き方そのものよりも前段の設計です。具体的には、参照素材をどの時点で用意するか、カットごとの可変要素をどこまで許容するか、どのタイミングで人間の目による選別を挟むか、という工程の組み立てです。
工程設計が甘いまま生成を始めると、後戻りが効きません。たとえば衣装のディテールを後から変更すると、すでに生成済みのカットとの整合が取れなくなり、実質的に全カットの再生成が必要になります。逆に、先に「変更してよい要素」と「絶対に固定する要素」を切り分けておけば、修正は局所的に収まります。
この記事で扱う範囲
ここからは、プリプロの設計項目、モデル選定の判断基準、一貫性を保つ実践テクニック、プロンプト設計、カメラワーク制御、編集までのパイプライン、よくある失敗の対処、用途別のワークフロー、そしてFAQという順番で整理していきます。特定のサービス名を前提にせず、どのツールを使っても応用できる考え方を中心に構成しています。
プリプロで決めるべき7つの項目
生成を始める前に決めておくべき項目は、実はそれほど多くありません。しかし、これを飛ばすと後工程で必ず跳ね返ってきます。
1. 総尺とカット割り
最終的な尺から逆算して、1カットあたりの秒数を決めます。生成AI動画は1回の出力が数秒単位であることが多く、長回しを狙うと破綻のリスクが跳ね上がります。3〜5秒のカットを積み上げる前提で設計し、どうしても長尺が必要な場合は、同一アングルで複数回生成して自然な箇所をつなぐ方針を先に決めておきます。
2. 一貫性の基準をどこに置くか
「顔が同じであればよい」のか、「衣装と小物まで同一である必要がある」のかで、必要な作業量は数倍変わります。ナラティブ作品では衣装の連続性が重要になりますが、商品紹介や解説動画では背景と照明の統一のほうが優先度が高くなります。ここを曖昧にしたまま進めると、後半で基準がぶれます。
3. アスペクト比と画角
縦型(9:16)、横型(16:9)、正方形(1:1)のどれを主軸にするかを決めます。同じ素材を複数の比率に展開する場合は、最初から被写体を中央寄りに配置し、周囲に余白を残す構図で生成しておくと、後からのトリミングが楽になります。
4. 参照素材の準備
キャラクターの設定画、衣装の参考写真、ロケ地のイメージ、ライティングの参考フレームなどを、生成前の段階でフォルダに揃えます。参照素材の質は出力の質に直結します。曖昧な参考画像を1枚だけ渡すより、正面・斜め・横の3方向を揃えたほうが、同一性は明確に向上します。
5. 音声の扱い
セリフやナレーションを生成するのか、後から人間が収録するのか、あるいは字幕のみで構成するのかを決めます。口の動きと音声を同期させる場合、リップシンクの処理工程が加わるため、カットの尺に余裕を持たせる必要があります。
6. 納品仕様と権利の確認
解像度、フレームレート、ビットレート、色空間といった技術仕様に加え、生成物の利用範囲、素材の取り扱い、出演者や商標に関する確認事項を整理しておきます。特に商用利用では、生成に使った参照素材の権利関係を明確にしておくことが后々のリスクを下げます。
7. 試行回数の上限
最も実務的で、最も見落とされる項目です。「1カットにつき何回まで再生成してよいか」を先に決めます。上限を決めずに進めると、1カットに半日を費やし、全体が破綻します。目安として、ラフ段階で5〜8回、決定稿で15〜20回と設定し、上限に達したらプロンプトの構造そのものを見直す、という運用が現実的です。
モデル選定の判断基準
ツールは日々入れ替わりますが、選定の判断軸はそれほど変わりません。以下は、Sora、PixVerse、Runway、Kling、Luma、Pika といった代表的なサービスを比較する際にも使える普遍的な基準です。
リアリズムと質感の再現度
実写調の映像を狙うなら、肌の質感、反射、髪の毛の一本単位の描写、そして何より「光の物理的な正しさ」を確認します。逆光や窓明かりのような複雑な光源を指定したときに、影の落ち方が破綻しないかをテストします。人物の顔がアップになるカットは、最も破綻が出やすい検証ポイントです。
アニメ・イラスト調の安定性
アニメ調やイラスト調の表現では、線の太さや塗りの一貫性が重要になります。カットごとに線のニュアンスが変わると、別の作品のように見えてしまいます。また、動きの激しいシーンでキャラクターの輪郭が崩れないかも確認します。
モーション量と物理挙動
生成AI動画の弱点は、激しい動きと物理挙動です。走る、跳ぶ、物を投げる、液体が跳ねる、といったシーンで、関節の位置や物体の軌道が不自然にならないかを検証します。モーション量を抑えた「静かな演技」のほうが、一般的に品質が安定します。
尺・解像度・アスペクト比の対応
1回の生成で得られる尺、対応する解像度、縦横比の柔軟さはツールごとに異なります。長尺が必要な案件では、延長機能や継ぎ目の自然さが選定の決め手になります。縦型中心の案件では、縦型出力の品質が横型と同等かを必ず確認します。
比較軸は「料金」ではなく「1カットあたりの試行回数」
コストの比較は単価だけでは意味を持ちません。同じ品質に到達するまでに必要な試行回数がツールによって異なるため、実際のコストは「単価 × 試行回数 × カット数」で決まります。単価が低くても20回試行が必要なツールより、単価が高くても5回で決まるツールのほうが、最終的な負担は小さくなることが珍しくありません。
併用パターンの基本形
実務で使いやすい組み合わせは、次の3層構造です。
- 構図と動きの検証用に、高速で安価なモデルでラフを大量生成する。
- 採用カットに対して、ディテールに強いモデルで本番生成を行う。
- キャラクターの同一性が必要なカットだけ、参照画像制御に強いモデルへ回す。
この分業により、品質を落とさずに試行回数を最適化できます。
キャラクターとシーンの一貫性を保つ実践テクニック
一貫性は「なんとなく似ている」では担保できません。仕組みとして設計する必要があります。
キャラクターシートを作る
まず、人物ごとに1枚のキャラクターシートを用意します。含めるべき情報は、正面・斜め45度・横顔の3方向の顔、全身のシルエット、衣装のディテール(素材、色、柄、小物)、髪型と髪色、そして代表的な表情3種です。これを画像としてまとめ、生成時の参照素材として毎回同じものを使います。
参照画像の渡し方と重みの調整
参照画像を複数渡せるモデルでは、「顔は参照A、衣装は参照B、背景は参照C」というように役割を分けて指定します。1枚の画像にすべてを詰め込むと、モデルがどの要素を優先すべきか判断できず、結果が不安定になります。参照の強度を調整できる場合は、顔を最も強く、背景を弱めに設定するのが定石です。
プロンプトの固定部分と可変部分を分離する
キャラクターの記述(年齢感、髪、瞳の色、体型、衣装)は固定ブロックとしてテンプレート化し、カットごとに変えるのはカメラワーク、背景、動き、感情のみにします。この分離を徹底するだけで、カット間の揺らぎが大幅に減ります。
管理表をつくる
カット番号、登場人物、衣装バージョン、時間帯、天候、使用モデル、使用した参照画像、プロンプトのハッシュを一覧表にします。表計算ソフトで十分です。この表があると、後から「この衣装はどのカットで使ったか」を即座に特定でき、修正範囲を最小化できます。
ライティングの統一
意外と見落とされるのが光の連続性です。同じシーン内で、カットAは暖色の夕方、カットBは寒色の昼光になっていると、視聴者は無意識に違和感を覚えます。シーンごとに「光源の方向」「色温度」「コントラスト」の3項目を数値や言葉でメモし、全カットのプロンプトに同じ表現を挿入します。
プロンプト設計:構図・動き・ライティングを分離して書く
長いプロンプトを一度に書くと、どの要素が効いたのか分からなくなります。要素を層に分けて記述するのが、再現性を高める最短ルートです。
5層テンプレート
実務で使いやすい構成は次の5層です。
- 第1層:被写体(誰が/何が)。キャラクター固定ブロックをここに置く。
- 第2層:動作(何をするか)。動詞を具体的に。
- 第3層:環境(どこで)。場所、時間帯、天候、周囲の要素。
- 第4層:カメラ(どう撮るか)。アングル、レンズ感、動き、構図。
- 第5層:光と質感(どう見えるか)。光源、色温度、フィルム感、粒子感。
この順番で書くと、修正したい層だけを差し替えられます。
カメラワークの語彙を揃える
「ゆっくりと近づく」よりも「プッシュイン」のように、業界で共有されている語彙を使うほうが、出力が安定する傾向があります。よく使う語彙は、パン、ティルト、ドリー、トラック、プッシュイン、プルバック、オービット、クレーンアップ、ハンドヘルド、ステディカムです。これらを日本語と英語の両方でメモしておくと、モデルごとの相性に応じて使い分けられます。
動きの指定は「誰が・何を・どう」
動きの指示が曖昧だと、モデルは無難な静止に逃げます。「人物が歩く」ではなく、「人物が右手に傘を持ち、左足から踏み出して画面左手前へ歩き出す」のように、主体・動作・方向・速度を明示します。ただし要素を詰め込みすぎると、かえって破綻します。1カットにつき主要な動きは1つに絞るのが原則です。
ネガティブ指定の実際
避けたい要素の指定は、効くモデルと効かないモデルがあります。一般的に、手の本数、指の融合、余分な手足、文字の混入、ロゴの出現、フレームの乱れなどは指定する価値があります。一方で、抽象的すぎる否定語(「不自然なもの」など)はほとんど効果がありません。具体的な名詞で指定するのがコツです。
カメラワークとシネマティックコントロール
生成AI動画の品質は、被写体の再現度だけでなく「カメラがどう動くか」で大きく印象が変わります。ここは演出の領域であり、同時に技術的な制御の領域でもあります。
レンズ感と被写界深度
「85mm相当の単焦点、絞り開放、背景は軽くボケる」といった指定を加えると、ポートレート的な質感が得られます。逆に全体にピントを合わせたい場合は、広角気味のレンズと深い被写界深度を指定します。ボケを強くしすぎると境界が破綻しやすいため、まず中程度で試すのが安全です。
アングルとハイト
同じ人物でも、目線の高さ、見上げ、見下ろしで印象は大きく変わります。見上げは威厳や緊張、見下ろしは不安や弱さ、目線の高さは中立と親密さを生みます。シーン内でアングルの方向性を統一すると、作品全体に一貫した視点が生まれます。
モーション強度の調整
多くのモデルには、動きの大きさを調整するパラメータがあります。数値を上げると躍動感は増しますが、破綻率も上がります。人物のクローズアップでは低め、風景や抽象的なカットでは高め、というように、被写体の種類に応じて使い分けます。
カット間の視線誘導とイマジナリーライン
隣り合うカットで被写体の画面内位置が大きく飛ぶと、視聴者は混乱します。前のカットで画面右にいた人物は、次のカットでも右側に置く。会話シーンでは2人の間の見えない線(イマジナリーライン)を越えない。この基本を守るだけで、生成物の断片をつないだときの自然さが格段に向上します。
生成から編集までのパイプライン
生成は工程の一部にすぎません。前後の工程を含めて設計します。
ラフ生成と選別
まず低コスト設定で各カットを複数パターン生成し、構図と動きの妥当性だけを評価します。この段階では質感や細部を気にしません。評価基準は「構図が意図どおりか」「動きが成立しているか」「破綻していないか」の3点です。採用率はおおむね2〜3割程度になるため、多めに生成しておきます。
アップスケールとフレーム補間
採用カットに対して、解像度の引き上げとフレームレートの補間を行います。補間は滑らかさを生む一方で、激しい動きでは残像やゴーストを生みます。動きの少ないカットは補間を強め、動きの激しいカットは補間を弱めるか、元のフレームレートを維持するほうが自然です。
編集ソフトへの受け渡し
生成したクリップは、ファイル名にカット番号とバージョンを必ず含めて管理します。編集ソフト側では、まず粗く並べて全体のテンポを確認し、そこから各カットのイン・アウトを詰めます。生成段階で尺に余裕を持たせておくと、編集の自由度が上がります。
音声・BGM・効果音
映像が整ってから音を載せると、テンポの課題に気づきやすくなります。ナレーションは先に仮の読みで構成を確認し、最終的な収録は映像が固まってから行う順序が効率的です。効果音は、カットの切り替わりに小さく入れるだけで知覚的なつながりが改善します。
レビューの回し方
レビューは「合格/不合格」の二値ではなく、修正の種類を分類して伝えます。分類は、構図の修正、動きの修正、質感の修正、色の修正、尺の修正の5種類で十分です。分類が揃うと、どの層のプロンプトを書き換えるべきかが即座に決まります。
よくある失敗と対処法
顔が崩れる
原因は大きく3つあります。参照素材が不足している、解像度が低い、動きが激しすぎる。対処は、参照画像を3方向に増やす、出力解像度を上げる、動きを減らして別カットに分割する、の順に試します。それでも改善しない場合は、顔のアップを避けた構図に変更するのが現実的です。
手指の破綻
指の本数や融合は、現行のモデルでも起こりえます。手を画面の主要素にしない、手前に物を持たせる、手のひらを隠すアングルにする、といった演出側の回避が最も確実です。どうしても手が必要な場合は、短い尺で使い、編集で目立たないタイミングに置きます。
フリッカーとモーフィング
フレーム間で明るさや輪郭が細かくちらつく現象は、生成の一貫性不足から起こります。対処としては、動きの量を減らす、生成尺を短くする、シードを固定して再生成する、といった方法があります。また、テクスチャの細かい背景(砂利、群衆、細い格子)はフリッカーを誘発しやすいため、ぼかすか単純化するのも有効です。
動きが止まる、あるいは過剰になる
動きが止まる場合は、動作の記述が抽象的すぎるか、モーション強度が低すぎます。具体的な動詞と方向、そして強度を少し上げることで改善します。逆に過剰な場合は、動きを1つに絞り、速度の記述(ゆっくり、静かに)を加えます。
色がカットごとに変わる
照明の記述がカットごとに揺れていることが原因です。シーン単位で光源・色温度・コントラストの記述を固定し、全カットのプロンプトに同一の文言をコピーします。編集段階でカラーグレーディングを行い、最終的な統一感を出すのも有効な仕上げです。
解像度とディテール不足
生成時の解像度が低いと、後からアップスケールしても細部は回復しません。重要なカットは最初から高解像度で生成し、ラフは低解像度で割り切る、という使い分けが基本です。
用途別の実践ワークフロー
SNS向け縦型ショート
テンポが最優先です。1カット1.5〜3秒、カット数は8〜15本。3秒以内に最初の変化(動き、カットチェンジ、テキスト出現)を入れる構成にします。字幕は必須前提で、被写体を中央やや上に配置して下部に余白を確保します。
商品紹介
商品の同一性が最重要です。実物の写真を参照素材として使い、ターンテーブル回転、寄り、使用シーンの3種類を基本カットとします。背景は単色かぼかしに統一し、照明は柔らかい拡散光で固定します。
教育・解説
情報の明瞭さが優先です。人物カット、図解カット、実例カットを交互に配置し、1カットを4〜6秒と長めに取ります。動きは最小限にし、静止に近い状態での質感を重視します。
ショートナラティブ
一貫性の難易度が最も高い用途です。キャラクターシートの作成、シーンごとの照明設計、カット管理表の運用を最初から徹底します。尺は3〜5秒、総カット数は30〜60本を目安に、まず1シーンを完成させてから全体に展開します。
よくある質問
複数のモデルを使い分けるのは、かえって非効率では
初期の学習コストはかかりますが、1カットあたりの試行回数が減るため、数本の制作を経験すると逆転します。特にキャラクターの一貫性が求められる案件では差が顕著です。
参照画像は何枚あれば十分か
顔の同一性のみを求めるなら正面1枚でも始められますが、実務的には3方向の顔と全身1枚の計4枚があると安定します。衣装や小物まで固定する場合は、それらを切り出した画像を追加します。
生成したカットをつなぐと不自然になる
原因の多くは、動きの方向と画面内位置の不連続です。前後カットで被写体の進行方向と配置を揃え、切り替え点に効果音を小さく入れると、知覚的な連続性が改善します。
どのくらいの尺を1カットで狙うべきか
3〜5秒が最も安定します。8秒を超えると破綻率が上がるため、長尺が必要な場合は同一アングルで複数生成し、自然な区間をつないで延長します。
動きのあるシーンと静かなシーン、どちらが向いているか
静かな演技のほうが品質は安定します。激しい動きが必要な場合は、カットを細かく分割し、動きのピークを1カット内に1つだけ置く構成にします。
品質が安定しないときの最初の見直し点は
参照素材、プロンプトの層構造、動きの量の3点を順に確認します。多くの場合、この3つのいずれかに原因があります。


