AI動画合成の現在地:単発ショットの品質と作品全体の品質は別問題
生成モデルの性能は急速に向上し、テキストから数秒のリアルな映像を作ることも、一枚の写真を自然に動かすことも、特別な機材なしでできるようになりました。しかし制作の現場で評価されるのは、1カットの派手さではなく、複数カットをつないだときの説得力です。主人公の髪型が次のカットで変わる、室内の照明が青から橙へ飛ぶ、手に持っていた小物の位置が入れ替わる。こうした乱れは、単発の生成品質がどれほど高くても簡単には隠せません。
つまり現在のボトルネックは「生成できるかどうか」から「意図どおりに制御できるかどうか」へ移っています。制御すべき対象は大きく4つあります。第一にキャラクターとスタイルの一貫性。第二にカメラワークと構図。第三に尺とリズム。第四に再現性、すなわち同じ結果をもう一度作れるかどうかです。
さらに見落とされがちなのが、生成の外側にある工程です。音声、字幕、編集、書き出し設定。これらが雑だと、生成そのものが良くても最終的な作品の印象は大きく落ちます。逆に言えば、生成モデルの差が小さくなった今、差がつくのは前工程の設計と後工程の作り込みです。
この記事では特定のサービスに依存しない形で、AI動画合成の実務ワークフローを整理します。モデルの選び方、プロンプトの設計、ショット分割、失敗の切り分け、レビュー体制まで、明日から手を動かせる粒度でまとめます。
ワークフロー全体像:企画から書き出しまでの7工程
最初に全体像を押さえておくと、どこで何が壊れるのかが見えやすくなります。AI動画制作は、次の7工程に分けると整理しやすくなります。
| 工程 | 主な作業 | 成果物 | つまずきやすい点 |
|---|---|---|---|
| 1. 目的と尺の決定 | 用途、公開先、想定視聴時間の確定 | 企画メモ | 尺を後から伸ばそうとして破綻する |
| 2. 脚本とショットリスト | 構成、ナレーション、カット割り | ショットリスト表 | カットが細かすぎて工数が膨らむ |
| 3. 参照素材の準備 | キャラクター設定、スタイル画像 | 参照画像セット | 参照が曖昧で毎回キャラが変わる |
| 4. キーフレーム生成 | 静止画で構図を固める | 各カットの基準フレーム | 構図を動画生成で直そうとする |
| 5. ショット化 | 画像から動画、またはテキストから動画 | 各カットのクリップ | 尺と動きの量が噛み合わない |
| 6. 音声と字幕 | ナレーション、環境音、テロップ | 音声トラック、字幕データ | 音声を後回しにして尺が崩れる |
| 7. 編集と書き出し | つなぎ、色調整、出力設定 | 最終ファイル | ビットレート不足で劣化する |
工程1と2で決めておくべきこと
目的が決まっていないと、あとから尺を伸ばす判断ができません。SNSの短尺フィード向けなのか、商品紹介の埋め込みなのか、研修用の解説なのかで、必要なカット数も1カットの長さも変わります。短尺であれば1カット2〜4秒のテンポが基本になり、解説型であれば1カット5〜8秒で情報を読み取る余白が必要です。
ショットリストは表形式で作り、各カットに「役割」「尺」「カメラ」「セリフまたはナレーション」の4項目を必ず書きます。役割が書かれていないカットは、編集時に残す理由が見つからず削られがちです。
工程3と4で失敗の8割が決まる
参照素材の準備は地味ですが、ここが最も効きます。キャラクターの正面、斜め45度、横顔の3枚を用意するだけで、別カットでの顔の再現性は体感で大きく変わります。スタイルについても、色温度、レンズの印象、粒子感の3点を言葉にして固定しておくと、モデルを切り替えてもトーンが揃います。
キーフレームを静止画で作り込むのは、修正コストを下げるためです。動画を何度も再生成するより、静止画を3〜4回作り直すほうがはるかに速く、意図も伝わります。構図の調整を動画生成側で行おうとすると、動きの再現性と構図の再現性を同時に狙うことになり、難易度が跳ね上がります。
一貫性を守る:キャラクター・スタイル・小物の管理
一貫性は才能ではなく設計で担保します。もっとも確実なのは、参照画像を固定し、それを毎回の生成に必ず渡す運用です。加えて、テキスト側でも同じ修飾語を繰り返す必要があります。
キャラクターシートの作り方
キャラクターシートには次の情報を含めます。年齢感、体型、髪型と髪色、瞳の色、肌のトーン、服装、アクセサリー、表情の傾向。これを文章として20〜40字程度に圧縮し、すべてのカットのプロンプトに同じ表現で貼ります。表現を毎回言い換えると、モデルは別の人物として解釈し始めます。
たとえば「30代前半の男性、短い黒髪、薄い無精ひげ、濃紺のシャツ、細身のシルバーフレーム眼鏡」という固定文を作り、これを全カットの冒頭に置きます。カットごとに変えるのは場所、行動、カメラだけです。
スタイル固定の3点セット
スタイルは、色温度、光の方向、質感の3点で固定します。「暖色寄りの5000K前後、逆光気味の柔らかい光源、35mmフィルム風の細かい粒子」のように書きます。この3点を別カットでも変えないことで、視聴者は同じ世界の話だと無意識に理解します。
逆に、色温度と光の方向を毎カット変えると、どれだけ映像がきれいでもチグハグな印象になります。雰囲気を変えたい場合は、シーン単位でセットごと切り替えるのが原則です。
小物と衣装の連続性
見落としやすいのが小物です。手に持つコップ、机の上の資料、壁のポスター。これらは生成のたびに形が変わりやすい要素です。対策は単純で、小物が映るカットでは小物の位置と形状をプロンプトに明記し、可能なら参照画像にも含めます。
衣装の連続性については、シーン内で着替える展開を避けるのが最も安全です。どうしても必要な場合は、着替えのカットを明示的な切り替え点として作り、視聴者に変化を認識させます。
カメラ制御とショット設計:映画的な語彙を数値に翻訳する
カメラワークは、AI動画合成でもっとも差が出る領域です。抽象語のまま指示すると、モデルは勝手に解釈します。「シネマティックに」と書けば勝手に動きが足され、「躍動感を」と書けば被写体が不自然に跳ねます。重要なのは、用語を具体的な動きと量に翻訳することです。
翻訳の基本ルール
「ゆっくりとしたドリーイン」は、被写体に近づく動きとして解釈されます。このとき、動きの速さを言葉で補います。「5秒かけて被写体に寄る」「移動距離は小さく、終始一定速度」。速度と距離、時間の3点をセットで書くと、意図した動きに寄ります。
「手持ち風」は、揺れの強さを指定しないと過剰になります。「肩持ちの軽い揺れ、振幅は小さく、呼吸程度」のように、揺れの種類と大きさを分けて書きます。
カメラワーク別の指示例
| カメラ | 意図 | 指示の書き方の例 |
|---|---|---|
| ドリーイン | 感情の高まり | 一定速度で被写体へ近づく、5秒で胸上まで |
| ドリーアウト | 状況の提示 | 被写体から静かに離れ、周囲の空間を見せる |
| パン | 情報の追加 | 左から右へ水平移動、速度は一定、最後に静止 |
| オービット | 立体感の演出 | 被写体を中心に半周、高さは一定 |
| クレーン | 規模感の提示 | 低位置から見上げへ上昇、空を背景に |
| 固定 | 台詞の集中 | カメラは固定、被写体の動きと表情のみ |
台詞やナレーションがあるカットでは、あえて固定カメラを選ぶのが有効です。カメラが動くと視線が散り、情報が入りにくくなります。
構図を先に決めるか、動きを先に決めるか
結論から言えば、構図を先に決めます。構図は静止画で確認でき、修正も速いからです。構図を固めたうえで、その構図を壊さない範囲の動きを足します。逆順にすると、動きに合わせて構図が崩れ、カットの役割が曖昧になります。
モデル選びの判断基準:単一モデル運用か、複数モデルの使い分けか
生成モデルは用途ごとに得意分野が異なります。写実的な人物、アニメ調のスタイル、商品の質感表現、文字の描写。すべてを1つのモデルで賄おうとすると、どこかで妥協が生まれます。
用途別に切り替える判断軸
判断軸は4つです。第一に、被写体が人物か物か。第二に、写実か様式化か。第三に、動きの量が多いか少ないか。第四に、尺が長いか短いか。この4軸で整理すると、どの工程でどのモデルを使うかが決まります。
人物のクローズアップで表情を丁寧に見せたい場面と、風景のパンで空間を広く見せたい場面では、求められる特性が違います。前者は顔の安定性、後者はフレーム全体の破綻の少なさが重要です。
単一モデル運用の利点と限界
単一モデルで通す最大の利点は、トーンが自然に揃うことです。色味や質感のクセが共通になるため、編集での色合わせが最小限で済みます。短尺の広告や、シリーズの1エピソードなど、尺が短くカット数が少ない案件ではこれが最適解になることが多いです。
限界は、特定の表現でどうしても破綻が出ることです。手の描写、激しい動き、文字の表示。これらが必要になった時点で、部分的な切り替えを検討します。
複数モデル運用の設計
複数モデルを混ぜる場合は、混ぜる単位を決めます。おすすめはカット単位ではなくシーン単位です。同じ場所、同じ時間帯のカットは同じモデルで作り、シーンが変わるときにモデルを切り替えます。カット単位で混ぜると、同じシーン内で質感が揺れ、視聴者に違和感を与えます。
また、料金体系はサービスごとに異なります。定額制、従量制、無料枠の有無。制作コストを見積もる際は、生成回数だけでなく再生成の回数も見込んでおきます。実際の現場では、採用したクリップの3〜5倍の生成が発生するのが普通です。
無料枠を検証に使う
新しいモデルを試すときは、無料枠や低解像度の設定で検証し、採用が決まってから高品質設定で本番生成する流れが効率的です。検証段階では解像度より、動きの破綻と一貫性のほうが重要です。
長尺化のための分割生成とつなぎ方
現在のモデルは、一度に生成できる尺に制限があります。長尺の映像は必然的に分割生成になり、つなぎの設計が品質を左右します。
ショット分割の原則
分割は「動きの切れ目」で行います。被写体の動作が完結した瞬間、視線が変わった瞬間、話者が切り替わった瞬間。これらのタイミングで切ると、視聴者は切れ目を認識しません。逆に、動作の途中で切ると、次カットの開始位置がずれて不自然な跳びが生まれます。
目安として、1カットは3〜6秒に収めます。これより長いと、モデルが尺を埋めようとして不自然な動きを生成しやすくなります。
前フレームを参照する連鎖生成
連続性を高める最も実用的な方法は、前カットの最終フレームを次カットの開始画像として使う連鎖生成です。これを繰り返すと、見た目の連続性が大幅に向上します。ただし、連鎖が長くなると画質が徐々に劣化し、色もずれていきます。5〜8カットごとに、元の参照画像に戻してリセットするのが安全です。
つなぎの技術
生成したクリップをつなぐ際、派手なトランジションは避けます。ディゾルブやワイプは、時間経過や場所の移動を示す意図があるときだけ使います。それ以外はカットつなぎが基本です。
アクションつなぎと音つなぎを使うと、切れ目が自然に隠れます。前カットの動作の勢いを次カットの冒頭に重ねる、前カットの音を次カットの冒頭に少し残す。この2つは編集ソフトで簡単に実装でき、効果が大きい手法です。
音声・字幕・編集:映像生成の外側にある工程
完成度の差は、生成の外側で生まれます。音声と字幕を後回しにすると、尺が崩れ、編集で無理な調整が必要になります。
ナレーションとリップシンク
ナレーション原稿は、映像の尺に合わせて先に確定します。目安は1分あたり300〜350字です。これを超えると早口になり、聞き取りづらくなります。
人物が話すカットでは、リップシンクの精度が目立ちます。対策は、口元が大きく映らない構図を選ぶことです。顎から上を少し外す、横顔にする、手前の要素で口元を隠す。これだけで違和感は大きく減ります。
字幕とテロップ
字幕は自動生成を使いつつ、必ず人手で修正します。固有名詞、専門用語、数字は誤変換が起きやすい箇所です。1行あたりの文字数は全角15〜20字程度、表示時間は最低1.5秒を確保します。
テロップのデザインは、映像のトーンと合わせます。色数を増やすと安っぽく見えるため、基本は2色までに抑えるのが無難です。
音設計
環境音、効果音、音楽の3層で考えます。環境音は空間の広がりを作り、効果音は動作を強調し、音楽は感情の流れを導きます。AIで生成した映像は、動きがやや滑らかすぎて現実感を欠くことがあります。そこに環境音を重ねると、途端に説得力が増します。
失敗パターンとトラブルシューティング
顔が崩れる、別人になる
原因は参照が弱いことです。対策は参照画像の追加、キャラクター固定文の統一、カット尺の短縮。動きの量を減らすだけでも改善することが多く、まず試す価値があります。
手や指が崩れる
対策は構図で逃げることです。手を画面外に出す、手前に物を置く、被写体を小さく写す。生成モデルの改善を待つより、回避設計のほうが現実的です。
動きがループする、止まらない
短い尺に動きを詰め込みすぎたときに起きます。プロンプトから動きの指示を減らし、カメラは固定に近づけます。動きが1つだけのカットは、意外なほど安定します。
色が飛ぶ、明るさが揺れる
ショット間の露出差が原因です。生成時点で色温度と露出を数値で指定し、編集で揃える前提を持ちます。編集では自動補正に頼らず、各カットの基準フレームを並べて手動で合わせます。
指示した構図にならない
テキストの指示が多すぎることが原因です。要素を5つ以下に絞り、優先順位を明記します。「最重要は構図、次に光、動作は最小限」といった書き方が有効です。
画質が途中で劣化する
連鎖生成の繰り返しが原因です。前述のとおり、定期的に参照をリセットします。また、生成時の解像度は最終出力より一段高く設定し、編集で縮小して仕上げると劣化が目立ちにくくなります。
品質管理チェックリストとレビュー体制
最後に、公開前のチェックリストを用意します。感覚ではなく項目で確認することが、安定した品質につながります。
- キャラクターの外見が全カットで一致しているか
- 衣装と小物の位置が前後で矛盾していないか
- 色温度と光の方向がシーン内で揃っているか
- 1カットの尺が長すぎないか、動きが過剰でないか
- カメラの動きに意図があり、視線を誘導できているか
- 音声の尺と映像の尺が一致しているか
- 字幕の誤変換、表示時間、改行位置は適切か
- 冒頭3秒で内容が伝わるか
- 書き出し設定が公開先の推奨に合っているか
レビューは3段階で行います。第一段階はキーフレームの承認。ここで構図とキャラクターを確定させます。第二段階はショット単位の承認。動きと尺を確認します。第三段階は通しでの確認。テンポと音のバランスを見ます。
各段階で修正可能な範囲が変わるため、順番を飛ばすと後戻りが大きくなります。特にキーフレームの承認を飛ばすと、動画生成後の修正が難しくなります。
バージョン管理も欠かせません。カット番号、生成日、使用モデル、プロンプトの要点を一覧で記録しておくと、後から差し戻したときに同じ状態を再現できます。
よくある質問
生成モデルは1つに絞るべきですか
尺が短くカット数が少ない案件では、単一モデルのほうがトーンが揃い、管理も簡単です。カット数が増え、表現の幅が必要になった時点でシーン単位の切り替えを検討します。
一貫性を最も効率よく上げる方法は何ですか
参照画像を固定し、キャラクター固定文を全カットで同一にすることです。この2つを徹底するだけで、体感の品質は大きく変わります。
長尺の映像はどこから作ればよいですか
短尺の1シーンから始めます。3〜5カットの連続したシーンを作り、つなぎの感覚を掴んでから尺を伸ばします。最初から数分の作品を狙うと、問題の切り分けが難しくなります。
プロンプトは長いほうが良いですか
いいえ。要素を絞り、優先順位を明記するほうが意図に近づきます。長文は指示の衝突を生み、結果が不安定になります。
音声はAIで作れますか
作れます。ただし固有名詞の読みと抑揚は要確認です。原稿の段階で読み方を指定し、生成後に必ず聞き直します。
商用利用で注意すべき点はありますか
サービスごとに利用条件と生成物の扱いが異なります。案件で使う前に、利用規約と権利の記載を必ず確認し、必要に応じて記録を残します。
どのくらいの生成回数を見込むべきですか
採用するクリップの3〜5倍を目安にします。凝ったカットや動きの多いカットでは、さらに増えることを前提に計画します。
編集ソフトは何を選べばよいですか
カットつなぎ、音の同期、字幕の扱いがしやすいものを選びます。AI生成クリップは可変フレームレートで出力されることがあるため、書き出し時にフレームレートを固定できるかも確認します。
まとめ:制御の設計が作品の質を決める
AI動画合成の技術は、もはや一部の専門家だけのものではありません。しかし、誰でも生成できる時代になったからこそ、差がつくのは設計力です。参照素材を固め、キャラクター固定文を統一し、カメラの動きを数値で指示し、ショットを動きの切れ目で分割する。当たり前に見えるこれらの手順が、完成度を大きく左右します。
まずは3カットの短いシーンを1本作り、チェックリストで検証してみてください。その小さな成功体験が、長尺の作品へ進むための最も確実な足がかりになります。



