生成AIを使った動画制作は、もはや実験的な遊びではなく、実際の案件で使われる制作手法になりました。テキストプロンプトから数秒のカットを生成し、それを編集でつなぎ合わせる。参照画像からキャラクターの外見を固定し、複数ショットにまたがる短編を作る。かつてはCGスタジオと相応の予算がなければ難しかったことが、個人や数人のチームでも現実的な選択肢になっています。
一方で、ツールが増えたぶんだけ「どう組み合わせるか」が難しくなりました。Soraのように長尺で一貫性の高いシーンを作れるモデル、Klingのように指示追従性と反復速度に優れたモデル、RunwayやLuma、Pikaのように特定の用途に強いモデル。それぞれ得意分野が違い、すべてを1つのモデルで済ませようとすると必ずどこかで破綻します。
この記事では、特定のプラットフォームに依存しない中立な立場で、AI動画制作のワークフローを工程別に整理します。企画の立て方、モデル選定の判断基準、プロンプト設計、ショット設計と一貫性維持、編集と音声、品質管理、チーム運用までを一気通貫で扱います。読み終えたときに、自分の案件へ持ち帰れる「型」が手に入る構成にしました。
AI動画制作の現在地と本記事の狙い
生成AI動画の最大の変化は、制作のボトルネックが「作れるかどうか」から「どう設計するか」に移ったことです。数年前まで、映像を作る敷居は技術と機材と人手でした。いまはプロンプトを1行書けば数秒の映像が出てきます。つまり、価値の源泉が撮影技術から設計能力へ移ったのです。
この変化が意味するのは、動画制作が「職人的な作業」から「設計と編集の仕事」に近づいたということです。カメラマンが構図を決め、照明技師が光を作り、編集者がリズムを整える。その分業の一部がモデルに置き換わり、人間は「何を、どの順番で、どう見せるか」を決める側に回ります。
とはいえ、AI動画はまだ万能ではありません。指の本数が崩れる、文字が溶ける、カメラワークが勝手に変わる、同じ人物のはずが別人になる。こうした制約を知らずに企画を立てると、制作の途中で手戻りが発生します。本記事の狙いは、モデルの限界を前提にしたうえで、破綻しにくい工程を組むことです。
具体的には次の3つをゴールに置きます。第一に、案件の目的から逆算してモデルを選べるようになること。第二に、ショット単位で工程を分解し、どこでAIを使い、どこで人間が手を入れるかを判断できるようになること。第三に、出来上がりのばらつきを抑えるチェックリストを持ち帰ることです。
主要な動画生成モデルの特徴を整理する
モデル選びで失敗する典型的なパターンは、「一番話題になっているものを使う」という決め方です。話題性と、自分の案件との相性は別物です。まずはモデルを機能カテゴリで整理しておきましょう。
テキストから映像を生成するモデル
プロンプトだけで映像を作るタイプです。Soraは複雑な物理挙動や長めのカメラワークを比較的自然に扱える点が強みで、情景の説得力が高い反面、細かい演技の指定は苦手な領域があります。Klingは指示への忠実さと反復のしやすさが特徴で、同じ構図を少しずつ変えながらベストを探る作業に向いています。
このカテゴリは「ゼロから世界を作る」用途に強い一方、登場人物の細部を毎回そろえるのは苦手です。キャラクター主導の物語より、風景・雰囲気・抽象的な映像詩的な表現と相性が良いと言えます。
画像から映像を生成するモデル
1枚のキービジュアルを起点に、数秒の動きを付けるタイプです。構図と人物の外見を画像側で確定できるため、ショット間の一貫性を作りやすいのが最大の利点です。キャラクターが登場する短編、商品紹介、広告のカット割りなど、見た目を管理したい案件ではこちらが主軸になります。
欠点は、元画像に写っていない情報をモデルが補完するため、動きの自由度がテキスト生成より狭いことです。逆に言えば、自由度が低いからこそ制御しやすいとも言えます。
動画から動画へ変換するモデル
既存の映像を入力にして、スタイル変換・フレーム補間・解像度向上・動きの再生成を行うタイプです。実写で撮った素材にアニメ調の質感を載せる、低フレームレートの素材をなめらかにする、ラフな3Dプレビューを高品質な映像に置き換える、といった用途で力を発揮します。
制作フロー全体で見ると、このカテゴリは「仕上げ」の工程に入ります。最初から最後までテキスト生成で作ろうとするより、実写や3Dの下地を用意して後段で変換するほうが、安定した結果を得やすいケースは少なくありません。
モデル選定の判断基準
どのモデルを使うかは、感覚ではなく条件で決めます。判断材料を整理しておくと、チーム内での合意も取りやすくなります。
品質・速度・制御性のトレードオフ
映像生成モデルは、おおむね次の3つの軸で評価できます。
- 品質:解像度、質感、物理挙動の自然さ、時間的な安定性
- 速度:1ショットあたりの生成時間と、やり直しの回転数
- 制御性:プロンプトや参照画像への追従度、構図や動きの指定しやすさ
この3つが同時に最大化されることはほとんどありません。リアルさで選べば反復に時間がかかり、速度で選べば細部の制御が効かない。したがって、案件のどこを優先するかを先に決めておきます。
たとえばSNS向けの短尺広告で、1日に何十パターンも試す必要があるなら速度と制御性を優先します。企業のブランド映像で、数カットを極限まで作り込むなら品質を優先します。この優先順位を決めずに作業を始めると、途中で基準がぶれ、判断が遅れます。
ショット単位でモデルを切り替える
現実的な運用は「1案件1モデル」ではなく「1ショット1モデル」です。全カットを同じモデルで作る必要はありません。
たとえば次のような切り分けが有効です。
| ショットの性質 | 向いているアプローチ |
|---|---|
| 情景・風景・雰囲気カット | テキストからの生成で広く探索 |
| キャラクターの顔が映るカット | 参照画像を固定して画像から生成 |
| 商品のディテール | 実写または3Dを下地に変換処理 |
| 抽象的なトランジション | テキスト生成で偶然性を活かす |
この表の考え方を持つだけで、無駄な試行が大きく減ります。「このカットは誰が主役か」を基準にすると判断しやすくなります。人物の顔が主役なら参照画像、空間が主役ならテキスト、質感が主役なら変換処理、という順番です。
プリプロダクション:企画を撮影可能な粒度まで分解する
AI動画制作でも、準備の重要性は従来の映像制作と変わりません。むしろ、生成のやり直しコストが高いぶん、前工程の精度が結果を大きく左右します。
ログラインから絵コンテへ
最初に決めるのは、尺と目的です。15秒、30秒、90秒では必要なショット数も情報量も変わります。次に、1本の動画を一文で説明するログラインを書きます。「誰が、何を望み、何に妨げられ、どうなるか」の4要素が入っていれば十分です。
ログラインが固まったら、ショットリストに分解します。各ショットには次の情報を必ず書きます。
- ショット番号と尺(秒数)
- 被写体と動作
- カメラワーク(固定、パン、ドリー、手持ち風など)
- 場所と時間帯
- 光の方向と質
- そのショットで伝えたい情報(1つだけ)
「伝えたい情報を1つに絞る」というルールは特に重要です。1つのショットに複数の意図を詰め込むと、プロンプトが長くなり、モデルが何を優先すべきか判断できなくなります。
キャラクター設定シートの作り方
複数ショットに同じ人物を登場させるなら、生成を始める前に設定シートを作ります。含めるべき要素は、正面・斜め・横の3方向の顔、全身のシルエット、代表的な衣装、髪型、年齢感、体型、そして「絶対に変えてはいけない特徴」を3つほど書き出したメモです。
このとき、特徴は具体的な言葉に変換しておきます。「優しそうな人」ではなく「眉が緩やかな弧を描き、目尻が下がっている」。形容詞はモデルに伝わりませんが、形の記述は伝わります。設定シートの粒度が、そのまま一貫性の精度になります。
プロンプト設計:映像モデルに伝わる指示の書き方
プロンプトは呪文ではなく仕様書です。順番と構造を決めておけば、再現性が上がり、チーム内でも共有しやすくなります。
基本構造
映像生成のプロンプトは、次の順番で組み立てると安定します。
- 被写体:誰が、何が、どんな見た目か
- 動作:何をしているか、その速さと方向
- 環境:場所、時間帯、天候、周囲の要素
- カメラ:距離、アングル、動き、レンズ感
- 光:光源の位置、硬さ、色温度
- スタイル:質感、色調、フィルムかデジタルか
日本語で書いても英語で書いても構いませんが、モデルによって得意な言語は異なります。迷ったら英語で書き、日本語で補足する運用が無難です。また、1ショットにつき1つの動作に留めるのが原則です。「歩きながら振り返り、同時に傘を開く」のような複合動作は、途中で破綻しやすくなります。
失敗しやすいプロンプトと改善例
よくある失敗は、抽象語の多用です。
悪い例:「とても美しく、感動的で、映画的な夕暮れの海辺のシーン」
改善例:「夕暮れの砂浜。カメラは低位置で固定。波打ち際をゆっくり歩く女性の後ろ姿。逆光で輪郭に当たるオレンジの光。遠景に水平線。35mmフィルム調、粒子感あり」
後者は判断材料がすべて数値化・具体化されています。美しいかどうかは、視聴者が決めることです。制作者が指定すべきは、形と光と動きです。
もうひとつの失敗は、否定形の多用です。「人物を入れないで」「文字を出さないで」といった指示は、モデルによっては逆効果になります。避けたい要素は、プロンプトから消すか、ポジティブな言い換えにします。「人物を入れない」なら「無人の構図」と書くほうが伝わります。
本生成:ショット設計と一貫性の維持
ここからが実際の生成工程です。最初に断っておくと、全ショットを一度に生成しようとするのは効率が悪い方法です。まず1ショットを完成させ、そこで使った設定をテンプレート化して横展開するのが定石です。
ショットリストと尺の設計
生成AIの映像は、1回あたり数秒が基本単位です。長回しをいきなり作るより、短いカットをつないでテンポを作るほうが現実的です。
目安として、30秒の動画なら8〜12ショット、90秒なら20〜30ショットを想定します。1ショットあたり2〜4秒。テンポを出したい場面では1秒未満のカットを混ぜ、落ち着かせたい場面では5秒以上を1つ入れると、緩急が生まれます。
尺を決めるときに忘れがちなのが、冒頭の3秒です。ここで視聴者が離脱するかどうかが決まります。AI生成ではつい美しい情景カットを冒頭に置きたくなりますが、動きのあるショット、あるいは強い問いかけを置くほうが引きが強くなります。
一貫性を保つ実務テクニック
一貫性は、大きく3つのレベルに分けて考えると整理しやすくなります。
- レベル1:同じ人物が同じに見えるか
- レベル2:同じ空間の照明と色が揃っているか
- レベル3:全体のトーンとリズムが統一されているか
レベル1は最も難しい課題です。有効な手段は、参照画像を固定すること、生成のたびに同じスタイル記述をコピーすること、そして一度採用したカットを「基準カット」として保存し、以降の生成で参照し続けることです。
レベル2は、カットごとに光の方向をメモして揃えることで解決します。屋内の昼、窓は画面左、暖色寄り。この情報をショットリストに書き込み、全カットで同じ表現を使います。
レベル3は編集段階で整えます。カラー調整、テンポ、音の統一によって、多少ばらついた素材でも1本の作品としてまとまります。
なお、どうしても一貫しないカットは、無理に直そうとせず構図を変えてしまいます。顔を映さない後ろ姿にする、手元だけにする、シルエットにする。回避も立派な解決策です。
ポストプロダクション:編集・音声・カラー
生成した素材は、まだ作品ではありません。ここからが仕上げの工程です。
編集のリズム
編集の基本は、動きの方向をつなぐことです。前のカットで右へ動いていたら、次のカットも右方向の動きから入る。これだけで視聴者の視線が自然につながります。逆に方向を急に反転させると、意図的な衝撃を作れますが、乱用すると疲れる映像になります。
カットの長さは、情報量と感情で決めます。新しい情報を見せるときは長めに、感情を積み上げるときは短めに。AI生成素材は1カットが短いため、丁寧につなぐだけでなく、あえて1フレーム差し込む、フラッシュを挟むといった演出が効果的です。
音声とBGM
映像の印象は音で大きく変わります。AI生成のカットは無音なので、環境音を丁寧に重ねるだけで説得力が跳ね上がります。波の音、街の雑踏、室内の空調音。これらをレイヤーとして敷くだけで、映像が「本物」に近づきます。
ナレーションを入れる場合は、まず台本を完成させてから音声を生成します。生成した音声に映像を合わせるほうが、その逆より作業が速いためです。読み上げ速度は1分あたり250〜300字程度が聞き取りやすい目安になります。
BGMは、動画の前半と後半でテンポを変えると効果的です。同じ曲のまま、編集でサビの位置を調整するだけでも印象が変わります。
品質管理:よくある失敗とその対処
生成AI動画で発生する問題は、ある程度パターン化されています。事前にチェックリストを持っておけば、手戻りを大幅に減らせます。
崩れのパターン別対処
- 手や指の崩れ:手が画面の主要素にならない構図に変更する。手前にボケを入れる、速い動きで誤魔化すのも有効です。
- 顔の変質:参照画像を固定し、生成時間を短くし、動きの大きい演技を避けます。
- 文字の溶け:文字が入るカットは生成で作らず、編集ソフトで後から載せます。これは最も確実な解決策です。
- カメラワークの暴走:プロンプトで動きを1つに限定し、「固定」「ゆっくりとしたパン」など明示します。
- 素材間の色ずれ:撮影時ではなく編集時にまとめて補正します。
公開前チェックリスト
納品前には次を確認します。
- 冒頭3秒で内容が伝わるか
- カットの方向性がつながっているか
- 音量がプラットフォームの基準内か
- テロップの可読性と表示時間は十分か
- スマートフォンの小さい画面で確認したか
- 権利処理(素材、音源、肖像)に漏れがないか
最後の項目は特に重要です。AI生成物であっても、参照した画像や音源に権利がある場合は確認が必要です。
チーム制作とアセット管理
複数人でAI動画を作る場合、個人作業とは別の工夫が要ります。もっとも効果が大きいのは、命名規則とディレクトリ構造を最初に固定することです。
推奨する構成は次のとおりです。
- 01_script:台本、ログライン、企画メモ
- 02_board:絵コンテ、ショットリスト
- 03_refs:参照画像、キャラクター設定
- 04_prompts:ショット別プロンプト(テキストファイル)
- 05_generations:生成素材(ショット番号_版数)
- 06_editing:編集プロジェクト、音声素材
- 07_deliver:書き出し、確認用
プロンプトは必ずテキストファイルとして保存します。生成結果だけ残しても、同じ条件を再現できません。プロンプトと素材をペアで保存する習慣が、後工程での修正を容易にします。
また、レビューは「全部できてから」ではなく、ショット単位で行います。1ショット目で方向性を承認してから量産に入ると、終盤のやり直しが激減します。承認者を1名に決めておくことも、判断のぶれを防ぐうえで有効です。
ワークフローを最適化する考え方
制作を進めるうちに、ボトルネックは必ず移動します。最初はアイデア出し、次に生成、そして編集。どこで詰まっているかを定期的に見直すことが、結果的に最短ルートになります。
判断の目安として、次の問いを立ててみてください。
- 生成に時間がかかりすぎているなら、解像度や尺を下げて試行回数を増やすべきか
- 編集で迷いが多いなら、絵コンテの段階でカット割りを決めきれていないか
- 修正が繰り返されるなら、承認基準が言語化されていないか
- 同じ作業を繰り返しているなら、テンプレート化できる部分はないか
特に効果が大きいのはテンプレート化です。人物紹介のカット、商品のクローズアップ、締めのロゴ表示。こうした定番のショットは、プロンプトごとテンプレートとして保存しておくと、次の案件で流用できます。制作の速さは、才能よりも再利用の設計で決まります。
よくある質問
AI動画制作に必要な機材は何ですか
高性能なGPUがあれば作業は快適ですが、多くのモデルはクラウド上で動くため、一般的なノートPCでも制作は可能です。必要なのは、安定した回線、十分なストレージ、そして編集ソフトです。むしろ時間の使い方と工程設計のほうが結果に影響します。
生成した映像は商用利用できますか
モデルごとに利用条件が異なります。商用利用の可否、生成物の扱い、入力素材の権利については、必ず各サービスの最新の規約を確認してください。加えて、参照画像や音源、実在の人物に似た表現については、別途権利処理が必要になる場合があります。
キャラクターの一貫性が保てません
原因は多くの場合、参照の固定とプロンプトの統一ができていないことです。基準となるカットを1つ作り、それを参照として使い続ける。プロンプトの人物記述部分をコピーして使い回す。この2点を徹底するだけで改善します。それでも難しいカットは、顔を映さない構図に逃がすのが現実的です。
どのモデルから始めるべきですか
まずは無料または低リスクで試せるものを1つ選び、1本の短い動画を最後まで完成させてください。モデルの比較は、完成までの工程を一度体験してから行うほうが判断が正確になります。
1本の動画制作にどれくらい時間がかかりますか
15秒程度の短尺であれば、慣れれば数時間から1日で形になります。30秒以上で構成が複雑になると、数日単位を想定したほうが安全です。ただし、絵コンテとショットリストの精度を上げれば、生成と編集の時間は大きく短縮できます。
実写とAI生成はどちらを使うべきですか
目的次第です。現実の人物や場所を正確に伝える必要があるなら実写、存在しない世界や概念を可視化するなら生成が向いています。両者を混ぜる手法も有効で、実写を下地にしてスタイル変換をかけると、説得力と非現実感を同時に得られます。
まとめ:工程を型にして再現性を高める
AI動画制作の成否を分けるのは、モデルの性能差よりも工程の設計です。企画をショットまで分解し、ショットごとに最適な手法を選び、プロンプトを仕様書として管理し、編集で全体を整える。この流れを型として持っておけば、ツールが入れ替わっても対応できます。
最初から完璧を目指す必要はありません。短い1本を作り、どこで詰まったかを記録する。その記録が、次回のワークフローを改善する材料になります。生成技術は変化が速い分野ですが、設計と検証の進め方は長く使える資産です。まずは15秒の1本から始めてみてください。



