Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画生成ワークフロー実践ガイド:企画・絵コンテ・プロンプト設計から編集までを体系化

Oct 4, 2026

AI動画生成は「モデル選び」から「工程設計」へ

AI動画生成の話題は、つい「どのモデルが優れているか」という比較に集中しがちです。新しい動画生成モデルが発表されるたびにデモ映像が話題になり、SNSでは数秒のクリップが拡散します。しかし、実際に広告案件や長尺の作品、継続的なSNS運用を担当している現場では、話はまったく別のところにあります。出来上がりの品質を決めているのは、モデルのベンチマークスコアではなく、企画、絵コンテ、参照素材、モデル選定、プロンプト設計、選別、編集という一連の工程の設計です。

これは料理に似ています。どんなに高性能な調理器具を揃えても、献立を決めず、下ごしらえをせず、味見をしなければ食べられる料理はできません。AI動画も同じで、生成ボタンを押す前の準備と、押した後の選別・加工にこそ品質差が生まれます。同じモデルを使っても、ある人は「なんとなく動く写真」しか作れず、別の人は商品広告として通用する15秒を作れる。その差は才能ではなく工程の有無です。

この記事では、AI動画生成を単発のトリックとしてではなく、再現可能な制作工程として整理します。企画の立て方、絵コンテの書き方、参照素材の作り方、モデルを選ぶ判断基準、プロンプトの型、一貫性の保ち方、音声と編集の仕上げ、そしてよくある失敗の回避策までを、実際の現場で使える順番で並べていきます。特定のツールに依存しない形で書いているので、手元の環境に合わせて読み替えてください。

全体像:AI動画制作を6つの工程に分解する

最初に全体像を押さえておきましょう。AI動画制作は、おおまかに次の6つの工程に分けると整理しやすくなります。

  1. 企画・コンセプト設計:誰に何を伝えるのか、尺はどれくらいか、トーンは何かを決める。
  2. 脚本・絵コンテ・ショットリスト:伝えたい内容をカット単位に分解する。
  3. 参照素材の準備:キャラクター、商品、背景、スタイルの基準になる画像や動画を用意する。
  4. モデル選定とプロンプト設計:用途に合う生成モデルを選び、カットごとに指示を組み立てる。
  5. 生成・選別・再生成:複数案を出し、使えるものを選び、必要なら狙いを変えて作り直す。
  6. 編集・音声・仕上げ:つなぎ、色調整、BGM、効果音、字幕、書き出しを行う。

重要なのは、この6工程のうち4番だけを切り出して「AI動画制作」と呼ぶのが間違いだという点です。実際の作業時間の配分は、企画と絵コンテで2割、参照素材で1割、生成と選別で4割、編集と仕上げで3割くらいになることが多く、生成そのものよりも前後の工程に時間がかかります。

もう一つの原則は「上流で決めたことを下流で取り戻さない」ことです。キャラクターの見た目を絵コンテ段階で決めずに生成を始めると、後から全カットを作り直すことになります。逆に、参照画像とショットリストを丁寧に作っておけば、生成工程は驚くほど機械的に進みます。

企画と絵コンテ:映像言語への翻訳

ログラインと尺の設計

最初に書くべきはログラインです。「誰が、どこで、何をして、どうなるのか」を1文で書きます。例えば「朝の台所で、忙しい会社員が1杯のコーヒーで一日のスイッチを入れる」といった具合です。この1文があると、後続のすべての判断に基準ができます。あるカットがログラインに寄与しないなら、それは削る候補です。

次に尺を決めます。AI動画生成は1カットあたり数秒単位で作ることが多く、長い尺を一発で作るのは現実的ではありません。したがって、完成尺から逆算してカット数を決めます。15秒のSNS広告なら6〜10カット、30秒のブランドフィルムなら12〜20カット、60秒の説明動画なら20〜35カットが目安です。1カットを2〜4秒で設計すると、生成の成功率が高く、編集で調整しやすくなります。

アスペクト比も最初に固定します。縦型のショート動画、横型のYouTube、正方形のフィード投稿では、構図の作り方が根本的に変わります。縦型なら人物の上半身と縦の動き、横型なら横方向の移動と広がりが映えます。生成を始めてから比率を変えると、ほぼ全カットの作り直しになるので、ここは妥協しないほうがよいポイントです。

ショットリストの作り方

ショットリストは、カット番号、尺、ショットサイズ、被写体の動き、カメラの動き、セリフや音の6項目を表形式で管理します。ショットサイズは、ロングショット(状況説明)、ミディアムショット(会話や動作)、クローズアップ(感情やディテール)、インサート(手元や小物)の4種類を使い分けると、単調になりません。

カメラワークの語彙も決めておきます。固定、パン(横振り)、ティルト(縦振り)、ドリー(前後移動)、トラッキング(被写体追従)、オービット(回り込み)、クレーン(上下移動)、ハンドヘルド(手持ち風)。AI動画生成では、1カットにつきカメラの動きは1つに絞るのが鉄則です。「ゆっくりドリーしながら回り込む」のような複合指示は、モデルが混乱して破綻しやすくなります。

編集上の注意として、同じショットサイズとカメラワークが3カット以上続くと、視聴者は飽きます。ショットリストを書く段階で、大きい画と小さい画を交互に配置し、動きのあるカットと静かなカットを混ぜておくと、編集段階で救われることが多くなります。

参照素材とキャラクターシート

AI動画生成において、テキストだけの指示は最も不安定な入力です。安定した出力が欲しいなら、参照画像を用意します。特にキャラクターが複数カットに登場する場合は、正面、斜め45度、横顔、背面の4方向の画像を用意し、服装、髪型、アクセサリー、体型を固定します。これをキャラクターシートと呼びます。

商品が主役の動画なら、商品のマクロ写真、手に持った状態、使用シーン、パッケージの4点を揃えます。背景は、ロケーションごとに1枚の基準画像を用意し、時間帯(朝、昼、夕、夜)のバリエーションをメモしておくと、シーン間の連続性が保ちやすくなります。

参照素材は高解像度であればよいわけではありません。むしろ、構図がシンプルで、被写体が中央にあり、照明が均一な画像のほうが、生成モデルは意図を汲み取りやすくなります。逆光で顔が暗い写真や、複数人が重なった集合写真は、参照としては扱いにくい素材です。

モデル選定の判断基準

写実性とスタイルの方向性

動画生成モデルは、大きく「フォトリアル系」と「スタイライズド系」に分かれます。フォトリアル系は実写に近い質感や肌、光の挙動が得意で、広告や製品紹介に向きます。スタイライズド系はイラスト調、アニメ調、絵画調など特定の美学に強く、ブランドの世界観作りやエンタメ用途に向きます。

選定の際は、モデルのサンプル映像ではなく、自分の参照画像と自分のプロンプトでテストするのが重要です。公開デモは丁寧に調整された最良の例であり、自分の素材で同じ結果が出るとは限りません。10秒のテストを3本作り、肌、髪、布、金属、水、煙といった要素の再現度を比較すると判断しやすくなります。

一貫性とキャラクター保持

複数カットで同じ人物を登場させる場合、モデルが参照画像をどこまで保持できるかが最重要の評価軸になります。評価ポイントは、顔立ちの保持、髪型の保持、服装の保持、体型の保持の4つです。1カット目と5カット目を並べて、別人に見えないかを必ず確認します。

一貫性を高める方法は、参照画像を複数与えられるモデルを選ぶこと、そしてカット間で共通する記述(年齢、髪色、服装、体型)をプロンプトの先頭に固定することです。指示語の順番を変えるだけで結果が変わることもあるため、プロンプトの雛形を作り、変数部分だけを差し替える運用が有効です。

モーションと物理挙動

動きの自然さは、歩行、手の動き、髪や布のはためき、液体の挙動、カメラワークの滑らかさで評価します。特に人物の歩行と手の動きは破綻しやすい箇所です。生成結果をスロー再生して関節の曲がり方を確認すると、破綻を早い段階で発見できます。

また、動きの量と破綻はトレードオフの関係にあります。激しいアクションを1カットで長く見せるより、短いカットに分割して編集でつなぐほうが、結果的に自然に見えることが多くなります。AI動画は「長回し」よりも「短いカットの積み重ね」に向いています。

生成速度・解像度・尺

納期と反復回数は密接に関係します。1本の生成に時間がかかるモデルは、選別のためのバリエーションを出しにくくなります。目安として、1カットにつき3〜5案を出せる速度があると、選別の精度が上がります。

解像度は最終書き出しから逆算します。1080pで書き出すなら、生成時に720p以上を確保し、必要に応じてアップスケールします。生成できる尺には上限があることが多く、上限を超える長さが必要な場合は、複数カットに分割して編集でつなぐのが基本です。

ライセンスと商用利用

見落とされがちなのが利用条件です。生成物の商用利用が可能か、学習データに起因する権利上の制約はないか、出力物の再配布や改変に制限はないかを、案件を受ける前に確認します。クライアントワークでは、使用したツール名と利用条件を簡単にメモしておくと、後から説明を求められたときに困りません。

プロンプト設計の実践テクニック

構造化プロンプトの型

動画生成のプロンプトは、文章をだらだら書くよりも、要素を順番に並べるほうが安定します。次の順序を雛形として使ってください。

  • 被写体:誰が、何が、どんな見た目か
  • 行動:何をしているか、どの方向に動くか
  • 環境:場所、時間帯、天候、周囲の要素
  • カメラ:ショットサイズ、アングル、動き、レンズ感
  • 照明:光源の種類、方向、色温度
  • 雰囲気:色調、質感、フィルムルック
  • 除外:避けたい要素

例えば「30代の女性、白いシャツ、窓辺でコーヒーカップを持つ、ゆっくり湯気が立つ、朝のキッチン、ミディアムショット、固定カメラ、窓からの自然光、柔らかい暖色、浅い被写界深度」という具合です。要素を絞り、形容詞を増やしすぎないことが安定の鍵です。

カメラ・照明・レンズの語彙

映像らしさを出すには、カメラと照明の語彙を増やすのが近道です。レンズは広角、標準、望遠、マクロ。アングルは目線の高さ、ローアングル、ハイアングル、俯瞰。照明は自然光、逆光、リムライト、ソフトボックス、実用的な光源(窓、ランプ、看板)。これらを組み合わせるだけで、同じ被写体でも印象が大きく変わります。

ただし、1カットに詰め込む情報量には上限があります。3つから5つの要素に絞り、優先度の高いものを先頭に置きます。長すぎるプロンプトは、モデルが一部を無視したり、矛盾する要素を混ぜたりする原因になります。

ネガティブ指定と除外

避けたい要素を明示するネガティブ指定は、破綻を減らすのに役立ちます。よく使う除外項目は、余分な指、変形した手、二重の顔、ぼやけた輪郭、テキストの混入、ロゴの勝手な生成、急激なカメラの跳ね、ちらつき、過度な彩度です。

ただし、ネガティブ指定は万能ではありません。除外項目を増やしすぎると、画そのものが貧しくなることがあります。まずは除外なしで生成し、問題が出た項目だけを追加するほうが効率的です。

バリエーション設計

同じプロンプトで複数回生成すると、毎回少しずつ違う結果が出ます。これを活かすには、意図的な変数を用意します。1つのカットについて、次の3軸でバリエーションを出します。構図のバリエーション(寄り/引き)、光のバリエーション(朝/夕)、動きのバリエーション(歩く/立ち止まる)。

3軸を掛け合わせると多くの候補が出ますが、すべてを検討する必要はありません。まず構図を決め、次に光を選び、最後に動きを微調整するという順番で絞り込むと、判断がぶれません。

一貫性を保つテクニック

参照画像とマルチイメージ入力

一貫性の土台は参照画像です。複数の参照画像を同時に入力できるモデルでは、人物用、背景用、スタイル用と役割を分けて渡すと、干渉が減ります。役割を分けたら、どの画像がどの役割かをプロンプト内で明示するか、モデルが対応している入力スロットに正しく配置します。

参照画像の品質は、生成結果に直結します。人物の参照画像は、正面・斜め・横の3方向を最低限揃え、照明条件をできるだけ統一します。背景の参照画像は、カメラの高さと画角を本編と合わせておくと、シーンのつながりが自然になります。

シードと反復

多くの生成ツールはシード値(乱数の初期値)を指定できます。シードを固定すると、構図や人物の特徴が安定し、プロンプトの一部分だけを変えて比較しやすくなります。シードを変更すると、同じプロンプトでもまったく別の解釈が出てきます。

実務では、まずシードを数個試して「当たり」の構図を見つけ、そのシードを固定して細部を詰める流れが効率的です。逆に、行き詰まったときはシードを大きく変えて、発想の枠を壊すのが有効です。

キャラクターシートの運用

キャラクターシートは作って終わりではありません。案件ごとに更新し、服装違い、季節違い、表情違いを追加していきます。ファイル名に「キャラクター名_服装_角度」のように規則的な命名をしておくと、複数人での作業でも迷いません。

長尺の動画では、カット番号と使用した参照画像のファイル名を対応表にしておきます。後から「このカットの人物だけ髪型が違う」と気づいたとき、どの参照画像を差し替えればよいかが一目で分かります。

声とリップシンク

人物が話すカットでは、音声と口の動きの同期が品質を大きく左右します。ナレーション主体の構成にするか、リップシンクを前提にするかを早い段階で決めます。リップシンクを使う場合、セリフの音声を先に確定させ、その音声に合わせて映像を生成する順序が安定します。

声そのものの一貫性も重要です。同じ人物に複数のセリフがある場合、声質、話速、抑揚の基準を決め、全カットで同じ設定を使います。声がカットごとに変わると、視聴者は無意識に違和感を覚えます。

音声・編集・仕上げ

生成したカットは素材であり、作品ではありません。編集で初めて作品になります。基本の流れは、粗い並べ替え、不要部分のトリミング、テンポ調整、色調整、音の追加、字幕、書き出しです。

まず音から作る編集手法も有効です。BGMやナレーションを先にタイムラインへ置き、それに合わせてカットの長さを決めると、テンポが自然になります。AI動画はカットが短くなりがちなので、音のリズムでテンポを保つと、全体が一本の映像としてまとまります。

色調整では、カット間のホワイトバランスとコントラストを揃えます。生成モデルごとに色味が違うため、何もせずつなぐとシーンごとに色が跳ねます。逆に、同じトーンに寄せすぎると単調になるので、シーン単位でゆるやかに変化させるのがコツです。

音の設計は3層に分けると整理しやすくなります。環境音(部屋鳴り、街の音、風)、効果音(足音、扉、スイッチ)、音楽(BGM)。環境音がないと映像が不自然に静かになり、効果音がないと動きの説得力が落ちます。

最後に書き出し設定を確認します。解像度、フレームレート、ビットレート、字幕の有無を、配信先の仕様に合わせます。縦型と横型で同じ素材から2種類を書き出す場合は、字幕の位置とサイズをそれぞれ調整します。

よくある失敗と対処法

人物がカットごとに別人に見える。 参照画像を増やし、共通の記述をプロンプト先頭に固定し、シードを揃えます。それでも解決しない場合は、顔がはっきり写るカットを減らし、後ろ姿や手元のカットでつなぐ編集に切り替えます。

手や指が崩れる。 手を画面の主要素にしない構図に変えるのが最も確実です。手前に物を持たせる、ポケットに入れる、フレームの外に出す、といった工夫で回避できます。

動きが滑らかにつながらない。 1カットの尺を短くし、動きの開始と終了をそろえます。カットの最後と次のカットの最初で、被写体の位置と方向を合わせると、つなぎが自然になります。

映像が全体的にのっぺりしている。 ショットサイズと照明に変化をつけます。寄りと引き、明るいカットと暗いカットを交互に配置するだけで、印象が大きく変わります。

テキストやロゴが勝手に生成される。 除外指定に文字とロゴを加え、文字が必要な場合は編集工程で字幕として載せます。生成モデルに文字を描かせるのは、現状では最も破綻しやすい作業のひとつです。

カットが足りず尺が埋まらない。 冒頭に状況説明のロングショット、中盤にインサート、最後に余韻のカットを足します。尺が足りないときは、無理に引き伸ばすよりも、カット数を増やしてテンポで見せるほうが破綻しません。

修正のたびに全部作り直している。 カット単位でファイルを分割し、使用したプロンプト、参照画像、シードをカットごとに記録します。この記録があるだけで、修正は局所化できます。

実践ワークフロー:30秒ブランドフィルムを5日で作る

具体的な流れを見てみましょう。商品が1つ、登場人物が1人、完成尺30秒、横型、ナレーションありという条件を想定します。

1日目:企画と絵コンテ。 ログラインを書き、15カットのショットリストを作ります。各カットの尺、ショットサイズ、カメラワーク、必要な音を表に入れます。この時点で、ナレーション原稿も書いておきます。

2日目:参照素材の準備。 人物の参照画像を3方向、商品の参照画像を4点、背景の基準画像を3種類用意します。ファイル名を規則的に整え、カット番号との対応表を作ります。

3日目:テスト生成とモデル選定。 代表的な3カット(寄り、引き、動きのあるカット)を複数モデルで試し、肌、布、商品の質感、動きの自然さを比較します。この日で本番モデルを決め切ります。

4日目:本生成と選別。 全15カットについて3〜5案を生成します。選別の基準は、構図、人物の一貫性、動きの自然さ、尺の4点です。迷った案は残しておき、編集段階で判断します。

5日目:編集と仕上げ。 ナレーションとBGMを先に置き、それに合わせてカットを並べます。色調整、効果音、字幕、書き出しを行います。最後に縦型版も書き出す場合は、字幕位置を調整して別途出力します。

この流れの要点は、生成に使う時間を1日に集約し、前後に十分な準備と仕上げの時間を確保していることです。生成を毎日少しずつ進めると、途中で方向性がぶれ、一貫性が崩れます。

よくある質問

Q. 生成モデルは1つに絞るべきですか。 基本は1つに絞り、補助的に別モデルを使うのがおすすめです。メインを決めずに複数を使い分けると、色味や人物の一貫性が崩れ、編集で修正しきれなくなります。

Q. プロンプトは長いほうが良いですか。 長さよりも構造です。被写体、行動、環境、カメラ、照明、雰囲気の順に整理し、要素を3〜5個に絞るほうが安定します。

Q. 一貫性を出す最も効果的な方法は。 参照画像の質と枚数です。テキストの工夫よりも、正面・斜め・横の参照画像を揃えるほうが効果が大きくなります。

Q. 生成したカットは何割くらい使えますか。 慣れていないうちは2〜3割、工程が固まってくると5〜7割が使えるようになります。使えない案も、構図の参考として残しておくと無駄になりません。

Q. 縦型と横型の両方が必要な場合は。 横型を本編として作り、縦型は主要カットのみ再構成します。全カットを作り直すのではなく、寄りのカットを中心に縦型用の素材を追加するのが効率的です。

Q. チームで作業するときの注意点は。 命名規則、プロンプトの雛形、参照画像の置き場所、カット番号との対応表を最初に共有します。属人的な運用は、担当者が変わった瞬間に破綻します。

Q. 学習に時間をかけるべき範囲は。 プロンプトの書き方よりも、絵コンテと編集の基礎を学ぶほうが投資対効果は高くなります。AI動画の品質は、映像の文法を理解しているかどうかに強く依存します。

Alexander

Alexander