Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画生成ワークフロー実践ガイド:モデル選定・プロンプト設計・一貫性・品質評価・編集・トラブル対応

Oct 5, 2026

AI動画生成を制作フローに組み込む全体像

生成AIによる動画制作は、プロンプトを書いて生成ボタンを押す単発の作業ではありません。現場で安定した成果を出しているチームは、工程を「企画」「設計」「生成」「選別」「編集」の5段階に分け、各段階に明確な成果物を定義しています。この分け方を徹底すると、うまくいかないときに「モデルの限界」なのか「プロンプト設計のミス」なのか「編集でリカバリーできる問題」なのかを切り分けやすくなります。

企画段階の成果物は、動画の目的・尺・公開先・トーンを1枚にまとめたブリーフです。設計段階ではショットリストとプロンプト台本を作ります。生成段階ではショットごとに複数案を出し、選別段階で採用テイクを決め、編集段階でつなぎと音を整える。この流れを最初に決めておくと、後工程で「素材が足りない」「尺が合わない」「キャラクターが別人になった」という手戻りが激減します。

もう一つ重要なのが、生成は「一度で当てる」ものではなく「確率の中から選ぶ」ものだという前提です。同じプロンプトでも出力は毎回変わります。したがって、1ショットにつき複数案を出す前提でスケジュールと作業量を組み立てる必要があります。プロの現場では、まず低解像度・短尺で構図と動きの方向性を確認し、方向性が固まったら本番品質で出力する二段構えが定着しています。

各工程で決めること

  • 企画:目的、ターゲット、尺、公開先、トーン、必須要素
  • 設計:ショット数、カット割り、プロンプト、リファレンス素材
  • 生成:解像度、尺、アスペクト比、同時に出す案の数
  • 選別:採用基準、スコアリング、リテイク判断
  • 編集:テンポ、つなぎ、音、字幕、グレーディング

役割分担の考え方

小規模チームなら、ディレクター(判断)、プロンプト設計(設計と生成)、編集(選別と仕上げ)の3役に分けるだけで回ります。1人が全部を担当する場合でも、作業時間を分けて「設計中は生成しない」「選別中は新しい生成をしない」と決めるのが有効です。設計と選別を同時に進めると、目先の出力に引っ張られて全体の構成が崩れます。

モデル選定の判断基準

表現の方向性で選ぶ

生成モデルには得意不得意の傾向があります。実写風の人物と自然な光を得意とする系統、イラストやアニメ調のスタイル変換を得意とする系統、シネマティックなカメラワークを得意とする系統など、それぞれ性格が異なります。まず「自分の企画がどの方向性か」を決め、その方向に強いモデルを主軸に据えます。複数モデルを併用する場合も、主軸を1つ決めておくと画のトーンが揃います。

制約条件で選ぶ

表現力だけで選ぶと後で詰まります。確認すべきは、生成できる最大の尺、対応する解像度とアスペクト比、出力形式、そして動作の安定性です。縦型ショート動画を大量に作る企画と、横型の長尺カットを作る企画では、必要なスペックがまったく違います。事前に「この企画で必要な最低スペック」を数値で書き出しておくと、選定が感覚ではなく比較になります。

一貫性の担保方法で選ぶ

同じ人物や同じ空間を複数カットで見せる企画では、一貫性の担保方法が最重要になります。リファレンス画像を渡せるか、前のカットを引き継げるか、キャラクター固定用の仕組みがあるか。ここが弱いモデルを主軸にすると、編集でどうにもならないレベルの破綻が量産されます。逆に、単発のカットだけで構成する企画なら、この項目の優先度は下がります。

コストは「試行単価×必要試行回数」で見る

料金体系は、単価だけを見ても意味がありません。大切なのは「採用テイクを1本得るまでに何回生成が必要か」という試行回数です。単価が安くても10回試行して1本しか使えないなら、実質コストは10倍です。逆に単価が高くても2回で決まるなら、結果的に安くつくことがあります。

判断基準を表で管理する

選定の根拠は必ず記録に残します。評価軸を「表現力」「必要な尺と解像度」「一貫性の仕組み」「1採用テイクあたりの試行回数」「扱いやすさ」の5項目に絞り、各モデルを5段階で採点します。この表は企画が変わるたびに更新するのが前提で、過去の採点をそのまま使い回さないことが重要です。モデルは更新され続けるため、半年前の評価は当てになりません。

プリプロダクション:ショットリストとプロンプト設計

ショットリストの粒度

ショットリストは「1カット=1生成」を基本単位にします。1つのショットに複数のアクションや複数のカメラ移動を詰め込むと、生成モデルはどの指示を優先すべきか判断できず、破綻率が跳ね上がります。1カット3〜5秒を基本とし、長いシーンは複数のショットに分割してつなぐほうが結果が安定します。

ショットリストに記載する項目は、カット番号、尺、構図(ワイド/ミディアム/クローズアップ)、被写体の動作、カメラの動き、照明、背景、必要な小道具です。このうち1つでも空欄があると、生成時にモデルが勝手に補完し、意図とずれた画が出てきます。空欄は「なんでもよい」という指示と同じ意味だと理解しておきましょう。

プロンプトの7要素テンプレート

プロンプトは思いつきで書かず、要素を固定して組み立てます。有効なのは次の7要素です。

  1. 被写体:年齢感、服装、表情、体の向き
  2. 動作:何をしているか、動作の速度と方向
  3. 環境:場所、時間帯、天候、周囲の要素
  4. カメラ:ショットサイズ、角度、動き、レンズ感
  5. 光:光源の位置、硬さ、色温度
  6. スタイル:写実性の度合い、色調、フィルム感
  7. 制約:避けたい要素(手の破綻、文字の混入、余計な人物など)

この順番で書くと、後から差分だけを差し替えてバリエーションを出すのが容易になります。たとえば光の項目だけを変えれば、同じ構図で朝と夕方の比較ができます。

差分で回すという考え方

一発で完璧なプロンプトを書こうとすると時間が溶けます。実務的には、ベースプロンプトを1つ決め、そこから1要素ずつ変えて比較する方法が効率的です。最初に構図と動作を確定させ、次に光、最後にスタイルを詰める。この順番なら、どの変更が結果に効いたのかが追跡できます。

ショット設計とカメラワーク制御

カメラ語彙をチーム内で標準化する

カメラワークの指示は言葉の揺れが最大の敵です。「ゆっくり寄る」「静かにズーム」は同じ意味ですが、モデルには別の指示として解釈されることがあります。チーム内で使う語彙を10個程度に絞り、定義を共有しておくと出力の再現性が上がります。

  • 固定(三脚)
  • ゆっくりとした前方移動(ドリーイン)
  • 後方への引き(ドリーアウト)
  • 横方向の追従(トラッキング)
  • 被写体の周囲を回る(オービット)
  • 上下の移動(クレーン、チルト)
  • 手持ち風の微細な揺れ

レンズと被写界深度

同じ構図でもレンズ感を変えると印象が大きく変わります。広角は空間の広がりと遠近感を強調し、望遠は背景を圧縮して被写体を引き立てます。浅い被写界深度は視線を一点に集め、深い被写界深度は情報量を増やします。生成時にこれらを指定しておくと、後工程でのグレーディングやトリミングの自由度が上がります。

モーションの量を絞る

動きの多いカットは破綻しやすいため、重要なカットほど動きを絞るのが定石です。会話シーンなら固定カメラでわずかな身振りだけ、アクションシーンなら1カット1アクションに限定します。「走りながら振り返って手を振る」は3つの動作なので、3カットに分けたほうが最終的な品質は高くなります。

カット間のリズムを設計する

生成したカットは、単体で見て良くてもつないだときにテンポが悪いことがあります。ショットリストの段階で、テンポの緩急を意識して尺を配分しましょう。導入は長め、情報提示は短め、クライマックスはさらに短く、余韻で長く戻す。この呼吸を作っておくと編集が格段に楽になります。

一貫性を保つワークフロー

キャラクター固定の手順

複数カットに同じ人物を登場させる場合、次の手順を踏むと破綻が減ります。まず基準となる正面の1枚(または1カット)を確定させ、それをリファレンスとして全カットに渡します。服装・髪型・アクセサリーの描写は毎回同じ文言で書きます。形容詞を言い換えると、モデルは別の人物として解釈する可能性があります。

照明と色温度の統一

シーンが同じなら、光の記述も揃えます。朝のシーンなら色温度の表現、光源の方向、影の柔らかさを固定します。ここがバラつくと、同じ部屋のはずなのにカットごとに別の場所に見えてしまいます。逆に、時間経過を表現したいシーンでは意図的に変えるので、変える/変えないをショットリストに明記しておきます。

リファレンス台帳の運用

採用した画、却下した画、使ったプロンプト、変更点を1つの台帳にまとめます。台帳があると、後から「あの雰囲気をもう一度出したい」という要求に短時間で応えられます。スプレッドシートで十分です。列はカット番号、プロンプト、主要パラメータ、採用可否、理由、ファイルパス程度に留め、更新が続く粒度にします。

避けるべきアンチパターン

一貫性が崩れる典型パターンは3つあります。1つ目は、シーンごとにプロンプトの書き方を変えること。2つ目は、リファレンスを毎回作り直すこと。3つ目は、破綻した画を「編集でなんとかする」と決めてしまうこと。3つ目が最も危険で、破綻は編集で直すほど別の破綻を呼びます。

生成結果の品質チェック

アーティファクトの見つけ方

生成映像には特有の破綻があります。指の本数や関節の曲がり方、歯や目の描写、背景の文字、細い物体の輪郭、反射や影の向き、人のすれ違い方。これらは等倍で見ると気づきにくいので、必ずスロー再生とコマ送りで確認します。特に動きの速いカットは、1フレーム単位で見る価値があります。

時間的一貫性の検証

カットの冒頭と末尾を並べて見比べます。被写体の位置、向き、服装、小道具、背景の要素が保たれているかを確認します。次に、前後のカットとつないだときに人物の位置関係が破綻していないかを見ます。カット単体では完璧でも、つなぐと急に人物が増えたり消えたりすることがあります。

意図反映度のスコアリング

主観で「良い/悪い」を判断すると、選別が終わりません。5項目で3段階程度のスコアを付けると判断が速くなります。

  • 構図:指定したショットサイズと角度になっているか
  • 動作:指示した動きが再現されているか
  • 一貫性:前後カットと矛盾がないか
  • 技術品質:破綻やノイズが許容範囲か
  • 感情:シーンの意図する感情が伝わるか

合計点で足切りを決めておけば、迷う時間が減り、選別のばらつきも抑えられます。

よくある失敗とトラブルシューティング

出力が全体的にぼんやりする

情報量が多すぎるプロンプトが原因のことが多いです。被写体・動作・カメラ・光の4要素に絞り、スタイル指定を削って再生成します。また、背景の要素を減らすと被写体のディテールが上がることがあります。

指示した動きが起きない

動作の記述が抽象的すぎる可能性があります。「歩く」ではなく「右から左へ、一定の速度で歩く」のように方向と速度を書きます。それでも効かない場合は、カットを分割し、動作そのものを減らします。

カメラだけが勝手に動く

カメラの記述が目立つ位置にあると、モデルがカメラを主役と解釈することがあります。カメラ指定を文の後半に移す、あるいは「固定」を明示することで安定します。

同じ人物がカットごとに変わる

リファレンスの渡し方と服装の記述を確認します。表現を言い換えていないか、参照画像の品質が十分かを見直します。それでも解決しない場合は、そのモデルでの一貫性維持が難しいと判断し、カット数を減らすか、見せ方を変える割り切りも必要です。

手や文字が崩れる

手が画面の主要素になる構図は避けるか、手を使わない動作に置き換えます。文字は原則として生成に任せず、編集ソフトで後から載せます。生成に文字を描かせると、崩れた文字が映像全体の信頼感を下げます。

ポストプロダクション

選別とテンポ

生成した素材は、まず音を消して通しで見ます。画だけで成立していれば、つなぎの強度は十分です。次に音を入れて見て、テンポの悪い箇所を削ります。1カットあたり0.2秒削るだけでも、体感のテンポは大きく変わります。

音・字幕・ナレーション

生成映像は無音なので、音の設計が作品の質を左右します。環境音、効果音、BGM、ナレーションの順に積むと整理しやすいです。字幕は読みやすさを最優先し、1行あたりの文字数と表示時間を統一します。

グレーディングと書き出し

カットごとに色温度やコントラストがばらついている場合は、グレーディングで寄せます。全カットに同じ調整をかけるのではなく、基準となるカットを決め、それに近づける形で個別に調整します。書き出し設定は公開先の仕様に合わせ、ビットレートは配信プラットフォームの推奨値に従います。

最終チェック

公開前に、冒頭3秒で内容が伝わるか、音量が極端に変わらないか、字幕に誤字がないか、スマートフォンでも読めるか、の4点を確認します。特に冒頭は再生継続率に直結します。

試行回数とリソースの設計

生成コストは「1回あたりの単価」ではなく「採用までの試行回数」で決まります。ショットごとに、必要試行回数の見積もりを立てておきましょう。

  • 単純な風景カット:少ない試行で当たりやすい
  • 人物のクローズアップ:表情の再現に試行が必要
  • 手や小道具が絡む動作:破綻が増え、試行が増える
  • 複数人物の絡み:一貫性の難度が高く、最も試行が増える

この見積もりを制作前に出しておくと、撮り直しの判断とスケジュール調整が現実的になります。また、解像度を下げた確認用の生成と、本番用の生成を分けることで、無駄な負荷を大幅に削れます。

バッチで回す

1カットずつ完成させようとすると、判断の基準がぶれます。同じシーンのカットをまとめて生成し、まとめて比較するほうが、一貫性も判断の速さも向上します。

FAQ

Q. どのモデルを使えばよいですか

企画の方向性と必要なスペックで決まります。写実的な人物、スタイル化された映像、シネマティックなカメラワークなど、得意分野が異なるため、まず自分の企画の優先順位を言語化してください。複数モデルの併用は、主軸を1つに絞ってから行うのが安全です。

Q. プロンプトは長いほうがよいですか

長ければよいというものではありません。要素が多すぎると優先順位が曖昧になり、狙いから外れます。被写体・動作・環境・カメラ・光・スタイル・制約の7要素を過不足なく書き、冗長な修飾語を削るほうが結果が安定します。

Q. 破綻したカットは編集で直せますか

小さな破綻は目立たないタイミングに隠せますが、構造的な破綻は直りません。指の本数や顔の崩れは隠すほど違和感が増します。再生成のほうが結果的に速いと判断する基準を持つことが重要です。

Q. 一貫性を保つ最も効果的な方法は

リファレンスを固定し、記述の文言を変えないことです。同じ人物を表す言葉を毎回同じにし、服装や髪型の描写もコピーして使い回します。表現の言い換えは一貫性の最大の敵です。

Q. 生成に任せるべきでない作業は

文字入れ、ロゴ、正確な数値や図表、法的に正確性が求められる表現は生成に任せず、後工程で作り込みます。これらは生成の得意領域ではなく、崩れが信頼性に直結します。

Q. 尺が足りないときはどうしますか

カットを増やすのではなく、既存カットの尺を伸ばすか、つなぎを工夫します。同じ素材でも、間の取り方で体感の尺は変わります。追加生成は最後の手段と考え、まず編集で解決できないかを検討します。

Q. チームで作業するときの注意点は

ファイル名の命名規則、カット番号、採用可否の記録方法を最初に決めます。生成は属人的になりやすいため、判断の理由を残す運用が必須です。台帳がないチームは、同じカットを何度も作り直すことになります。

Q. 学習のために何を見直せばよいですか

却下したカットとその理由を定期的に見返します。失敗の傾向は個人やチームごとに偏っており、3〜4本のプロジェクトを終えたあたりで一度分析すると、次回のプロンプト設計が明確に改善します。

Alexander

Alexander