Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画生成ワークフロー実践ガイド:企画・生成・編集・書き出しまでの全手順と失敗回避のコツ

Oct 6, 2026

AI動画生成が「単発の実験」で終わる理由

テキストから数秒の映像を出すだけなら、現在のモデルは誰でも驚かせてくれる。しかし、実際に納品できる形——広告、商品紹介、解説、ショートドラマ、採用動画——になると成功率は一気に下がる。理由は単純だ。生成モデルは「1ショットの美しさ」を競うが、動画は「ショット間の連続性」と「情報の順序」で評価される。1本の動画は、最低でも10〜30のショット、ナレーション、BGM、テロップ、書き出し設定という別々の工程が噛み合って初めて成立する。

うまくいかない原因の多くはモデルの性能ではない。ワークフローの設計である。プロンプトを1回だけ書いて出てきた映像をそのまま並べると、キャラクターの顔が毎カットで変わり、色温度がばらつき、カメラの向きが矛盾し、視聴者は数秒で離脱する。逆に、地味な見た目のモデルでも、工程を分割して管理すれば驚くほど安定した成果物になる。

この記事では、AI動画生成を「思いつきの実験」から「再現性のある制作ライン」に変えるための実践手順を、企画から書き出しまで通しで解説する。特定のツールに依存しない形で書いているので、利用中のサービスが変わっても考え方はそのまま使える。

ワークフロー全体像:6つの工程を一枚の地図にする

まず制作ラインを6工程に分解する。この地図があるだけで、どこで詰まっているのかが一目で分かるようになる。

  1. 設計:企画、台本、絵コンテ、ショットリスト
  2. 素材準備:参照画像、ロゴ、フォント、BGM候補、テンプレート
  3. 生成:ショット単位のクリップ生成(1ショットにつき3〜5テイク)
  4. 選別:テイク比較、ベストテイク抽出、必要なら再生成
  5. 組み立て:編集、音声、テロップ、モーショングラフィックス
  6. 仕上げと配信:カラー調整、書き出し、サムネイル、公開設定

重要なのは、工程3と工程4を分離することだ。生成と選別を同時にやろうとすると、「もっと良いのが出るはず」と無限に回し続けて時間が溶ける。1ショットにつき上限テイク数を先に決め、上限に達したら必ず選別に進む。

もうひとつの原則は「壊れたショットは直さない、作り直す」である。生成AIの出力は編集で無理に修正すると不自然さが残りやすい。1カット2〜4秒なら、再生成したほうが速く、結果も良い。

さらに、工程ごとにレビュー担当を決めておくと品質が安定する。台本のレビュー、ショットの選別、音声の確認、最終チェックを別の人が見るだけで、自分では気づけない違和感——視線の不一致、テロップの誤字、音量差——が大幅に減る。

プリプロダクション:目的・尺・配信先を先に固定する

生成を始める前に、変更コストが高い項目を確定させる。ここを曖昧にしたまま生成に入ると、後工程で作り直しが発生する。

目的を1文で書く

「誰に、何を、どう感じてもらい、次に何をしてほしいか」を1文にまとめる。例:海外向けECの新商品を、機能ではなく生活シーンの変化として伝え、商品ページへの遷移を増やす。この1文があると、ショットの取捨選択が速くなる。

尺とアスペクト比を決める

縦動画と横動画では構図の設計が根本的に違う。縦は被写体を中央に寄せ、上下にテロップとUIの余白を確保する。横は左右の情報量を活かせるが、縦より被写体が小さくなる。

配信先の型 推奨比率 目安の尺 設計の要点
縦型ショート 9:16 15〜45秒 1カット2〜3秒、冒頭1秒で結論
フィード広告 1:1 / 4:5 15〜30秒 音なし前提、字幕必須
通常動画 16:9 1〜10分 章立て、Bロール多用
プレゼン資料動画 16:9 3〜8分 図解とテロップ中心
サイネージ 9:16 / 16:9 10〜20秒 無音ループ、文字大きめ

ショットリストを作る

台本をそのまま生成に入れない。必ずショット単位に割る。1ショットは「1つの動作、1つのカメラ、1つの光」に絞るのがコツだ。欲張って複数の動作を1クリップに入れると、モデルは必ずどこかで破綻する。

ショットリストには次を書く。

  • ショット番号と尺(例:S03 / 3秒)
  • 構図(ワイド、ミディアム、クローズアップ)
  • 被写体と動作
  • カメラの動き(固定、パン、プッシュイン、オービット)
  • 光と時間帯
  • ナレーションまたはテロップの内容

この表があると、生成時に迷う時間がほぼゼロになる。

素材を先に揃える

参照画像(人物、商品、ロゴ)、使用フォント、BGM候補、効果音、カラーパレットを事前にフォルダ分けする。生成を始めてから素材を探すと、トーンが混ざって全体が散らかる。

モデル選定の判断基準:品質・速度・制御性のトレードオフ

モデルは「一番すごいもの」を選ぶのではなく、用途に合わせて使い分ける。判断すべき軸は次の8つだ。

1. 再現したい表現の種類

  • 実写風の人物・生活シーン:人物の自然な動きと肌の質感に強いモデル
  • アニメ・イラスト調:線の安定性とスタイル忠実度に強いモデル
  • 3D・プロダクトCG:形状の正確さと反射表現に強いモデル
  • 図解・インフォグラフィック:生成よりAfter Effects系の方が速く正確
  • 顔のトーキング:リップシンク精度と首の動きの自然さで選ぶ

2. クリップの最大尺

多くのモデルは5秒前後、長いもので10〜20秒。ショットリストの尺と合わないと、無理な分割が発生してつながりが悪くなる。長尺を1本で狙うより、短いクリップを設計通りに並べるほうが最終品質は高い。

3. 参照画像・一貫性のサポート

人物や商品の同一性を保つには、参照画像を複数枚受け付けるか、シードを固定できるかが決定的に重要になる。ここが弱いモデルは、長尺のストーリーには向かない。

4. カメラ制御の粒度

「プッシュイン」「オービット」「ドリー」といった語彙にどれだけ忠実か。カメラ制御が弱いモデルは、編集でごまかすしかなくなる。

5. 解像度とアップスケール耐性

720pで生成して1080pや4Kに拡張する流れが現実的。アップスケールしたとき破綻が少ないモデルを選ぶ。

6. 速度

1ショット30秒で出るか、5分かかるかで、試行回数が変わる。試行回数はそのまま品質に直結する。プレビューは低解像度、本番だけ高解像度という二段構えが有効だ。

7. 音声の同時生成

効果音や環境音を同時に出せるモデルは、後工程の手間を減らす。ただし音の同期精度はまだ粗いことが多いので、最終的には別レイヤーで整える前提で考える。

8. 商用利用条件

業務用途では、生成物の商用利用可否、学習データに関する表記、入力素材の取り扱いを必ず確認する。ここを曖昧にしたまま進めると、公開直前に全部やり直しになる。

ハイブリッド運用が現実解

1本の動画を単一モデルで作る必要はない。人物カットは人物に強いモデル、商品カットは形状に強いモデル、テロップは編集ソフト、背景は静止画生成という分担が普通になっている。むしろ、同じモデルで全部やろうとするほうが不自然さが目立つ。

プロンプト設計:被写体・動作・カメラ・光・スタイルの5要素

プロンプトは雰囲気を書くものではなく、仕様を書くものだ。次の5要素を順番に埋めると再現性が上がる。

  1. 被写体:誰が、何が、どんな見た目で(年齢層、服装、素材感)
  2. 動作:何をするか(1つだけ)、動作の速度
  3. カメラ:構図、アングル、レンズ感、動き
  4. 光:時間帯、光源の方向、色温度、コントラスト
  5. スタイル:実写/アニメ/フィルム調、色味、質感

テンプレート例

「40代の女性が白いシャツで木製の机に向かう。左手でノートを開き、右手でペンを取る。ミディアムショット、やや俯角、50mm相当、ゆっくりしたプッシュイン。午前の窓光が左から入り、柔らかい影。落ち着いた実写調、自然な色味、粒子感は控えめ」

この形なら、要素を1つずつ差し替えてバリエーションを量産できる。逆に、要素を全部同時に変えると、何が効いたのか分からなくなる。

否定条件も仕様として書く

「文字を入れない」「ロゴを出さない」「余計な人物を入れない」「カメラを速く動かさない」など、避けたい要素を明示する。特にテロップは生成に任せず、編集で載せたほうが読みやすく、修正も簡単だ。

言語の扱い

日本語で書いて意図が通るモデルも増えたが、動作やカメラ用語は英語のほうが精度が高いことが多い。日本語で構成を書き、カメラと光のキーワードだけ英語を併記するスタイルが実務的だ。

シードと参照の固定

同じ人物を複数ショットで使うなら、シード値を記録し、参照画像を3枚(正面、斜め、表情違い)用意する。服装・髪型・アクセサリーの記述は全ショットで一字一句同じにする。ここを「気分で書き換える」のが、一貫性が崩れる最大の原因である。

ショット生成と一貫性:キャラクター・色・カメラをつなぐ技術

生成の現場で最も時間を食うのが一貫性の維持だ。次の順番で対処すると効率が良い。

キャラクターの一貫性

  • 参照画像は正面だけでなく、斜め45度と横顔を用意する
  • 生成順は「基準ショット」を最初に決め、それを参照にして残りを作る
  • アップに耐える顔を基準にする(引きの絵から作ると顔が曖昧になる)
  • 年齢・体型・髪型の記述をテンプレート化して使い回す

色の一貫性

ショットごとに色温度が変わると、素人っぽさが最も強く出る。照明条件を「同じ時間帯・同じ光源位置」に揃え、編集で全カットに共通のLUTを当てて統一する。屋外と屋内を混ぜるなら、屋内も窓光を同じ方向から入れる。

カメラの一貫性

視線のルール(イマジナリーライン)を守る。人物Aが右を向くカットの次は、相手が左を向くカットにする。これを破ると、会話シーンが急に分かりにくくなる。加えて、カメラの動きは「1ショット1動作」に絞る。パンとプッシュインを同時に指示すると、たいてい破綻する。

クリップの長さとつなぎ

1カット2〜4秒を基本にすると、生成の成功率が上がり、編集の自由度も増える。つなぎは次の3つを使い分ける。

  • マッチカット:似た構図でつなぐ(動作の連続性を演出)
  • カットオンアクション:動作の途中で切る(テンポが出る)
  • ジャンプカット:同構図で時間を飛ばす(説明動画で有効)

アップスケールとフレーム補間

生成した素材は解像度が足りないことが多い。アップスケールツールで1080pまたは4Kに引き上げ、必要ならノイズ除去を軽くかける。フレーム補間は諸刃の剣で、24fpsのシネマティックな素材を60fpsにすると不自然なぬるっとした動きになる。補間は「遅い動きのカット」だけに限定する。また、動きが速すぎて破綻する場合は、スローモーション指定で生成してから編集で速度を上げると自然に仕上がる。

音声・BGM・字幕:見た目より音で差がつく

視聴者は映像の粗さには寛容だが、音の悪さには即座に離脱する。AI動画で最も投資対効果が高いのは音まわりだ。

ナレーション

音声合成を使う場合、読み上げ速度は1.0〜1.1倍、文の間は0.2〜0.4秒空ける。句読点の位置を調整するだけで自然さが大きく変わる。固有名詞や数字は読み間違えやすいので、事前に読みを確認し、必要ならその部分だけ別テイクに分ける。

BGMと効果音

BGMは動画のテンポを決める。冒頭1秒でリズムが入ると離脱率が下がる。音量はナレーションを邪魔しない位置に敷き、盛り上げたい瞬間だけ持ち上げる。効果音は3〜5個に絞る。多いほど安っぽく聞こえる。

音量の目安

  • ナレーション:ピークが概ね -6dB 前後
  • BGM:ナレーションより -18〜-20dB 程度下
  • 統合ラウドネス:配信先の基準に合わせる(動画投稿サイトは概ね -14 LUFS、音声主体の配信は -16 LUFS 前後)
  • 書き出し音声:48kHz / AAC 256〜320kbps

字幕

縦動画は音を出せない視聴が多いため、字幕は必須と考えたほうがよい。1行あたり15〜20文字、表示は2〜3秒、画面下から少し上げてUIと重ならない位置に置く。読み上げと字幕のタイミングを数フレームずらすと、口の動きと合って見える。

編集とポストプロダクション:AI素材を作品に変える工程

生成素材はあくまで素材だ。ここで「作品」に近づける。

カットのリズム

つないだ後に一度通しで見て、ダレる箇所を削る。目安として、情報提示パートは1カット2〜3秒、感情を乗せるパートは4〜6秒。AI素材は長く見せると粗が目立つので、短く切って畳みかけるほうが強い。

カラー調整

全カットに同じLUTを当ててから、ショット単位で露出とホワイトバランスを微調整する。肌の色がカットごとに違うと一気に安っぽくなるので、顔だけを基準に合わせる。

テロップとモーショングラフィックス

文字は生成に任せず、編集ソフトで載せる。フォントは1本の動画につき2種類まで。見出しと本文でウェイトを分け、登場アニメーションは0.2〜0.3秒で統一する。図解や矢印は生成より既存のテンプレートのほうが速く、正確で、修正も効く。

よくある不自然さの修正

  • 手や指の崩れ:該当カットを短く切るか、手が写らない構図に差し替える
  • 一瞬のモーフィング:その0.3秒を切り落とす、または別テイクに差し替える
  • 背景の歪み:被写体にモーションブラーを軽くかけ、視線を被写体に集める
  • 文字化けのようなノイズ:暗い背景に置き換えるか、覆いをかける

書き出し設定

用途 解像度 ビットレート目安 コーデック
縦型ショート 1080x1920 8〜12 Mbps H.264
通常動画 1920x1080 8〜12 Mbps H.264 / H.265
高品質配信 3840x2160 35〜45 Mbps H.265 / AV1

音声は48kHz、AAC 256〜320kbpsに統一。フレームレートは素材と合わせ、24fps素材を無理に60fpsで書き出すとカクつきの原因になる。HDRは配信先が対応していない限り避け、SDRで安定させる。縦動画は上下にセーフエリアを取り、UIやテロップに被らないようにする。

よくある失敗とトラブルシューティング

キャラクターの顔が毎回変わる

参照画像の枚数不足、シード未固定、プロンプトの記述ゆれが原因。3点セットで対処する。参照画像を3枚に増やす、シードを記録して固定する、人物記述をコピー&ペーストで完全一致させる。

動きが速すぎて不自然

速い動作は破綻しやすい。スローモーションで生成し、編集で速度を戻す。あるいは動作を1つに絞り、フレーム数を増やす。

生成コストと時間が読めない

解像度と尺を下げたプレビュー生成を先に行い、構図が確定したカットだけ本番生成する。並列で回せるサービスなら、優先度の高いカットから順に処理する。上限テイク数を決めておくことも重要だ。

商用利用が不安

利用規約を確認し、入力素材(顔写真、ロゴ、既存キャラクター)の権利を整理する。実在人物に似た人物、実在ブランドに似たロゴ、既存楽曲に似たBGMは避ける。声についても、本人の許諾なしに特定個人の声を模倣しない。

なんとなく安っぽい

原因の多くは音とテンポ。BGMを入れ、冒頭1秒を締め、テロップのフォントを2種類に絞る。これだけで印象は大きく変わる。

FAQ

Q1. 1本の動画を作るのに何ショット必要か

15秒の縦動画なら6〜10ショット、60秒なら15〜25ショットが目安。1ショット2〜4秒で設計し、テロップだけのカットを混ぜると制作が軽くなる。

Q2. どのモデルを最初に試すべきか

用途で決める。人物を自然に動かしたいなら人物描写に強いモデル、スタイルを固定したいなら参照画像対応が強いモデル、図解中心なら生成を使わず編集ソフトで作る。まず1カットだけ試して、手と顔の破綻率を確認するのが早い。

Q3. 生成素材だけで1本作れるか

可能だが、推奨しない。テロップ、図解、商品の寄り、ロゴの静止画など、生成に頼らないカットを3割ほど混ぜると、全体の説得力が上がり制作時間も短くなる。

Q4. 日本語プロンプトと英語プロンプトどちらが良いか

構成や物語は日本語で整理し、カメラ・光・質感のキーワードは英語を併記するのが実務的。モデルごとに得意な表現が違うため、同じ指示を両言語で試して結果を比較する価値はある。

Q5. 音声はどう作るか

音声合成でナレーションを作り、必要なら録音した本人の声と混ぜる。読み上げ速度と間を調整し、BGMと効果音を別レイヤーで重ねる。音量は配信先の基準に合わせて最終確認する。

Q6. 一貫性を保つ最短手順は

基準ショットを1つ作り、それを参照画像として残りを生成する。シードを固定し、人物と照明の記述をテンプレート化し、全カットに共通LUTを当てる。この3点で大半のばらつきは消える。

Q7. どこまで自動化すべきか

企画、台本、ショットリスト、テイク選別、最終カラー調整は人が関与したほうが品質が上がる。逆に、下書きナレーション、字幕の初稿、低解像度プレビュー、フォーマット変換は自動化に向く。

Q8. 品質を上げる最短の一手は

尺を短くすること。30秒の動画を45秒に伸ばすより、30秒を22秒に圧縮するほうが、体感品質は必ず上がる。不要なカットを削る作業は、新しいモデルを試すより効果が大きい。

まとめ:工程を分けた人が勝つ

AI動画生成の成果は、モデルの新しさではなく工程設計で決まる。目的と尺を先に固定し、ショットリストを作り、モデルを用途で使い分け、参照画像とシードで一貫性を守り、音と編集で仕上げ、配信先に合わせて書き出す。この流れを型として持っておけば、使うツールが入れ替わっても同じ品質で作り続けられる。

最初から完璧を狙う必要はない。まず15秒の縦動画を1本、6ショットで作ってみること。制作ラインを1周すると、どこに自分のボトルネックがあるかがはっきり見えてくる。そして2本目からは、そのボトルネックだけを改善すればよい。

Alexander

Alexander