Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画制作ワークフロー実践ガイド:企画から書き出しまでの全工程を解説

Sep 27, 2026

AI動画制作は、少し前まで「面白い実験」の域を出ないものでした。しかし生成モデルの精度が上がり、編集ソフトや音声ツールとの連携が当たり前になった現在では、個人でも短編映像や商品紹介、解説コンテンツを短時間で組み立てられます。ところが、いきなりツールを開いてプロンプトを打ち始めると、カットごとに画風がばらつき、音と映像が噛み合わず、使えない素材だけが大量に残るという結果になりがちです。

この記事では、AI動画制作を「企画 → 設計 → 生成 → 音声 → 編集 → 書き出し」という工程に分割し、各段階で何を決め、どのツールをどう使い分け、どこでつまずきやすいのかを実務目線で整理します。特定のサービスに依存しない汎用的な手順としてまとめているため、ショート動画、商品プロモーション、音楽ビデオ、企業の採用動画など、目的が変わっても同じ骨格を使い回せます。

AI動画制作の全体像:工程を分けて考える理由

品質差の大半は「最初の30分」で決まる

AI動画の仕上がりを左右するのは、生成モデルの性能差よりも事前設計の差です。同じモデルを使っても、目的・トーン・尺・カット数・画面比率を先に決めておくだけで、生成のやり直し回数は驚くほど減ります。逆にこれらを決めずに走り出すと、3カット目あたりで「この映像は何を伝えたいのか」が分からなくなり、全部作り直すことになります。

特に効くのが「誰に、どこで、何秒で見せるか」の3点です。縦型のショート動画なら冒頭1.5秒で引き込み、横型の解説動画なら最初の10秒で結論を出す、といった前提が決まれば、カットの長さもテンポも自ずと決まります。

標準的な6工程と所要時間の目安

実際の制作は、おおむね次の6工程に分かれます。

  1. 企画・コンセプト設計(30分〜2時間):目的、ターゲット、尺、トーン、配信先を決める
  2. 脚本・絵コンテ・ショットリスト(1〜3時間):カット数、各カットの内容、セリフ、尺を書き出す
  3. 映像生成(2〜8時間):モデル選定、プロンプト設計、複数案の比較、採用判断
  4. 音声制作(1〜3時間):ナレーション、セリフ、BGM、効果音
  5. 編集・整音・カラー調整(2〜6時間):カット、テンポ調整、音量バランス、色の統一
  6. 書き出し・確認・配信(30分〜1時間):解像度、ビットレート、字幕、サムネイル

初めての一本なら、この倍の時間を見込んでおくと安心です。慣れてくると「生成」よりも「選ぶ」作業に時間が移り、最終的には判断の速さがそのまま制作速度になります。

手戻りを減らす3つのチェックポイント

工程を分ける最大の目的は、後戻りを減らすことです。具体的には、(1) 絵コンテ確定前に映像生成を始めない、(2) 全カットの生成が終わる前に編集を始めない、(3) 音声を後回しにしない、という3点を守るだけで無駄が大幅に減ります。特に音声は、映像の尺を確定させる重要な要素です。ナレーションの長さが分からないままカットを切ると、必ず尺が余るか足りなくなります。

ステップ1:企画とコンセプト設計

目的から逆算して企画を立てる

企画の出発点は「作りたいもの」ではなく「達成したいこと」です。商品の認知を広げたいのか、問い合わせを増やしたいのか、ポートフォリオとして見せたいのかで、必要な情報量も尺も変わります。認知目的なら1本30秒で完結する印象的な映像、説明目的なら90秒から3分の構成が向いています。

また、配信先を最初に固定しておくと判断がぶれません。縦型9:16はスマートフォンの全画面表示に向き、横型16:9は解説や比較に向き、正方形1:1はフィード表示との相性が良い形式です。マルチ配信を想定する場合は、横型で作って縦型にクロップするのではなく、最初から縦型用に構図を設計したほうが破綻が少なくなります。

コンセプトシートに書くべき7項目

制作前に、次の7項目を1枚にまとめておきます。

  • 目的と成功条件(再生数、クリック率、問い合わせ数など)
  • ターゲットと視聴シーン(通勤中、就業中、就寝前など)
  • 尺と画面比率
  • トーン(硬質、温かい、コミカル、近未来的など)
  • 映像のルック(実写調、フィルムグレイン、アニメ調、3D調)
  • 必須要素(ロゴ、商品名、禁止表現、法的表記)
  • 納品形式(解像度、フレームレート、字幕の有無)

このシートがあると、生成中に迷ったときの判断基準になります。「なんとなくかっこいい」で採用したカットは、後から必ずトーンから外れます。

尺とトーンの設計

尺は「伝えたい情報量 ÷ 1カットあたりの情報量 × カットの平均秒数」で概算できます。たとえば3つの要点を伝える30秒の動画なら、導入3秒、要点それぞれ6秒で18秒、結論6秒、余韻3秒といった配分です。この配分を先に決めておくと、カット数が自然に確定します。

トーンは言葉だけで指定するより、参照画像や参照映像を2〜3点用意したほうが伝わります。自分用のメモであっても、参照があるとプロンプトの語彙が安定し、生成結果のばらつきが小さくなります。

ステップ2:絵コンテとショットリストの作り方

ショットリストは「表」で作る

絵コンテをきれいに描く必要はありません。重要なのは、カットごとに「何が映るか」「どう動くか」「何秒か」「どんな音が鳴るか」を一行で書いたショットリストです。表計算ソフトで十分機能します。

列の例は、カット番号/尺/画面の内容/カメラの動き/セリフ・ナレーション/効果音/備考です。この表があると、生成時のプロンプトをほぼそのまま流用でき、編集時にもタイムラインの設計図になります。

カット割りのテンポ設計

一般的に、視聴者の注意を保ちやすいカットの長さは2〜4秒程度です。ただし全てを短くすれば良いわけではなく、強調したいカットは前後を短くして相対的に長く見せる、といった緩急が効きます。導入は短く、説明はやや長め、結論は短く切る、というリズムが基本形です。

また、生成モデルは「1カット=1アクション」のほうが破綻しにくい特性があります。1つのカットに歩行と振り向きと発話を同時に入れると、手足や顔が崩れる確率が跳ね上がります。動作を分割してカット数を増やすほうが、結果的に作業時間は短くなります。

生成しやすい構図と避けたい構図

生成が安定しやすいのは、被写体が画面中央付近にあり、背景がシンプルで、光源の方向が明確な構図です。逆に、鏡や水面の反射、多数の人物が重なる群衆、画面端で切れた手指、細かい文字が並ぶ看板などは崩れやすい要素です。これらは絵コンテの段階で回避するか、編集で差し替える前提で設計します。

ステップ3:映像生成モデルの選び方

判断基準を6つの軸で言語化する

モデル選びで迷ったときは、次の6軸で比較します。

  1. ルックの再現性:実写調、アニメ調、3D調のどこが得意か
  2. 動きの大きさ:静的なカメラワーク向きか、激しいアクション向きか
  3. 一貫性:同一人物・同一画風を維持できるか
  4. 尺:1回の生成で得られるクリップ長
  5. 制御方法:テキスト指示、参照画像、カメラ指定などの対応範囲
  6. 反復のしやすさ:同じ設定で再生成しやすいか

たとえば人物の顔を固定して複数カットをつなぐ作品では、一貫性と参照画像対応が最重要になります。逆に風景の空撮風カットを量産するなら、動きの大きさとクリップ長が優先されます。

プロンプトの基本構造

プロンプトは、次の順序で組み立てると安定します。

  • 被写体(誰が/何が)
  • 動作(何をしているか)
  • 場所と時間帯(どこで/いつ)
  • カメラ(距離、アングル、動き)
  • 光と質感(逆光、柔らかい光、フィルム粒子など)
  • スタイル(色調、レンズ感、参考にしたい表現)
  • 除外したい要素(文字が入らない、余計な人物を出さないなど)

長ければ良いわけではなく、曖昧な形容詞を重ねるより、具体的な名詞と動作で指定するほうが効きます。「美しい」「すごい」といった主観語は、結果のばらつきを増やすだけになりがちです。

一貫性を保つ4つのテクニック

一貫性はAI動画最大の課題です。実務で効果が高いのは次の4つです。

第一に、参照画像を固定する方法です。同じ人物画像を全カットの入力に使い、プロンプト側では動作とカメラだけを変えます。

第二に、カットを分割しすぎないことです。同じ人物が映るカットは連続させ、カメラアングルを極端に変えないほうが同一性を保ちやすくなります。

第三に、ルックを後工程で揃える方法です。生成段階では色調のばらつきを許容し、編集で全カットに同じカラー調整とグレインをかけて統一感を作ります。

第四に、採用カットを絞ることです。似たカットを複数並べると差が目立ちます。テンポよく切り替わる編集では、ばらつきは視聴者にほとんど気づかれません。

ステップ4:音声・音楽・ナレーションの設計

ナレーションは先に作る

音声を作る順番は、映像よりも先がおすすめです。理由は単純で、音声の長さが尺を決めるからです。読み上げ原稿を確定し、実際に音声化して秒数を測り、その秒数に合わせてカットを割り当てます。

読み上げ原稿は、1文を40〜60文字程度に収めると聞き取りやすくなります。漢語が続く文は、ひらがなに開くか、間に短い接続詞を挟むと自然な抑揚になります。数字や専門用語は、読み方を指定できる形式で管理しておくと後工程が楽になります。

BGMと効果音の役割分担

BGMは感情の土台を作り、効果音は情報の区切りを作ります。BGMを最後まで一定音量で流すと単調になるため、導入は静かに、山場で一段上げ、結論で抜くという3段階の設計が基本です。

効果音は、カットの切り替わり、テキストの出現、数値の強調など、視聴者の視線を誘導したいタイミングに置きます。多用すると安っぽく聞こえるため、1本あたり5〜10箇所程度に絞ると洗練されて聞こえます。

リップシンクとセリフの扱い

人物が話すカットは難易度が高く、口の動きと音声のズレが最も目立つ部分です。対策としては、顔の正面アップを避けて斜めや後ろ姿にする、話している最中にカットを切り替える、セリフを短くする、といった方法があります。どうしても正面の会話が必要な場合は、音声を先に確定させ、それに合わせて映像を生成し、最後に編集で数十フレーム単位の微調整を行います。

ステップ5:編集とポストプロダクション

粗編集でテンポを決める

編集の第一段階は、生成したクリップを並べて尺を確認する粗編集です。ここでは色も音も触らず、順番と長さだけを調整します。この段階で「間延びしている箇所」を削り、冒頭3秒を最も強いカットに差し替えます。

AI生成のクリップは、始まりと終わりに不要なフレームが含まれることが多いため、前後を数フレームずつ切るだけで見違えるほど自然になります。

ルックの統一とカラー調整

次に、全カットに共通のカラー調整を適用します。手順としては、基準となるカットを1つ決め、露出、ホワイトバランス、コントラスト、彩度を整え、その設定を他のカットにコピーします。最後に全体へ軽いグレインや軽微なぼかしを加えると、生成モデルごとの質感差が目立たなくなります。

カラーの方向性は、コンセプトシートのトーンと一致させます。清潔感を出したいならハイキーで彩度控えめ、緊張感を出したいならシャドウを締めて寒色寄りに、といった具合です。

音量バランスと整音

ナレーション主体の動画では、ナレーションを基準にBGMを-18〜-12dB程度下げ、効果音をその中間に置くのが目安です。スマートフォンのスピーカーで確認し、ナレーションの言葉が聞き取れるかを必ずチェックします。イヤホンだけで確認すると、低音が過剰なミックスになりがちです。

書き出し設定の実務

書き出しは配信先の仕様に合わせます。横型16:9・1080p・30fpsは最も汎用性が高く、縦型9:16・1080×1920はショート向けの標準です。ビットレートは1080pで8〜12Mbps程度を目安にし、動きの多い映像では少し高めに設定します。字幕は必ず焼き込み前に誤字を確認し、可能なら別ファイルでも書き出しておくと再利用が容易になります。

よくある失敗とトラブルシューティング

画風がカットごとにばらつく

原因は、プロンプトの語順やスタイル指定がカットごとに変わっていることです。対策は、共通のスタイル記述をテンプレート化し、全カットで同一の文言を使うことです。加えて、編集でルックを統一する処理を必ず入れます。

手指・文字・小物が崩れる

現行のモデルでも、手指や細かい文字は崩れやすい領域です。対策は3つあります。手指を画面に入れない構図にする、文字は生成せず編集でテキストとして重ねる、小物は単純な形状のものに置き換える。特に文字を生成で出そうとすると失敗率が高いため、テキストは後乗せが鉄則です。

動きが不自然、または尺が足りない

動きの不自然さは、1カットに複数の動作を詰め込んだときに起きやすくなります。動作を分割し、クリップを短くして数を増やすと安定します。尺が足りない場合は、同じクリップを速度変更して伸ばすのではなく、別アングルのカットを挿入してつなぐほうが破綻しません。

音と映像のズレ

ズレの多くは、編集時にクリップをトリミングした際の音声側の追随漏れが原因です。対策として、音声を先にタイムラインへ配置し、映像を後から合わせる順序で作業します。

権利・ライセンス・商用利用の確認

利用するモデル、音源、素材、フォントにはそれぞれ利用条件があります。商用利用の可否、生成物の扱い、クレジット表記の要否は、制作前に確認して記録しておきます。特に楽曲とフォントは見落としやすい項目です。判断に迷う場合は、条件が明確なライブラリから選ぶのが安全です。

制作効率を上げる運用のコツ

テンプレート化して迷いを消す

毎回ゼロから設計すると、判断のたびに時間が消えていきます。プロンプトの雛形、ショットリストの表、編集プロジェクトの初期設定、書き出しプリセットをテンプレートとして保存しておけば、実質的な作業時間は半分近くまで縮みます。

バージョン管理とレビューの回し方

ファイル名には日付と版番号を含め、プロンプトの変更履歴もテキストで残します。レビューは「構成」「映像」「音」の3観点に分け、それぞれ別のタイミングで確認すると指摘が混ざりません。修正依頼は口頭ではなく、タイムコード付きで記録すると手戻りが減ります。

分業する場合の引き継ぎ設計

複数人で進める場合は、工程の境界を明確にします。企画担当がコンセプトシートとショットリストを確定し、生成担当がカットを量産し、編集担当が尺と音を整える、という分担です。引き継ぎ時のルールは「未確定要素を残さない」こと。特に尺と音声は、後工程が最初に必要とする情報です。

よくある質問

Q. 生成モデルは1つに絞るべきですか

A. 目的別に2〜3種類を使い分けるのが現実的です。人物の一貫性に強いもの、風景や動きに強いもの、短いクリップを量産しやすいものを組み合わせ、編集でルックを揃える運用が効率的です。

Q. 1本あたり何カットが目安ですか

A. 30秒なら10〜15カット、60秒なら20〜30カットが目安です。カットが少ないと単調になり、多すぎると制作コストが増えるため、要点の数から逆算して決めます。

Q. 映像生成と編集はどちらを先に学ぶべきですか

A. 編集の基礎を先に押さえることをおすすめします。カットのつなぎ方、テンポ、音量バランスが分かると、生成時にどのカットが必要かが明確になり、無駄な生成が減ります。

Q. 生成に時間がかかりすぎます

A. 解像度を下げて構図と動きを検証し、採用が決まったカットだけ高解像度で再生成する二段階方式にすると、待ち時間を大幅に削減できます。

Q. 音声は合成と収録のどちらが良いですか

A. 量産と修正のしやすさなら合成、温度感と信頼感が重要な場面なら収録が向いています。ナレーションは合成、要所のセリフだけ収録というハイブリッドも有効です。

Q. スマートフォンだけで完結できますか

A. 短尺の縦型動画であれば十分可能です。ただしカラー調整と音量バランスの確認は、できれば大きな画面とスピーカーで行うと仕上がりが安定します。

まとめ:工程を守ることが最短ルート

AI動画制作で最も多い失敗は、ツールの性能不足ではなく、工程の飛ばしです。企画とコンセプトを固め、ショットリストで尺を確定し、音声を先に作り、生成は1カット1アクションで進め、最後に編集でルックと音量を揃える。この順序を守るだけで、完成までの時間とやり直しの回数は大きく減ります。

最初のうちは1本作るのに丸一日かかっても問題ありません。2本目、3本目と重ねるうちに、どの工程を短縮できるかが見えてきます。大切なのは、毎回同じ手順をなぞり、うまくいった設定を記録に残すことです。記録が溜まれば、AI動画制作は「その都度賭けをする作業」から「再現性のある制作フロー」へと変わっていきます。

Alexander

Alexander