Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画生成ツールで作る縦型ショート動画の制作ワークフロー完全ガイド:企画から編集・書き出しまでの手順

Oct 4, 2026

縦型ショート動画の制作をAIワークフローとして組み直す

縦型ショート動画の制作は、かつては「撮影・編集・書き出し」の三点で語られることがほとんどでした。しかし現在は、企画の段階から生成AIを組み込むことで、撮影機材も出演者もスタジオも用意せずに完成品までたどり着けるようになっています。重要なのは、AIを単発の魔法のボタンとして使うのではなく、再現性のある工程(ワークフロー)として並べることです。

ワークフローとして整理すると、ショート動画制作は大きく次の7工程に分かれます。

  1. 企画とコンセプト設計
  2. 脚本と構成の作成
  3. 絵コンテとショットリストの設計
  4. 画像生成と動画生成による素材づくり
  5. 音声・字幕・BGMの組み立て
  6. 編集と書き出し
  7. 量産体制の運用

この記事では、この7工程を順番にたどりながら、各工程で何を決め、どのツールをどの基準で選び、どこでつまずきやすいのかを具体的に解説します。特定のツールに依存しない形で書いていますので、手元の環境に合わせて読み替えてください。

ステップ1:企画とコンセプトを固める

AIは「決まっていないこと」を勝手に決めてはくれません。むしろ曖昧な指示を出すと、平均的で印象の薄い映像が返ってきます。だからこそ、生成を始める前の企画工程が最も重要です。

1本につき1メッセージに絞る

ショート動画の最大の敵は「情報の詰め込みすぎ」です。15秒から60秒の尺で伝えられるのは、実質ひとつのメッセージだけだと考えてください。

  • 悪い例:新商品の紹介+会社の理念+採用情報+キャンペーン告知
  • 良い例:「この道具を使うと作業時間が半分になる」という一点だけ

企画シートには、次の3行を必ず書き出します。

  • 誰に向けた動画か(例:在宅で動画編集を始めたばかりの人)
  • 見終わったあとに何を思ってほしいか(例:自分にも作れそうだ)
  • そのために最初の3秒で見せる映像は何か(例:完成品のビフォーアフター)

冒頭3秒のフックを設計する

縦型フィードでは、視聴者は指を止めるかどうかを一瞬で判断します。冒頭は「説明」ではなく「結果」か「違和感」から始めるのが定石です。

  • 結果提示型:完成した映像をいきなり見せる
  • 質問型:画面に短い問いを出す
  • 変化型:before/afterを1秒ずつ見せる
  • 断定型:よくある誤解を一言で否定する

AI生成に慣れていないうちは、このフックのカットだけを何パターンも生成して比較するのがおすすめです。本編を作り込む前に、冒頭だけを5案つくる。これだけで完成後の視聴維持率が大きく変わります。

ステップ2:脚本と構成を組む

企画が決まったら、尺に合わせて構成を組みます。AIにいきなり「脚本を書いて」と頼むのではなく、尺と構造を先に固定してから文章を作らせると、破綻が減ります。

尺ごとの構成テンプレート

15秒構成

  • 0〜2秒:フック(結果・問い)
  • 2〜8秒:問題の提示
  • 8〜13秒:解決策の提示
  • 13〜15秒:締めの一言

30秒構成

  • 0〜3秒:フック
  • 3〜10秒:なぜそれが起きるのか
  • 10〜22秒:具体的な方法を3ステップで
  • 22〜27秒:注意点をひとつ
  • 27〜30秒:行動を促す一言

60秒構成

  • 0〜3秒:フック
  • 3〜15秒:前提と課題
  • 15〜40秒:手順を順番に、画面で見せる
  • 40〜52秒:よくある失敗と回避策
  • 52〜60秒:まとめ

ナレーション原稿を書くときのコツ

字幕を前提にするなら、1文は20〜25文字程度に収めます。長い修飾語は削り、体言止めを混ぜるとテンポが出ます。また、原稿を書く段階で「どの文で画面が切り替わるか」をスラッシュで区切っておくと、後の編集が驚くほど楽になります。

例:「作業時間が半分になります/理由はたった一つ/道具を変えるだけです」

AIに原稿の推敲を頼む場合は、「1文25文字以内」「中学生でもわかる語彙」「専門用語は使わない」といった制約を明示すると、読み上げたときに自然な文章が返ってきます。

ステップ3:絵コンテとショットリストを作る

ここが多くの人が飛ばしてしまい、後工程で大きな手戻りが発生するポイントです。ショットリストとは、カットごとに「何を・どう動かすか」を書き出した表のことです。

ショットリストに書くべき項目

  • カット番号と尺
  • 画面の内容(被写体・背景・構図)
  • カメラの動き(固定・パン・ズームイン)
  • 光の方向と時間帯
  • ナレーションまたは字幕の文言
  • 使用する音の種類

この表があると、生成AIへの指示を1カットずつ切り出せるため、失敗したカットだけをやり直せます。逆にこれがないと、毎回ゼロから指示を作り直すことになり、絵柄も動きもばらつきます。

世界観の一貫性を保つための設定メモ

複数カットを生成するとき、人物の服装・髪型・色調・レンズ感をメモとして固定します。たとえば次のように書き出しておきます。

  • 主人公:30代前半、短髪、紺のシャツ、左手に腕時計
  • 背景:木目のデスク、白い壁、右手に窓
  • 色調:やや寒色、彩度は低め、コントラストは中庸
  • レンズ:35mm相当、被写界深度は浅め

このメモを毎回の生成指示に貼り付けるだけで、カット間の印象がそろいます。人物の同一性を保つ機能があるツールなら、参照画像と組み合わせて使いましょう。

ステップ4:画像生成と動画生成を使い分ける

素材づくりは、大きく3つのアプローチに分かれます。目的によって使い分けるのが効率的です。

テキストから動画を生成する

最も手軽な方法です。情景や抽象的なイメージ、背景映像、雰囲気カットに向いています。一方で、特定の人物を毎回同じ顔で出したい場合や、細かい手の動きを正確に再現したい場合には不向きです。

画像から動画を生成する

構図と人物の見た目を先に確定できるため、ショート動画では最も扱いやすい方法です。画像生成で納得のいく1枚を作り、それを動かすという順番にすると、失敗率が大きく下がります。

動画から動画へ変換する

既存の素材のスタイルを変えたり、フレームレートを補間したりする用途に向いています。実写素材と生成素材を混ぜたいときに有効です。

モーション指示の書き方

動きの指示は、抽象語ではなく物理的な動きで書きます。

  • 弱い指示:「いい感じに動かす」
  • 強い指示:「カメラは左から右へゆっくりパン、被写体は小さくうなずく、髪はわずかに揺れる」

また、1カットに複数の動きを詰め込むと破綻しやすくなります。1カット1アクションを原則にしてください。どうしても複雑な動きが必要なら、カットを分割して編集でつなぐほうが結果が安定します。

生成回数の上限がある環境では、解像度を落として構図だけを確認し、採用が決まったカットだけ高解像度で再生成するという二段構えが有効です。

ステップ5:音声・字幕・BGMを組み立てる

映像が8割できたとしても、音で印象は大きく変わります。ショート動画は音声オフで見られることも多いため、字幕は必須と考えてください。

合成音声と自分の声、どちらを選ぶか

  • 合成音声:収録の手間がなく、修正が容易。連続投稿に向く。
  • 自分の声:感情の起伏や信頼感を出しやすい。顔出しなしでも親近感が出る。

迷ったら、まず合成音声で最後まで完成させ、反応の良かった動画だけ自分の声で録り直すという順番が現実的です。完全な状態を目指して最初から録音を始めると、編集の途中で原稿が変わり、録り直しが発生します。

字幕の読みやすさを設計する

  • 1画面につき最大2行まで
  • 1行は全角12〜15文字程度
  • 背景とのコントラストを確保する(縁取りか半透明の帯を使う)
  • 重要な数字やキーワードだけ色やサイズを変える
  • 表示位置は画面下部の安全領域に収める

自動字幕生成を使う場合、固有名詞と同音異義語は必ず目視で確認します。誤変換は内容の信頼性を直接損ないます。

BGMと効果音の扱い

BGMはナレーションの邪魔をしない帯域に抑えます。一般的には、人の声が中心となる帯域を少し下げ、それ以外を持ち上げると聞き取りやすくなります。効果音はカットの切り替わりやテロップの出現に合わせると、テンポが伝わりやすくなります。

ステップ6:編集と書き出し

最後の工程です。ここでの判断基準は「演出の豊かさ」ではなく「離脱されないか」です。

テンポとカットの刻み方

ショート動画では、無音・無変化の区間が1.5秒を超えると離脱が増えやすいと言われます。目安として、次のいずれかを常に動かしておきます。

  • カットの切り替え
  • テロップの出現
  • 軽いズームやパン
  • 効果音

ただし、変化を詰め込みすぎると疲れる映像になります。重要な説明パートではあえて静止させ、締めの直前でテンポを上げるという緩急をつけると、最後まで見られやすくなります。

書き出し設定の基本

  • 解像度:1080×1920(縦型9:16)
  • フレームレート:30fpsまたは60fps(素材に合わせる)
  • ビットレート:1080pなら8〜12Mbps程度を目安に
  • 音声:48kHz、ステレオまたはモノラル
  • 色空間:SDRで問題ないが、素材に合わせて統一する

書き出したファイルは、必ずスマートフォンで一度再生して確認します。PCのモニターでは気づかない字幕の切れや音量差が見つかります。

ステップ7:量産体制をつくる

1本だけ作るなら手作業でも問題ありませんが、継続的に投稿するなら工程をテンプレート化する必要があります。

テンプレート化するもの

  • 編集プロジェクトの雛形(テロップのスタイル、字幕位置、音声トラック構成)
  • 生成指示のテンプレート(人物設定・色調・レンズのメモ)
  • 構成の型(15秒・30秒・60秒のテンプレート)
  • ファイル命名規則(例:テーマ_連番_日付)

バッチ制作の進め方

効率がよいのは、工程ごとにまとめて処理する方法です。

  1. 企画を5本分まとめて書き出す
  2. 5本分の脚本を一気に作る
  3. 背景素材をまとめて生成する
  4. 音声を連続で生成する
  5. 編集は1本ずつ仕上げる

1本ずつ「企画から完成まで」を回すよりも、頭の切り替えコストが減り、同じ設定を使い回せるため品質も安定します。

投稿後の見直し

投稿したら、少なくとも次の3点を記録します。

  • 冒頭3秒の離脱状況
  • 完視聴に近い視聴者の割合
  • 保存・共有の発生数

この記録を2〜3週間ためると、「どのフックが強いか」「どの尺が合っているか」が見えてきます。感覚ではなく記録で次の企画を決めるのが、継続の鍵です。

よくあるつまずきと対処法

カットごとに人物の顔や服装が変わる

原因は、生成指示に人物設定が毎回書かれていないことです。対処法は、設定メモを外部ファイルに固定し、毎回コピーして使うこと。加えて、参照画像を併用できるツールなら必ず使います。それでも解決しない場合は、顔が映るカットを減らし、手元・後ろ姿・シルエット中心の構成に切り替えるのも実用的な判断です。

動きが不自然になる

1カットに複数のアクションを指示していることが原因の多くを占めます。「歩きながら話して振り返る」のような指示は、1カットでは破綻しがちです。歩く、話す、振り返るを3カットに分け、編集でつなぐと自然に見えます。

尺が余る、または足りない

脚本の段階で尺を決めていないことが原因です。音読して秒数を数え、1秒あたり4〜5文字(日本語のナレーション目安)で逆算します。30秒なら120〜140文字程度が目安になります。

字幕がずれる、読みにくい

自動生成した字幕は、句読点の位置でタイミングがずれます。文節単位に分割し、表示時間を最低0.8秒確保すると読みやすくなります。また、話し終わりと同時に字幕が消えると目が疲れるため、0.2秒ほど余韻を残すと自然です。

音が小さい、または割れる

ナレーションのピークを-3dB程度に抑え、BGMは-18dB前後に下げます。複数の効果音を重ねると音圧が飽和するため、同時に鳴らす音は2種類までに絞るのが安全です。

同じような動画ばかりになる

テンプレートを固定すると、その代わりに表現が単調になりがちです。背景の色調、アングル、冒頭の型をそれぞれ3パターン用意し、ローテーションで組み替えるだけで印象が変わります。

よくある質問

Q. 撮影機材は本当に不要ですか

用途によります。人物の表情や声の温度感が重要な企画では、スマートフォンでの実写撮影のほうが速く、説得力も高くなります。AI生成は、実写では撮れない情景、繰り返し使う背景、大量のパターン検証に向いています。両者を混ぜるのが最も現実的です。

Q. 1本作るのにどれくらい時間がかかりますか

慣れていない段階では、15秒の動画でも3〜5時間かかることがあります。しかし工程をテンプレート化し、素材生成をまとめて行うようになると、1本あたり30〜60分程度まで短縮できます。短縮の鍵は生成速度ではなく、迷う時間を減らすことです。

Q. AI生成の映像は見分けられませんか

現在の技術でも、指の本数、文字の崩れ、髪の境界、反射の不自然さなどで見分けられることがあります。対策としては、手や文字が大きく映るカットを避ける、動きの速いカットを短くする、テロップを上から重ねるなどが有効です。完璧を目指すより、違和感の出にくい構図を選ぶほうが現実的です。

Q. 無料のツールだけで完結できますか

企画・脚本・字幕・簡易編集は無料の範囲でも十分に可能です。一方で、動画生成や高品質な音声合成は、利用量に応じた制限に当たりやすい領域です。まずは無料枠で全体の流れを体験し、ボトルネックになっている工程にだけ投資するのが合理的です。

Q. どの工程からAIに任せるべきですか

効果が大きい順に、次のようになります。

  1. 字幕の自動生成と整形
  2. 背景素材と雰囲気カットの生成
  3. 脚本の下書きと推敲
  4. 音声の合成
  5. 本編の映像生成

映像生成は最後に回すのが安全です。脚本と構成が固まっていれば、生成の試行回数を最小限に抑えられます。

Q. 同じ素材を使い回すのは問題ありますか

自分で生成した素材を再利用することは、効率化の基本です。ただし、同じカットをそのまま何度も使うと単調になります。切り出し位置を変える、色調を変える、速度を変える、別のカットと組み合わせるなど、ひと手間加えると印象が変わります。

Q. チームで制作するときの注意点は

設定メモとテンプレートを共有ファイルとして一元管理することが最重要です。担当が変わっても同じ人物設定・同じ色調・同じテロップスタイルが使えるようにしておけば、品質のばらつきを抑えられます。また、生成指示の変更履歴を残しておくと、後から「なぜこの絵柄になったのか」を追跡できます。

まとめ:工程を分けるほど、速く、安定する

AIを使った縦型ショート動画制作で成果を分けるのは、ツールの性能よりも工程の分解度です。企画、脚本、絵コンテ、素材生成、音声と字幕、編集、量産という7段階を明確に分け、それぞれに判断基準とテンプレートを持たせる。これだけで、手戻りが減り、品質が安定し、何より「次に何をすればいいか」で悩む時間が消えます。

最初から完璧なワークフローを作る必要はありません。まずは15秒の動画を1本、この7工程に沿って最後まで通してみてください。どこで詰まったかをメモしておけば、それがあなた自身のワークフローの改善点リストになります。2本目、3本目と回すうちに、テンプレートは自然と育っていきます。

最後に、迷ったときの判断基準をひとつだけ挙げるなら、「その工程は、次に作る動画でも再利用できるか」です。再利用できる形に書き残す。それが、AI時代のショート動画制作で最も価値のある習慣です。

Alexander

Alexander