AI動画制作の全体像:企画から書き出しまでの流れ
AIを使った動画制作は、プロンプトを一行入力すれば完成品が出てくる魔法ではありません。実際の現場では、企画設計、素材生成、音声と字幕の設計、編集という四つの工程を何度も往復しながら仕上げていきます。生成AIが強みを発揮するのは主に素材生成の工程で、それ以外の部分は依然として人間の判断が必要です。この構造を頭に入れておくと、「思った通りの映像が出ない」と感じたときに、修正すべき場所を切り分けられるようになります。
工程ごとの役割分担は次のように整理できます。
| 工程 | 主な作業 | 生成AIが得意なこと | 人間が決めること |
|---|---|---|---|
| 企画設計 | 目的、尺、トーン、配信先の決定 | 構成案のたたき台、タイトル案 | 誰に何を伝えるか、最終的な採否 |
| 素材生成 | カットごとの映像・画像の生成 | 短いクリップの生成、スタイル変換 | カット割り、採用するテイクの判断 |
| 音声設計 | ナレーション、字幕、BGM | 音声合成、自動字幕 | 声の印象、読み上げ速度、間の取り方 |
| 編集仕上げ | カット、色調整、書き出し | ノイズ除去、自動カラー補正 | テンポ、全体のトーン、最終尺 |
この表で重要なのは、AIに任せられる範囲が素材の生成に偏っているという点です。逆に言えば、企画と編集に時間をかけた分だけ、生成の試行回数を減らせます。多くの初心者がつまずくのは、企画を空白のままプロンプトを打ち始め、生成結果に合わせて企画を後から作ろうとするケースです。この進め方ではシーンのつながりが破綻し、何度も作り直すことになります。
もう一つの基本原則は「短く作って、つなぐ」です。現在の生成技術では、一つの長いクリップを連続性を保ったまま作るよりも、数秒単位のカットを複数生成して編集でつなぐ方が、結果的に品質が安定します。映画やCMもショットの集合体でできています。つまりこの方法は遠回りではなく王道だと考えて構いません。
作業時間の目安として、30秒の動画を初めて作る場合は、企画に20パーセント、素材生成に40パーセント、音声と字幕に15パーセント、編集に25パーセントほどの配分が現実的です。二本目以降は自分用のテンプレートが効いてくるため、生成に割く比率は自然と下がっていきます。
ステップ1:企画と脚本をAIに渡せる形に整える
最初に決める三つのこと
動画制作で最初に決めるべきは、技術ではなく前提条件です。具体的には、誰に向けた動画か、どこで再生されるか、そして何秒で伝えきるかという三点です。縦型のショート動画なのか、横型の解説動画なのかによって、画角の設計もカットの長さも変わります。テレビ番組の構成をそのまま縦型に持ち込むと、冒頭で視聴者が離脱してしまいます。
前提条件が決まったら、それを一文で書き出します。たとえば「一人暮らしを始める20代に向けて、縦型30秒で、料理器具の時短効果を伝える」という具合です。この一文があると、生成のたびに迷いが減り、不要なテイクを作らずに済みます。
尺別の構成テンプレート
15秒の場合、掴み、課題提示、解決の提示という三部構成が基本です。冒頭1秒で動きのあるカットを置き、3秒以内に視聴者の悩みを提示し、残りで解決策の映像を見せます。30秒の場合は、掴み、課題、解決、根拠、行動喚起の五部構成にすると情報量とテンポのバランスが取れます。60秒を超える場合は、章立てを意識し、10秒から15秒ごとに映像のトーンを変えると飽きられにくくなります。
尺を決めるときにやってはいけないのは、素材ありきで構成を考えることです。先に尺と構成を決め、それに必要なカット数を逆算します。30秒で6カット前後、60秒で12カット前後が目安になります。
ショットリストへの分解
脚本ができたら、各行をショット単位に分解します。一行につき一つの動作、一つのカメラワーク、一つの背景というルールで分解すると、生成時のプロンプトが自然と短く整理されます。逆に一行に複数の動作を詰め込むと、AIはどちらかを省略したり、両方を混ぜた不自然な動きを出力したりします。
ショットリストは表計算ソフトで管理するのがおすすめです。カット番号、尺、被写体、動作、カメラ、背景、必要な音の列を作っておけば、生成がうまくいかなかったカットだけを後から差し替えられます。この管理表の有無が、修正にかかる時間を大きく左右します。
ステップ2:生成方式を選ぶ(テキスト起点・画像起点・動画起点)
テキストから動画
テキストだけで映像を生成する方式は、もっとも手軽で、アイデアの検証に向いています。ただし被写体の見た目や構図を細かく指定できないため、シリーズものや同じ人物が登場する動画には向きません。ランダム性が高い分、思いがけない映像が出る楽しさもありますが、業務用途では再現性の低さが弱点になります。
画像から動画
一枚の静止画を起点に動きを加える方式は、現在もっとも安定した制作手法です。構図、配色、人物の顔立ちを先に確定できるため、複数カット間の一貫性を保ちやすくなります。静止画の制作には画像生成を、動きの付与には動画生成を使うという分担が基本です。
動画・参照素材から動画
既存の動画を参照して動きやスタイルを引き継ぐ方式は、動きの再現性が高い反面、元映像の権利確認が必要です。商用利用を想定する場合は、参照素材のライセンスを必ず確認してください。自社で撮影した素材や、権利が明確なストック素材を使うのが安全です。
どれから始めるべきか
| 方式 | 向いている用途 | 強み | 弱み |
|---|---|---|---|
| テキスト起点 | アイデア出し、抽象的な映像 | 速い、手軽 | 再現性が低い |
| 画像起点 | ストーリー動画、商品紹介 | 構図と人物を固定できる | 静止画の準備が必要 |
| 参照素材起点 | ダンス、動きの模倣 | 動きの精度が高い | 権利確認が必要 |
迷ったら画像起点から始めてください。最初に構図を決める習慣が身につくと、のちにテキスト起点を使うときも「何を固定したいか」を意識できるようになります。
ステップ3:一貫性を守るための設計とプロンプト術
キャラクター設定シートを作る
同じ人物を複数カットに登場させるなら、最初に設定シートを作ります。年齢、髪型、髪色、服装、体型、表情の傾向を箇条書きで固定し、その記述をすべてのプロンプトで使い回します。表記ゆれは厳禁です。「黒いショートヘア」と書いたら、別のカットでも同じ言葉を使います。類語に言い換えると、AIは別の人物として解釈することがあります。
背景と空間の固定
人物だけでなく、場所の記述も固定します。室内なら窓の位置、光源の方向、家具の配置を短いフレーズで定義しておきます。カットごとに背景の記述を変えると、同じ部屋のはずが毎回違う部屋に見えてしまいます。空間の連続性は、視聴者に違和感を与えないための最重要ポイントです。
スタイル語彙リスト
映像のトーンを決める言葉も、あらかじめ数個に絞ってリスト化します。シネマティック、柔らかい自然光、彩度控えめ、浅い被写界深度といった表現を、すべてのカットで共通して使います。リストが10個を超えると、どの言葉が効いているのか分からなくなるため、5個前後に絞るのが実用的です。
参照画像とシード値の使い分け
同じ構図を再現したい場合は参照画像を、同じ雰囲気を保ちたい場合はシード値を固定するのが基本です。ただしシード値を固定しても、プロンプトのわずかな違いで結果は変わります。完全な再現を目指すよりも、許容できる揺らぎの範囲を決めておく方が現実的です。
ステップ4:カメラワークとショット割りを言語化する
ショットサイズとアングル
映像の印象は、被写体をどれだけ大きく写すかで大きく変わります。全身を収める引きの画は状況説明に、胸から上の画は会話や感情に、手元や目元の寄りは強調に使います。同じカットを並べるだけで単調になるため、引きと寄りを交互に配置すると編集でリズムが生まれます。
動きの記述
カメラの動きは、被写体の動きと分けて記述すると伝わりやすくなります。被写体が歩く、振り返る、手を伸ばすといった動作と、カメラが前進する、横に流れる、ゆっくり回り込むといった動きは別の要素です。両者を混ぜて書くと、AIがどちらかを省略することがあります。
プロンプトの基本フォーマット
実務では、被写体、動作、カメラ、光、スタイルという五つの要素を順番に並べる形式が扱いやすいです。たとえば「白いシャツの女性、コーヒーカップを持つ、カメラはゆっくり前進、窓からの柔らかい朝光、落ち着いた色調」という具合です。要素を固定しておけば、うまくいかなかったときに一つずつ差し替えて原因を特定できます。
モーション過多を避ける
初心者がやりがちな失敗は、一つのカットに動きを詰め込みすぎることです。歩きながら振り返り、同時にカメラも回り込むといった指定は、破綻の原因になります。一カットにつき主要な動きは一つまでに抑えるのが安全です。物足りなさは、カットをつなぐ編集のテンポで補えます。
ステップ5:音声・字幕・BGMで作品に仕上げる
ナレーションと声の設計
音声合成を使う場合、声の印象は動画の性格を決める重要な要素です。落ち着いた解説には低めのトーン、ショート動画にはやや速めで明るいトーンが合います。読み上げ速度は、聞き手が内容を理解できる速度に調整してください。速すぎるナレーションは、情報量が多くても伝わらないという結果を招きます。
声を複数の動画で使い回す場合は、同じ話者を指定し続けることが大切です。動画ごとに声が変わると、チャンネルの一貫性が損なわれます。
字幕の読みやすさ
字幕は原則として画面下に置き、一行の文字数を抑えます。日本語の場合、一行あたり13文字から15文字程度、最大二行までが読みやすい目安です。話し言葉をそのまま書き起こすと冗長になるため、意味を変えずに短く言い換える編集作業が必要です。
専門用語や固有名詞は、初出時にだけ補足を添えると視聴者の離脱を防げます。また、字幕の表示タイミングは音声より0.2秒ほど早めに出すと、耳と目のずれが気になりにくくなります。
BGMと効果音のレイヤー
音は、ナレーション、BGM、効果音、環境音の四層に分けて考えます。ナレーションが主役の動画では、BGMは邪魔にならない音量に抑えます。逆に映像だけを見せるカットでは、BGMと効果音で情報を補います。切り替えの瞬間に効果音を一つ入れるだけで、場面転換が格段に分かりやすくなります。
ステップ6:編集とポストプロダクションの実務
つなぎ目の処理
生成したカットは、そのまま並べると不自然につながることがあります。動きの方向を揃える、前のカットの終わりの動きを次のカットの始まりに引き継ぐ、といった工夫でつなぎ目は目立たなくなります。ジャンプカットを避けたい場合は、間に背景や手元のカットを挟むと自然です。
カラーと質感の統一
カットごとに色温度や彩度がばらつくと、素人っぽさが際立ちます。編集ソフトのカラー調整機能で、全カットに共通のトーンを適用します。すべてを同じ数値にするのではなく、肌の色を基準に合わせると破綻しにくくなります。
書き出し設定
配信先に合わせて解像度と縦横比を決めます。縦型なら9対16、横型なら16対9が基本です。フレームレートは素材に合わせて統一し、途中で混在させないようにします。ビットレートを上げすぎても、配信先で再圧縮される場合は効果が限定的です。
ステップ7:無料プランと低予算で回すための運用術
制約を先に把握する
無料で使えるツールには、多くの場合なんらかの制約があります。書き出しに透かしが入る、解像度が限定される、生成できる回数に上限がある、商用利用の条件が異なるといった点です。ツールを選ぶ前に、自分が最終的に必要な品質と利用条件を書き出し、その条件を満たせるかを確認します。
特に商用利用の可否は、あとから覆せない問題です。企画の段階で確認しておけば、完成間際の手戻りを避けられます。
テストと本番を分ける
低予算で運用する最大のコツは、テストと本番を明確に分けることです。構図や動きの確認は低解像度の短いカットで行い、採用が決まったものだけを高品質で作り直します。最初から高品質で試行錯誤すると、時間も費用もあっという間に消費します。
テスト段階では、採用可否の基準を先に決めておきます。たとえば「顔の崩れがない」「手の形が不自然でない」「指定した動きが再現されている」の三点をチェックリストにすれば、判断が速くなります。
テンプレート化と素材の再利用
二本目以降の制作を速くするには、プロンプトのテンプレート化が効果的です。被写体、光、スタイルの部分を固定し、動作と構図だけを差し替える形にすれば、毎回ゼロから考える必要がありません。背景素材、効果音、字幕のスタイルも、一度作ったものを再利用します。
待ち時間の使い方
生成には待ち時間が発生します。この時間に別のカットのプロンプトを準備したり、字幕の原稿を整えたりすると、制作全体の効率が上がります。複数のカットを並行して進める習慣をつけると、待ち時間は実質的な作業時間に変わります。
よくある失敗とトラブルシューティング
| 症状 | 主な原因 | 対処法 |
|---|---|---|
| 顔がカットごとに変わる | 人物の記述が揺れている | 設定シートを作り、表現を統一する |
| 手や指が崩れる | 手の動きを指定しすぎている | 手元を写さない構図に変えるか、寄りを避ける |
| 映像がちらつく | 動きの指定が多すぎる | 一カット一動作に絞る |
| 文字が崩れて表示される | 映像内に文字を生成させている | 字幕や図は編集で重ねる |
| 動きが止まって見える | 変化のない構図を長く使っている | カットを短く切り、寄りと引きを混ぜる |
| 色味がカットごとに違う | スタイル語彙が統一されていない | 共通のスタイル指定を固定する |
これらの症状の多くは、生成の技術的な限界ではなく、指定の仕方に原因があります。うまくいかないときは、プロンプトを長くするのではなく、要素を減らして切り分ける方向に考えてください。
もう一つ見落とされがちなのが、尺の問題です。生成したカットが想定より短く、つなぐと全体が詰まって見えることがあります。この場合は、カットの前後に余白を足すか、ナレーションの間を調整して呼吸を作ります。映像の速度だけでなく、音の間も編集の対象です。
用途別ワークフローとよくある質問
縦型ショート動画
冒頭1秒に動きのあるカットを置き、3秒以内に結論の一部を見せます。縦型では人物の上半身が画面いっぱいになるため、引きの画は使いどころが限られます。テロップは中央やや上に置くと視線が集まりやすくなります。カット数は15秒で4から6、30秒で8から10が目安です。
商品紹介・サービス紹介
商品を静止画で撮影し、背景を生成してから動きを加える流れが安定します。実際の商品写真を使うことで、形状の再現性が高まります。次に使用シーン、最後に購入や問い合わせの導線を置く構成が定番です。
教育・解説コンテンツ
情報の正確さが最優先されるため、生成映像は導入や比喩表現に限定し、核心部分は図解や画面収録で補うのが安全です。ナレーションの速度を落とし、字幕を必ず付けます。章ごとに映像のトーンを変えると、長尺でも集中を保ちやすくなります。
よくある質問
Q. 無料のツールだけで商用レベルの動画は作れますか。
短尺のSNS投稿であれば十分に実用的なものが作れます。ただし透かしの有無、解像度、商用利用の条件はツールごとに異なるため、企画段階で必ず確認してください。長尺や広告用途では、有料の選択肢を併用した方が結果的に効率的です。
Q. 同じ人物を何度も登場させるコツはありますか。
人物の記述を設定シートとして固定し、すべてのプロンプトで同じ言葉を使うことが最も効果的です。加えて、構図を決める静止画を先に作り、それを起点に動画化すると揺らぎが減ります。
Q. 生成した映像が思ったより短いのですが。
短いカットをつないで構成するのが前提と考えてください。尺が足りない場合は、同じカットを速度変更したり、寄りのカットを追加したりして調整します。無理に長いクリップを生成しようとすると、後半で動きが破綻しやすくなります。
Q. プロンプトは長い方が良いのでしょうか。
いいえ。要素を詰め込みすぎると、AIが優先順位を判断できず、指示の一部が無視されます。被写体、動作、カメラ、光、スタイルの五要素に絞り、必要に応じて一つずつ追加する方が結果が安定します。
Q. 音声はどの段階で作るべきですか。
映像の構成が固まった後、編集の直前がおすすめです。先に音声を作ると、尺の制約が強くなり、映像の選択肢が狭まります。ただし尺の感覚を掴むために、仮のナレーションを早い段階で一度読んでおくと、構成の破綻に気づきやすくなります。
Q. 制作のスピードを上げるには何から手を付けるべきですか。
ショットリストのテンプレート化と、テストと本番の分離です。この二つを導入するだけで、同じ品質を保ちながら試行回数を大幅に減らせます。ツールを増やすよりも、手順を整える方が効果は大きいです。





