テキストから動画生成で何が変わるのか
数行のテキストを入力すると、数分後には映像が返ってくる。この体験が一般的になったことで、動画制作の常識は大きく変わりました。以前なら、企画書を書き、絵コンテを描き、ロケを組み、撮影機材を揃え、編集者が何日もかけて仕上げる必要がありました。現在はその工程の多くをAIが肩代わりし、人間は「何を伝えたいか」を決める役割に集中できます。
ただし、ここで誤解が生まれがちです。「テキストを書けば自動で良い動画ができる」わけではありません。生成AIは指示のあいまいさをそのまま映像に反映します。目的が曖昧なプロンプトからは、目的が曖昧な映像しか出てきません。つまり動画制作の中心は、撮影技術から「設計と指示の技術」へと移ったのです。
本記事では、テキストから動画を生成する制作工程を、実際の業務で回せる形に分解して解説します。企画の立て方、プロンプトの書き方、モデルの選び方、キャラクターの一貫性管理、音声の統合、編集、そして量産体制の作り方までを一つの流れとして扱います。読み終えたときには、自分の目的に合ったワークフローを自分で組み立てられる状態を目指します。
AI動画制作ワークフローの全体像
最初に全体像を押さえておきましょう。テキストから動画を作る作業は、大きく6つのフェーズに分かれます。多くの失敗は、いきなり生成フェーズから始めてしまうことに起因します。
| フェーズ | 主な作業 | 成果物 |
|---|---|---|
| 1. 企画 | 目的・ターゲット・尺・トーンの決定 | 企画メモ |
| 2. 脚本 | ナレーション・セリフ・シーン分割 | シーン表 |
| 3. 設計 | プロンプト、参照画像、スタイル定義 | プロンプトセット |
| 4. 生成 | 映像・音声・BGMの生成 | 素材クリップ |
| 5. 編集 | カット、色調整、字幕、ミックス | マスター映像 |
| 6. 展開 | 縦横変換、多言語化、派生素材 | 配信用バリエーション |
重要なのは、フェーズ4の「生成」は全体の一部に過ぎないという点です。実際の制作時間で見ると、企画から設計までの上流工程が全体の質の7割を決めます。生成を何度もやり直す時間がもったいないと感じるなら、上流に時間をかけるほうが結果的に速くなります。
また、このワークフローは一直線ではありません。編集で気づいた課題を企画に戻して改善するループを2〜3回回すと、品質が安定します。最初から完璧を狙わず、短い尺で試作し、確認しながら伸ばしていく進め方が現実的です。
企画と脚本:AIに渡す前に決めるべきこと
目的・尺・配信先を先に固定する
生成を始める前に、次の3点を書き出してください。
- 誰に見せるのか(年齢層、関心、視聴環境)
- 何を行動してほしいのか(認知、登録、購買、共有)
- どこで流すのか(縦型ショート、横型広告、社内研修、展示ループ)
この3点が決まっていないと、映像のテンポもカメラワークも決まりません。たとえば縦型ショートなら、最初の2秒で注意を引き、テロップは画面中央上寄り、カット割りは1〜2秒単位が基本になります。横型の説明動画なら、画面上部に余白を残し、図解やテロップを重ねる前提で構図を設計します。
尺の目安も先に決めます。15秒、30秒、60秒、3分では、必要なシーン数がまったく違います。1シーンあたり3〜5秒で計算すると、30秒なら6〜10シーン、60秒なら12〜20シーンが目安です。
シーン表に分解する
脚本は「文章」ではなく「表」にします。縦軸にシーン番号、横軸に「役割」「映像内容」「セリフ・ナレーション」「尺」を置きます。ここで各シーンの役割を必ず言葉にしてください。導入なのか、課題提示なのか、解決策なのか、証拠なのか、行動喚起なのか。役割が書かれていないシーンは、編集時に削る候補になります。
シーン表の例を示します。
| # | 役割 | 映像内容 | ナレーション | 尺 |
|---|---|---|---|---|
| 1 | 導入 | 朝の街並みを歩く人物、逆光 | 「毎朝の10分が、一日を変える」 | 4秒 |
| 2 | 課題 | 机に散らかる書類、俯瞰 | 「やるべきことは、増える一方で」 | 5秒 |
| 3 | 解決 | ノートに手書きで予定を書く手元 | 「書き出すだけで、順番が見えてくる」 | 4秒 |
| 4 | 証拠 | 完成した手帳のページめくり | 「続けた人は、もう迷わない」 | 4秒 |
| 5 | 行動 | 商品を手に取る、白背景 | 「今日から始めよう」 | 3秒 |
この表があるだけで、生成時の指示が具体的になります。「朝の街並み」ではなく「逆光の中を歩く人物の後ろ姿、浅い被写界深度」と書けるためです。
プロンプトの基本構文をそろえる
映像生成のプロンプトは、次の順序で書くと安定します。
- 被写体(誰が、何が)
- 動作(何をしているか)
- 環境(どこで、時間帯、天候)
- 構図とカメラ(寄り・引き、固定・パン、レンズ感)
- 光と色(光源の方向、色温度、コントラスト)
- 質感とスタイル(実写風、アニメ調、フィルム粒子、CG)
- 除外したい要素(不要な文字、余計な人物、ロゴ)
たとえば「女性が歩く、公園、昼、ミディアムショット、自然光、柔らかい色調、実写風、テキストなし」のように並べます。1行にまとめる必要はなく、項目ごとに改行しても構いません。モデルによって得意な書き方が違うため、同じ内容を短縮版と詳細版の2種類用意しておくと、切り替えが楽になります。
避けたい書き方も覚えておきましょう。「美しい映像」「かっこいい感じ」といった抽象語は、モデルにとって情報量がほぼゼロです。抽象語を思いついたら、必ず具体的な視覚要素に置き換える癖をつけてください。
生成モデルの選び方:5つの判断基準
質感とスタイル適性
一口に映像生成モデルといっても、得意な絵柄は異なります。実写の人物表現に強いもの、イラストやアニメ調に強いもの、3D的なCG表現に強いもの、抽象的なモーショングラフィックスに強いものがあります。まずは自分の作りたいトーンを決め、そのトーンに合うモデルを2〜3本試すのが効率的です。
実写系では Runway、Kling、Luma、Sora などが代表的な選択肢です。イラストやアニメ寄りの表現では、Stable Diffusion 系のワークフローや ComfyUI を使った画像生成と組み合わせる方法が現実的です。実写でもアニメでも「動きの質感」はモデルごとに差が出るため、同じプロンプトで比較テストを行うことをおすすめします。
尺・解像度・フレームレート
1回の生成で作れる尺はモデルごとに異なります。短いクリップを多数つないで構成するのか、長めのカットを少数使うのかで、選ぶべきモデルが変わります。
- ショート動画中心なら、3〜5秒のクリップを大量に生成して編集でテンポを作る
- 説明動画なら、8〜10秒の安定したカットを少数生成して図解を重ねる
- シネマティックな演出なら、カメラワークが滑らかなモデルを優先する
解像度は配信先の要求に合わせます。縦型なら1080×1920、横型なら1920×1080が基本です。生成時に低解像度で作り、編集でアップスケールする流れも有効ですが、人物の顔はアップスケールで破綻しやすいため、重要なカットは最初から高解像度で生成するほうが安全です。
一貫性と参照機能
シリーズものや商品紹介では、同じ人物・同じ商品が複数カットに登場します。このとき重要になるのが、参照画像を渡せるか、同じシード値を固定できるか、キャラクター定義を保存できるかという機能です。
一貫性を保つ手段は主に3つあります。参照画像を与える、シード値を固定する、そして学習済みの追加モデルを使う。いずれも完璧ではなく、角度が大きく変わると別人に見えることがあります。そのため、同じ人物は「正面」「斜め45度」「横顔」の3カットだけに絞るなど、見せ方を設計でカバーするのが実務的です。
音声・リップシンク
話している人物を出す場合、リップシンクの品質が仕上がりを左右します。音声を先に作り、それに口の動きを合わせる流れが一般的です。ElevenLabs などの音声生成でナレーションやセリフを作り、映像側でリップシンクを適用する、あるいは音声と映像を同時に扱えるモデルを選ぶという選択肢があります。
日本語のリップシンクは、母音の口の開きが英語より小さく、崩れが目立ちにくい反面、子音の動きが乏しく見えることがあります。顔のアップを避け、バストアップ以上で撮る構図にすると、違和感を大幅に減らせます。
処理時間と再利用性
制作を継続するなら、1本あたりの処理時間と、同じ設定を再利用できるかが重要になります。試作段階では速いモデル、本番カットでは高品質なモデルというように、工程ごとに使い分けるのが現実的です。
また、生成したクリップは必ずフォルダを分けて保存し、使用したプロンプト・参照画像・シード値・モデル名をメモとして残してください。数週間後に「あのカットをもう一度」となったとき、記録がなければゼロからやり直すことになります。
キャラクターとスタイルの一貫性を守る方法
参照画像とシード値を固定する
最初に決めるべきは「基準カット」です。主人公であれば、表情が自然で照明が素直な1枚を基準に選びます。この基準カットを参照画像として全カットに渡し、シード値も可能な範囲で固定します。
服装・髪型・アクセサリーは、カットごとに変えないでください。生成モデルは小さな差異を増幅させます。シーンが変わっても服装を固定し、背景と光だけを変えるほうが、視聴者には自然に映ります。
スタイルガイドを言語化する
一貫性は画像だけでなく言葉でも管理します。次の項目を文章として定義し、全プロンプトに共通で貼り付けます。
- 色調(例:彩度低め、青みの影、ハイライトは暖色)
- 光(例:逆光気味、柔らかい拡散光、光源は画面左上)
- レンズ感(例:35mm相当、浅い被写界深度、軽い歪み)
- 質感(例:微細なフィルム粒子、わずかなハレーション)
- 禁止事項(例:画面内の文字、ロゴ、余計な人物)
この共通ブロックをテンプレート化しておけば、シーンごとの差分だけを書き換えれば済みます。
破綻したときのリカバリ手順
一貫性が崩れたときは、次の順序で対処します。
- 参照画像を見直す(表情・角度・照明が極端でないか)
- プロンプトから曖昧な形容詞を削る
- シード値を変えて3回試す
- 構図を変える(顔のアップを避ける)
- どうしても合わなければ、そのカットを削って別の見せ方に置き換える
最後の選択肢を軽視しないでください。編集で解決できる問題に、生成で何時間も費やすのは効率が悪いものです。手元だけを映す、後ろ姿にする、背景に人物を置くといった演出で回避できるケースは非常に多くあります。
音声・BGM・字幕をまとめて設計する
映像のクオリティは、音で大きく変わります。逆に言えば、映像が多少粗くても、音が整理されていれば作品として成立します。
ナレーションは、映像生成の前に作ることを強くおすすめします。音声の長さがそのままシーンの尺を決めるため、後から映像を合わせるより、先に音を確定させるほうが破綻が少ないのです。読み上げ速度は1分あたり280〜320字程度が聞き取りやすい目安です。
BGMは、動画全体のトーンを決める要素です。ただし音量バランスを誤ると、ナレーションが聞き取れなくなります。目安として、ナレーションを基準にしたとき、BGMは-18〜-24dB程度まで下げ、ナレーションの帯域(おおよそ200Hz〜4kHz)を軽く抑える処理を入れると聞き取りやすくなります。
字幕は、後工程ではなく設計段階で想定します。縦型では画面下部の安全領域を避け、中央やや上に配置するのが無難です。1行あたりの文字数は、縦型なら13〜15字、横型なら20〜24字が読みやすい上限です。自動文字起こしは Whisper 系のツールで下書きを作り、固有名詞と数字だけは必ず人間が確認してください。
音声を扱う際の注意点として、声の使用許諾と、学習元に関する規約の確認があります。商用利用の可否はツールごとに異なるため、制作前に必ず利用条件を確認する習慣をつけましょう。
編集と仕上げ:素材を作品に変える工程
生成されたクリップは、素材であって作品ではありません。ここからの編集工程が、視聴維持率を大きく左右します。
カットのリズムを作る
最初の2秒で視聴者の注意を掴み、その後は1〜3秒単位でカットを切り替えるとテンポが出ます。ただし全てを短くすると疲れるため、重要なメッセージの前後には1秒程度の余白を入れます。この「間」があることで、情報が記憶に残りやすくなります。
編集ツールは、DaVinci Resolve、Premiere Pro、Final Cut Pro、CapCut など、使い慣れたもので構いません。AI生成素材はフレームレートや色空間がばらつきやすいため、プロジェクトの設定を最初に統一し、クリップごとにフレームレートを変換してから並べるのが安全です。
色と質感をそろえる
モデルごとに色味が違うため、カットをまたぐと色が跳ねます。簡易的には、全カットに共通のルック(コントラスト、彩度、色温度)を適用し、前後のカットと見比べながら微調整します。肌の色を基準にすると判断しやすくなります。
粒子やハレーションなどの質感エフェクトを全カットに薄くかけると、生成由来のわずかな粗さが目立たなくなり、統一感が生まれます。
仕上げの確認項目
書き出し前に、次を必ず確認してください。
- 冒頭2秒で内容が伝わるか
- テロップの誤字、数字の誤りがないか
- 音量が配信先の基準に収まっているか(一般的に-14〜-16 LUFSが目安)
- 縦型・横型・正方形のいずれが必要か
- 先頭と末尾に不要なフレームが残っていないか
量産体制のつくり方:テンプレート化と自動化
1本作れるようになったら、次は同じ品質で複数本を作れる仕組みに移行します。
テンプレート化する要素
- シーン表のひな形(役割・尺・構図のパターンを固定)
- プロンプトの共通ブロック(スタイル定義)
- テロップの位置・フォント・サイズ
- BGMの候補リストと音量プリセット
- 書き出し設定のプリセット
これらをファイルとして保存し、新規案件では複製して使います。ゼロから作るのではなく、既存の型を差分更新するほうが、品質が安定し、作業時間も短くなります。
バッチ処理とキュー管理
複数カットをまとめて生成する場合、処理は非同期で走ります。生成待ちの間に別の作業を進められるよう、シーン番号ごとにフォルダを切り、生成結果が届いたら自動でリネームして格納する運用にすると混乱しません。
各クリップのファイル名には、シーン番号・テイク番号・モデル名を入れておきます。例として s03_take2_kling.mp4 のようにしておけば、編集時に差し替えが容易です。
品質チェックの分担
量産時にもっとも事故が起きやすいのは、公開前の確認漏れです。チェック項目をリスト化し、映像・音声・テロップ・権利の4区分で担当を決めておきます。特に、生成した人物が実在の人物に似ていないか、商標やロゴが映り込んでいないかは、公開前に必ず目視確認してください。
よくある失敗とトラブルシューティング
動きが不自然・カクつく
原因として多いのは、プロンプトに相反する動きが含まれているケースです。「歩きながら振り返り、同時に手を振る」のような複数動作は破綻しやすくなります。1カット1動作を原則にし、複数の動きが必要ならカットを分けてください。
キャラクターがカットごとに別人になる
参照画像の品質、シード値の固定、構図の変更の3点を順に確認します。特に顔のアップは角度の変化に弱いため、バストアップ以上で統一するのが有効です。
手指・文字が崩れる
手指と文字は現行モデルでもっとも崩れやすい要素です。手指は画面外に出す、手袋や小物で隠す、浅い被写界深度でぼかすといった回避策が有効です。文字は生成に任せず、編集ソフトでテロップとして載せるのが基本です。
尺が足りない・長すぎる
生成クリップが想定より短い場合は、同じカットをスロー再生して尺を伸ばす、あるいは別アングルのカットを挿入します。逆に長すぎる場合は、動きの山場だけを使い、前後をトリムします。生成のやり直しよりも、編集で調整したほうが速いケースがほとんどです。
なんとなく安っぽく見える
多くの場合、原因は光とリズムです。光の方向がカットごとにバラバラだと、素人っぽさが出ます。全カットで光源の方向をそろえ、カットの長さに強弱をつけるだけで、見違えるほど整います。
よくある質問と実践チェックリスト
初心者はどの工程から始めるべきですか
企画とシーン表から始めてください。いきなり生成を触ると、指示の不足を映像の質でしか判断できず、改善点が見えません。まず5シーン、合計20秒程度の短い企画を1本完成させることを目標にすると、全体像がつかめます。
生成AIだけで完結させるべきですか
完結させる必要はありません。図解、テロップ、実写の手元素材、スクリーンショットなどを混ぜるほうが、情報量が増え、生成映像の弱点も隠せます。AIは素材制作の一部として捉えるのが現実的です。
どのくらいの頻度でモデルを乗り換えるべきですか
乗り換え自体を目的にしないでください。現在のモデルで明確な課題(動きの不自然さ、一貫性の欠如など)が出たときだけ検討します。乗り換える場合は、同じシーン表とプロンプトで比較テストを行い、編集の手間まで含めて判断します。
音声はどのタイミングで作りますか
映像より先です。音声の尺がシーンの尺を決めるためです。ナレーションを先に収録・生成し、その波形に合わせて映像のカット割りを決めると、編集が格段に楽になります。
権利関係で気をつけることは何ですか
生成モデルの利用規約、学習データの扱い、商用利用の可否、そして生成物が既存の著作物や実在人物に似ていないかの確認です。特に広告用途では、公開前の法務確認を工程に組み込んでおきましょう。
実践チェックリスト
制作を始める前に、以下を確認してください。
- 目的・ターゲット・配信先・尺を書き出した
- シーン表を作り、各シーンに役割を割り当てた
- プロンプトの共通スタイルブロックを定義した
- 基準カットを選び、参照画像とシード値を記録した
- ナレーションを先に作り、尺を確定した
- テロップの位置と文字数を決めた
- 書き出し設定と音量基準を確認した
- 権利・類似性チェックの担当を決めた
- 生成ログ(モデル名・プロンプト・テイク番号)を保存した
- 2秒の冒頭で内容が伝わるか確認した
テキストから動画を作る作業は、一回の生成で奇跡を狙うものではありません。設計を丁寧に行い、短いループで改善を重ね、記録を残して再利用する。この地味な積み重ねが、安定した品質と制作速度につながります。まずは20秒の1本から始めて、ワークフローを自分の手に馴染ませていきましょう。

