AIエージェント動画制作の全体像
動画制作にAIエージェントを組み込む目的は、映像を1本生成することではなく、制作プロセスそのものを再現可能な仕組みに変えることです。プロンプトを思いつきで打ち込み、良い絵が出るまで繰り返す進め方には再現性がありません。エージェント型のワークフローでは、制作者はディレクターとして企画と判断を担当し、エージェントは脚本の分解、ショットリストの生成、生成モデルの割り当て、結果の評価、再生成の指示という実務を担当します。
エージェントに任せられる工程は大きく4つに整理できます。第一に企画の構造化。曖昧なアイデアを、尺・目的・トーン・対象視聴者・必須要素に分解します。第二に工程計画。どのカットをどのモデルで、どの順番で生成するかを決めます。第三に実行。生成リクエストを投げ、結果を確認し、条件を変えて再実行します。第四に記録。どのプロンプトでどの結果が出たかを残し、次の企画で再利用できる形にします。
重要なのは、エージェントは「決める」ことより「並べる」ことが得意だという点です。最終的な演出判断、ブランドのトーン、視聴者に何を感じてほしいかは人間が握ります。この分担を最初に決めておかないと、出力は平均的で無難な映像に収束していきます。逆に、分担を明確にしておけば、10本目、50本目でも同じ品質を安定して出せるようになります。
本記事は、特定のツールに依存しない形でワークフローを組み立てるためのチュートリアルです。読み終えた時点で、自分の企画をエージェントに渡せるブリーフに変換し、カットごとの生成計画を立て、音声と編集まで一気通貫で回せるようになることを目標にします。
プリプロダクション:企画とブリーフをエージェントに渡す
ブリーフに必ず入れる7項目
エージェントの出力品質は、渡すブリーフの解像度でほぼ決まります。「カッコいい商品動画」では何も決まりません。最低限、次の7項目を箇条書きで渡すところから始めます。
- 目的:認知、理解、行動喚起のどれか。1本につき1つに絞る
- 尺:15秒、30秒、60秒、3分など。尺はカット数と1カットの長さを決める
- 公開先:縦型ショート、横型、展示用ループ、社内共有など
- トーン:静謐、疾走感、温かい、無機質、高級感など形容詞で指定
- 必須カット:商品の正面、使用シーン、ロゴ、人物の表情など
- 禁止要素:特定の色、競合を連想させる表現、避けたい構図
- 音声の有無:ナレーションの想定文字数、字幕の必要性
このうち尺と公開先は後工程のすべてに影響します。縦型15秒なら1カットあたり1〜2秒、横型3分なら3〜6秒が目安になり、必要なカットの数も種類も変わります。30秒の縦型で10〜14カット、3分の横型で30〜40カットが一つの目安です。
エージェントへの初回指示の書き方
初回の指示は、いきなり映像生成に入らず「計画を出させる」ことに使います。たとえば次のように投げます。
以下のブリーフをもとに、30秒の縦型動画のカット構成を提案してください。各カットについて、役割、秒数、被写体、カメラワーク、必要な素材の種類(実写風・イラスト風・図解)を表形式で出してください。実現が難しいカットには代替案を添えてください。
ブリーフ:(上記7項目)
この一手間が効きます。カット構成の段階で違和感を潰せば、生成のやり直しが大幅に減ります。エージェントが提案した構成に対して「3カット目と4カット目を統合」「全体を5秒短く」といった修正を対話で重ね、確定版を作ります。
人間が握るべき判断
次の3つはエージェントに委ねないほうが安全です。第一に、ブランドの言い回し。固有名詞の表記ゆれや禁止表現は機械的に判断しづらく、公開後の修正コストが大きくなります。第二に、訴求の優先順位。伝えたいことが複数あるとき、どれを落とすかは戦略判断です。第三に、最終的な色味と音のバランス。ここは人の目と耳で決めたほうが仕上がりが安定します。
モデル選定の判断基準
汎用モデルと専門モデルの使い分け
生成モデルは大きく2種類に分けて考えます。汎用モデルは、風景・人物・抽象表現まで幅広く対応し、プロンプトの解釈が安定しています。専門モデルは、特定の表現(アニメ調、図解、製品の質感、手書き風など)に強みを持ちます。
| カットの種類 | 向いているモデル | 理由 |
|---|---|---|
| 人物の演技・表情 | 汎用の動画生成モデル | 動きの自然さと一貫性を優先 |
| 製品の質感・反射 | 質感に強い専門モデル | マテリアル再現が安定 |
| 図解・データ表現 | 画像生成+モーショングラフィックス | 生成より編集のほうが速く正確 |
| 抽象的な背景 | 汎用モデル | 破綻が目立ちにくい |
| ロゴ・文字 | 生成しない(編集で載せる) | 文字化けと崩れを避ける |
もっとも多い失敗は、ロゴや文字を生成モデルで作ろうとすることです。文字は編集ソフトで載せたほうが速く、正確で、修正も効きます。
選定フローチャート
迷ったときは次の順で判断します。
- カットに人が写るか → 写るなら汎用の動画生成モデルを優先
- 製品の質感が主役か → 主役なら質感に強いモデル、あるいは静止画生成+カメラワーク付与
- 情報を伝えるカットか → 情報伝達が目的なら生成ではなく図解とテロップで作る
- 1カットあたり何秒必要か → 長回しは破綻しやすいので、短いカットに分割する
- 同じ被写体が再登場するか → 再登場するなら参照画像を使えるモデルを選ぶ
生成時間と品質のトレードオフ
高品質な設定は生成に時間がかかります。すべてのカットに最高設定を使う必要はありません。視聴者が注視するのは冒頭の3秒と、商品が映る数カットです。そこにリソースを集中し、つなぎのカットは軽い設定で量産する。この配分を決めるのもエージェントに任せられる仕事です。「注視カットとつなぎカットを分類し、それぞれに必要な品質レベルを提案してください」と指示すれば、優先順位づけのたたき台が出てきます。
ショットリストとプロンプト設計
ショットリストのフォーマット
生成を回し始める前に、ショットリストを表形式で確定させます。列は次のとおりです。
- カット番号
- 秒数
- 役割(つかみ、課題提示、解決、証拠、行動喚起)
- 被写体とアクション
- カメラワーク(固定、パン、ドリー、手持ち風)
- 画角(寄り、引き、俯瞰)
- 照明と時間帯
- 使用モデル
- 参照素材の有無
- 状態(未着手、生成済み、採用、却下)
「役割」の列が最も重要です。役割が書かれていないカットは、編集段階で「なぜここにあるのか」が分からなくなり、削除の判断ができません。
プロンプトを構造化する
動画生成のプロンプトは、語順を固定すると安定します。次の順番で書くのが扱いやすい形です。
- 被写体:誰が、何が
- アクション:何をしているか
- 環境:どこで、どの時間帯に
- カメラ:画角、動き、レンズ感
- 照明:光源の種類と方向、色温度
- 質感・スタイル:フィルム風、CG風、イラスト調など
- 除外指定:避けたい要素
たとえば「雨中の夜景を歩く人物」を撮るなら、次のようになります。
30代の人物が、雨上がりの夜の商店街をゆっくり歩いている。濡れた路面に看板の光が反射する。ミディアムショット、ゆっくりしたトラッキング、35mm相当のレンズ。光源は看板のネオンと街灯、青と橙の混色。フィルムグレインを少し加えた写実的な質感。人物が振り返る動作や、カメラの急な動きは入れない。
この構造をカットごとに埋めていくと、エージェントは差分だけを差し替えて量産できます。逆に、散文的にだらだら書くと、同じカットを再生成したときに毎回違う絵が出ます。
ネガティブ指定の扱い
除外したい要素は、モデルによって書き方が異なります。汎用モデルではネガティブプロンプト欄がある場合と、本文中に「〜は入れない」と書く場合があります。どちらが効くかは数回試せば分かります。エージェントには「このカットで避けたい要素を列挙し、各指定が有効かを検証するための比較生成の条件を出してください」と依頼すると、検証の手間を減らせます。
一貫性を保つ:キャラクター・画風・照明
3つの一貫性
シリーズ物や複数カットの動画では、次の3つの一貫性を別々に管理します。
- キャラクターの一貫性:顔立ち、髪型、服装、体格
- 画風の一貫性:色調、フィルム感、線の太さ、コントラスト
- 照明の一貫性:光源の方向、色温度、影の濃さ
まとめて「同じ雰囲気で」と指示すると、どれかが崩れます。分けて指定し、崩れた項目だけを修正するほうが速く直ります。
参照画像とキーフレームの使い方
最も確実なのは、基準となるキーフレームを1枚作り、それを参照画像として全カットに渡す方法です。手順は次のとおりです。
- キャラクターの設定画を1枚生成し、採用版を固定する
- その画像を参照として、正面・斜め・横の3方向を生成する
- 各カットの生成時に参照画像を指定する
- 生成結果のうち、設定画と大きくズレたものは再生成する
照明も同じ考え方で扱います。「この動画全体の照明は、左上からの柔らかい昼光、色温度はやや暖色」と決め、全カットのプロンプトに同じ記述を入れます。エージェントに「全カットのプロンプトに共通で入れるべき照明記述を1行にまとめてください」と依頼すれば、表記ゆれを防げます。
つなぎ目の処理
カットの切り替わりで色味が急に変わると、素人っぽさが出ます。対策は2つです。第一に、隣り合うカットの色温度を近づける。第二に、編集段階でカラーマッチングをかける。生成段階で完全に揃えるより、編集で微調整するほうが現実的です。
音声・字幕・編集工程の自動化
音声を作る順番
映像より先に音声を作ると、カットの秒数を音声に合わせて決められるため手戻りが減ります。手順は次のとおりです。
- 確定した脚本からナレーション原稿を作る
- 音声合成で読み上げを生成する
- 読み上げの長さを測り、カットの秒数に反映する
- 映像を生成する
- 最終的なタイミングを編集で詰める
読み上げ速度は1分あたり300〜350文字程度が日本語の目安です。30秒のナレーションなら150〜175文字。この数字を知っておくと、原稿の段階で尺を調整できます。
字幕の自動生成と校正
音声認識による自動字幕は便利ですが、固有名詞と同音異義語で必ず誤ります。運用としては、自動生成のあとに次の3点だけを重点的に確認します。
- 固有名詞(社名、製品名、人名)
- 数字(数量、日付、単位)
- 業界用語
字幕の表示は、1行あたり日本語で13〜16文字、同時表示は2行までが読みやすさの上限です。これを超えると視線移動が増え、映像に集中できません。
編集の自動化ポイント
編集ソフトや自動編集ツールに任せられる作業は意外に多くあります。無音区間のカット、テンポに合わせたカット割り、カラー調整のプリセット適用、書き出し設定の最適化などです。ただし、テンポの判断は作品の印象を左右するため、最終的な調整は人が行います。エージェントには「無音区間の削除候補を出し、各候補の前後3秒の波形情報を添えてください」といった形で、判断材料の整理を任せます。
品質チェックとレビュー体制
公開前チェックリスト
次の項目を順に確認します。抜けると公開後に発見して慌てることになります。
- 冒頭3秒で何の動画か分かるか
- 必須カットがすべて入っているか
- ロゴと文字が崩れていないか
- カット間に不自然な色の跳びがないか
- 音声と字幕の内容が一致しているか
- 音量がプラットフォームの基準内か
- 縦型・横型それぞれの安全領域に文字が収まっているか
- 権利処理が必要な素材が混ざっていないか
レビューの回し方
レビューは「粗い段階で多く、細かい段階で少なく」が原則です。絵コンテ段階で3人、ラフカット段階で2人、最終段階で1人が現実的な配分です。最終段階で初めて見せると、手戻りが最大になります。
エージェントをレビューに使う場合は、客観的な観点に限定します。「この動画のカット割りについて、各カットの秒数が長すぎる箇所を指摘してください」「テロップの文字数が多すぎる箇所を列挙してください」といった形です。好みの判断は人間に残します。
よくある失敗と対処法
失敗1:最初から完成品を作ろうとする
すべてのカットを高品質設定で作り、1本目に数日かけるパターンです。対策は、まず10秒のテスト動画で全工程を通すこと。生成、音声、字幕、書き出しまで一度通せば、ボトルネックがどこか分かります。
失敗2:プロンプトを毎回書き直す
カットごとに表現がばらつき、一貫性が崩れます。対策は、共通部分をテンプレート化し、可変部分だけを差し替える運用にすることです。表計算ソフトでも管理できます。
失敗3:文字を生成で作る
ロゴや商品名を生成モデルに描かせると、崩れた文字が出力されます。対策は、生成段階では文字を入れず、編集段階でテロップとして載せること。修正も容易になります。
失敗4:長回しを1カットで作る
10秒を超えるカットは破綻しやすく、途中で被写体が変形します。対策は3〜5秒に分割し、つなぎで連続性を出すこと。分割したほうが再生成のコストも下がります。
失敗5:音声を後回しにする
映像を先に作ると、ナレーションが尺に収まらず原稿を削ることになります。対策は音声先行。原稿の文字数から尺を逆算します。
失敗6:記録を残さない
採用したプロンプトと設定を残していないと、翌週に同じ絵を作れません。対策は、カット番号・プロンプト・モデル・設定・採用可否を1つの表にまとめること。エージェントに記録の整形を任せると定着します。
FAQ
Q. AIエージェントを使えば撮影は不要になりますか?
用途によります。人物の演技や商品の実物感が重要な場合、実写のほうが速く正確なことがあります。生成が向くのは、実現が難しい環境(海外、危険地帯、SF的な空間)、多数のバリエーションが必要な場面、撮影予算が取れない企画です。実写と生成を混ぜる構成も有効です。
Q. どのくらいの学習時間が必要ですか?
最初の1本は半日から1日かかると考えてください。2本目以降は工程が固定されるため、作業時間は大きく短縮されます。3本目あたりでテンプレートが固まり、以降は企画と差し替えが中心になります。
Q. どのツールから始めればよいですか?
動画生成モデル1つ、画像生成モデル1つ、音声合成1つ、編集ソフト1つ。この4つで始められます。最初から多数のツールを併用すると、それぞれの癖を覚える前に挫折します。1つの組み合わせで10本作ってから広げるのが現実的です。
Q. 生成した映像の権利はどう考えればよいですか?
利用するツールの規約を必ず確認してください。商用利用の可否、生成物の扱い、学習への利用可否はツールごとに異なります。クライアント案件では、使用ツールと規約の確認結果を記録として残すことをおすすめします。
Q. エージェントの提案が平凡に感じます。どうすればよいですか?
ブリーフの禁止要素と参照例を増やしてください。エージェントは制約が少ないほど平均的な答えを返します。「こういう表現は使わない」「この作品のこの部分の緊張感を参考にする」といった具体例を3つほど入れると、出力の個性が変わります。
Q. チームで使う場合に決めておくべきことは?
命名規則、カット番号の振り方、プロンプトのテンプレート、レビューのタイミング、書き出し設定の5つを先に決めます。これがないと、メンバーごとに別々の動画が量産され、あとで統合できなくなります。
チームで運用するときの設計
役割分担
少人数で回す場合、次の3役に分けます。ディレクター(企画と最終判断)、プロンプト担当(ショットリストと生成)、編集担当(音声、字幕、仕上げ)。1人が兼ねることもできますが、兼ねる場合は工程を分けて作業時間を確保します。
テンプレートの整備
定着させるべきテンプレートは4つです。ブリーフ用、ショットリスト用、プロンプト用、記録用。最初の1本を作りながら同時に整備すると、無理なく定着します。完成してから作ろうとすると、忙しさを理由に後回しになります。
量産と品質のバランス
本数を増やすほど、1本あたりの品質は下がりがちです。対策は、全カットに同じ品質を求めないこと。視聴者の注視が集まるカットを3割程度に絞り、そこに時間を集中させます。残りの7割はテンプレートで量産し、編集で整える。この配分が、継続的に本数を出しながら品質を保つ現実的な解です。
最後に、エージェント導入で最も効果が出るのは、生成そのものより「記録と再利用」の部分です。1本目で作ったショットリストとプロンプトのテンプレートは、2本目以降の出発点になります。10本作ったとき、ゼロから始めるチームとの差は工程の数ではなく、蓄積の差として現れます。


