AIディレクターと協働する制作フローの全体像
映像制作の工程は、大きく四つに分けられます。脚本、絵コンテ、カット生成、編集です。生成AIが劇的に短縮したのは主に三番目と四番目ですが、実際に現場でボトルネックになるのは一番目と二番目です。脚本の意図を読み取り、それをカット割りに変換し、各カットの画を具体的にイメージする。この「演出の翻訳」作業にこそ時間と経験が要ります。
ここで登場するのがAIディレクターという考え方です。人間の監督を置き換えるものではなく、脚本を解析して演出上の論点を洗い出し、絵コンテの叩き台を作り、映像生成モデルに渡すための指示文へ翻訳する補助役です。人間は意思決定に集中し、AIは反復作業と量産を担当します。
協働の基本サイクルは次の四段階です。
- 脚本を構造化する。シーン、登場人物、感情の起伏、尺を表形式に落とす。
- 演出の意図を明文化する。このシーンで一番見せたいものは何かを一行で書く。
- 絵コンテを生成する。カット単位で構図とショットサイズを確定させる。
- 映像モデルへ渡す。カットごとにプロンプトと参照素材を用意して生成する。
この流れを回すと、30秒から60秒の短尺映像であれば、企画から初稿までを数時間で作れるようになります。逆に、順番を飛ばして「いきなり映像生成」から始めると、カット間のつながりが崩れ、撮り直しに近い手戻りが頻発します。AIディレクターの価値は、生成の速さではなく、手戻りを減らす点にあります。
脚本を「演出可能な情報」に分解する
生成AIにとって、散文の脚本はそのままでは扱いにくい入力です。曖昧な修飾が多く、解釈の幅が広すぎるからです。まずは脚本を機械可読な表に変換します。このひと手間が、後のすべての工程の品質を決めます。
シーン表の作り方
最低限、次の列を用意します。
- シーン番号と尺(秒)
- 場所と時間帯(屋内/屋外、昼/夜)
- 登場人物
- このシーンの目的(情報提示、感情の転換、伏線など)
- 見せたい対象(顔、手元、風景など)
- セリフまたはナレーション
- 遷移の種類(カット、フェード、ディゾルブ)
この表があると、AIディレクターに「この表を元にカット割りを提案して」と依頼するだけで、筋の通った絵コンテ案が返ってきます。表がない状態で同じ依頼をすると、シーンの目的を取り違えた案が混ざります。
意図と感情曲線の抽出
脚本を読むときに意識したいのは、感情の起伏です。緊張が高まる場面、緩む場面、どんでん返しの直後など、起伏を数値化して折れ線で描いてみます。すると、テンポの単調な区間が見えてきます。そこに短いカットを差し込むか、逆に長回しで見せるかを判断できます。
AIディレクターには「この脚本の緊張度をシーンごとに0から100で推定して」と頼むのが有効です。数値そのものの精度よりも、相対的な高低の並びが使えれば十分です。
登場人物・小道具・ロケーションの台帳
一貫性を保つうえで最も効くのが台帳です。登場人物ごとに、年齢感、髪型、服装、体格、表情の癖を一行で固定します。小道具も同様に、色、素材、傷の有無などをメモします。
たとえば「赤い傘」と書くだけでなく、「くすんだ深紅、骨組みが一本曲がっている、柄は木製」まで書いておくと、カットをまたいでも同じ物として生成されやすくなります。台帳は地味ですが、これがあるだけで修正回数が半分近くに減るケースは珍しくありません。
絵コンテ生成:カット設計をAIと詰める
絵コンテは、映像の設計図です。ここで決めた構図、距離感、視線の流れが、そのまま最終映像の印象を決めます。AIに任せきりにせず、人間が編集できる前提で使うのがコツです。
ショットサイズとアングルの語彙を揃える
AIへの指示がぶれる最大の原因は、語彙の不一致です。チーム内で使う用語を先に決めておきます。
- ロングショット:人物が小さく、環境が主役
- フルショット:全身が入る
- ミディアムショット:腰から上
- バストショット:胸から上
- クローズアップ:顔、または手元
- インサート:物や細部のみ
- ローポジション:下から見上げる
- ハイポジション:上から見下ろす
この語彙をプロンプトにもそのまま使い、日本語と英語の対応表を作っておくと、モデルごとの指示の揺れが小さくなります。
構図のバリエーションを出す
同じシーンに対して、三案ほど構図を出させます。たとえば、引きの画で状況を見せる案、寄りで感情を見せる案、第三者視点で客観的に見せる案です。三案を並べると、どれが脚本の意図に合うかが一目で分かります。一案だけ出すと、比較対象がないため判断が鈍ります。
一貫性のための参照素材を設計する
登場人物が複数カットに登場する場合、参照画像を一枚用意して全カットで使い回します。参照は正面だけでなく、斜め45度のアングルも用意すると安定します。服装が変わるシーンでは、シーン単位で参照を切り替え、切り替え地点を台帳に記録します。
背景も同様です。同じ部屋が何度も出るなら、空間の見取り図を一枚描いておく。窓の位置、机の向き、照明の方向が固定され、カットをまたいだ破綻が減ります。
絵コンテからプロンプトへの橋渡し
絵コンテができたら、次は映像生成モデルへの入力に変換します。ここが最も技術的な工程で、慣れるまでは試行錯誤が続きます。
プロンプトを五層に構造化する
おすすめは、指示を五つの層に分けて書く方法です。
- 被写体:誰が、何が、どの状態で
- 動作:何をしているか、動きの速さ
- カメラ:ショットサイズ、アングル、動き(固定、パン、ドリー)
- 照明と時間帯:光源の種類、色温度、影の硬さ
- 質感とスタイル:写実調、フィルム粒子、アニメ調、色調
層ごとに改行して書くと、どの層を変えたら結果がどう変わったかを追跡できます。全部を一行にまとめると、原因の切り分けができなくなります。
モデルごとの得意分野を見極める
映像生成モデルは、総合点よりも「何が得意か」で選ぶ時代です。同じプロンプトでも、人物の顔の安定性、カメラワークの自然さ、テキストの描画、物理挙動の説得力に差が出ます。
判断の目安として、次の三つを実際に試します。
- 人物のクローズアップで表情が崩れないか
- カメラが動く指示で破綻しないか
- 手や髪など細部の動きが不自然でないか
三つを短いテスト生成で確認し、シーンごとに最も合うモデルを割り当てます。全カットを同じモデルで作る必要はありません。ただし、モデルを混ぜる場合は色調と粒状感を後工程で揃える前提で編集します。
ネガティブ指定と修正ループ
避けたい要素は具体的に列挙します。手が増える、顔が溶ける、背景が勝手に変わる、文字が崩れるなど、モデルごとに起こりやすい現象は異なります。失敗したら、プロンプト全体を書き直すのではなく、一層だけ変えて再生成します。
修正ループは三回までを目安にします。三回で決まらない場合は、プロンプトではなくカット設計自体に無理があることが多いです。その場合は絵コンテに戻り、別のショットサイズで作り直します。
映像生成ツールの選定基準
ツール選びで迷ったら、価格や話題性よりも次の観点で比較します。
品質と制御性のトレードオフ
美しい画を出しやすいモデルは、しばしば細かい制御が苦手です。逆に制御しやすいモデルは、画がやや硬くなりがちです。物語の要所は制御性の高いモデルで作り、雰囲気カットは画作りが得意なモデルに任せる、という分担が現実的です。
尺とカット数の設計
生成モデルは一度に作れる尺が限られます。長回しを狙うより、短いカットをつないでテンポを作るほうが失敗が少なくなります。30秒の映像なら15から25カット、60秒なら30から40カットが目安です。カットが短いほど、一つの破綻が全体に与える影響が小さくなります。
音声・音楽・効果音の統合
映像だけ整えても、音が粗いと完成度は上がりません。手順としては、カットの確定後にナレーションを収録または合成し、その尺に合わせてカットを微調整します。音楽は最後に当てます。先に音楽を決めると、カットが音楽に引っ張られて冗長になりがちです。
効果音は、カットの切り替わりに一つ入れるだけで印象が変わります。扉の音、足音、衣擦れ、環境音。派手さは不要ですが、無音の切り替えが続くと素人っぽく見えます。
実例:30秒のプロモーション映像を仕上げる
具体的な流れを追います。テーマは、新しいカフェの紹介映像とします。
企画と脚本
まず目的を一行で決めます。「朝の静けさと、豆を挽く音の心地よさを伝える」。尺は30秒、ナレーションは3文、登場人物は店主一人。
脚本は六つのシーンに分けます。開店前の店内、豆の量り売り、湯を注ぐ手元、常連客の笑顔、窓からの朝日、店の外観。それぞれに尺を割り当てます。5秒、5秒、6秒、5秒、5秒、4秒です。
絵コンテ
各シーンを二から三カットに分割し、合計18カットにします。手元のクローズアップを多めに置き、人物の顔は二回だけ見せます。顔の露出を絞ると、静かな印象が強まります。
AIディレクターには、シーン表を渡してカット割りの案を出させ、そのうち七割を採用、三割を人間が差し替えます。差し替えるのは、感情の山場にあたるカットと、最後の外観カットです。
生成と編集
カットごとにプロンプトを五層で書き、参照画像を二枚用意します。店主の正面と斜め、そして店内の見取り図です。生成は各カット三本ずつ出し、最も自然なものを選びます。
編集では、まずカットをつないで尺を確認します。次にナレーションを入れ、最後に音楽と効果音を当てます。色調は全カットに同じ補正をかけて統一します。ここまでで、初稿は半日、調整込みで一日程度が現実的なラインです。
よくある失敗とトラブルシューティング
カット間で人物が別人になる
原因は参照素材の不足か、プロンプトでの人物記述の揺れです。台帳の記述をコピーして全カットに同じ文言を使い、参照画像を固定します。服装や髪型を変える場合は、シーン単位でまとめて変えます。
動きが不自然で、早送りに見える
動作の指示が抽象的すぎるのが原因です。「歩く」ではなく「ゆっくり三歩歩く」のように、回数と速さを数値で指定します。カメラの動きも同様で、「ゆっくり右へパン」のように速度を添えます。
画はきれいだが、話が伝わらない
脚本の段階でシーンの目的が曖昧なまま進んだ典型例です。シーン表の「目的」列を埋め直し、目的が情報提示なら引きの画、感情の転換なら寄りの画、という対応を機械的に適用します。
生成結果が毎回大きく変わる
乱数要素が大きいモデルでは起こりがちです。シード値を固定できるなら固定し、できない場合は同じプロンプトで複数回生成して安定した構図を選びます。参照画像の比重を上げるのも有効です。
尺が足りない、または余る
編集段階で直すのではなく、絵コンテ段階で尺を積み上げて確認します。合計尺が目標を超えたら、目的の薄いカットから削ります。逆に余る場合は、間のカットを足すのではなく、既存カットを少し長く伸ばして呼吸を作ります。
チームで回すためのレビュー設計
一人で作る場合と、複数人で回す場合とでは、確認すべき点が変わります。チームの場合は工程ごとにゲートを設けます。
第一のゲートは脚本確定です。目的、尺、登場人物が固まっているかを確認します。第二は絵コンテ確定。カット数と尺の合計、視線の流れを確認します。第三はカット生成の選定。各カットで採用するテイクを決めます。第四は編集の初稿確認。音と色を含めた通し視聴です。
各ゲートで確認する項目を三つ以内に絞るのがポイントです。項目が多いと、レビューが感想の羅列になり、修正指示が曖昧になります。
また、AIが生成した案は必ず一度は人間が全カットに目を通します。見落としは、尺の合計、人物の左右の位置関係、小道具の有無、照明の方向の四つに集中しやすいので、この四点をチェックリスト化しておくと効率的です。
よくある質問
脚本が苦手でもAIディレクターは使えますか
使えます。ただし、目的を一行で書く作業は人間が行ってください。目的が決まっていれば、シーン分割やカット割りはAIが十分に補助できます。目的が曖昧なままだと、出力も曖昧になります。
絵コンテは何枚くらい作ればよいですか
尺の秒数とほぼ同じ枚数が目安です。30秒なら25から30枚、60秒なら50枚前後です。ただし、アクションの多い場面は多めに、静かな場面は少なめに配分します。枚数そのものより、カットの長短のリズムが重要です。
どの映像生成モデルを選べばよいですか
目的によって変わります。人物の表情を丁寧に見せたい作品は顔の安定性を、風景や雰囲気を重視する作品は質感表現を、それぞれ基準にします。複数モデルを試し、シーンごとに割り当てるのが現実的です。
学習させる必要はありますか
短尺の映像であれば、既存モデルと参照画像の組み合わせで十分な品質が出せます。特定の画風やキャラクターを継続的に使う場合のみ、専用の調整を検討します。最初から作り込むより、まず一本完成させるほうが学びが大きいです。
生成した映像の権利や利用条件はどう考えますか
利用条件はツールごとに異なるため、業務利用の前に必ず確認してください。商用利用の可否、生成物の扱い、入力素材の権利の三點を確認し、社内の記録として残しておくと安全です。判断に迷う場合は、権利処理が明確な素材だけで構成するのが無難です。
音声はどうやって作りますか
ナレーションは、収録と合成のどちらでも構いません。合成を使う場合は、カットを確定した後に原稿を読み込ませ、間の取り方を調整します。機械的な抑揚が気になる場合は、文を短く区切って個別に生成し、編集でつなぐと自然になります。
初心者が最初に取り組むべき練習は何ですか
15秒、5カットの映像を一本作ることです。短い尺で、脚本、絵コンテ、生成、編集の全工程を一度通すと、どこで詰まるかが分かります。二本目からは、詰まった箇所を重点的に改善します。
まとめ:AIディレクターは「翻訳者」として使う
AIディレクターの役割は、脚本という言語を、映像という別の言語に翻訳することです。翻訳の精度を上げるのは、モデルの性能よりも入力の質です。シーン表、感情曲線、登場人物の台帳、参照素材。これらを整えるほど、生成結果は安定し、修正の手数は減ります。
逆に、これらを省略して生成から始めると、どれだけ高性能なモデルを使っても、つながりのないカットの寄せ集めになります。映像は、カット単体の美しさではなく、カット間の関係でできているからです。
最初の一歩としては、手元にある短い脚本を一つ選び、シーン表に書き出すところから始めてみてください。表が埋まった時点で、映像の輪郭はすでに見え始めています。

