AIアシスタントを「ディレクター役」として使うという発想
映像制作の初期工程は、長いあいだ「時間がかかって当然」とされてきた。企画メモをシナリオに落とし、シナリオをショットに分解し、各カットの画を想像して絵コンテに描き起こす。この流れを少人数で回すと、数日から数週間が普通に消える。AIアシスタントをここに組み込む最大の価値は、作業を丸ごと代替することではなく、判断の材料を瞬時に並べてくれる点にある。「AとBのどちらが良いか」を考える時間を、数十秒に短縮できるのだ。
従来のチャット型AIは、頼まれた文章をそれらしく返すだけだった。近年の制作支援ツールはそこから一歩進み、物語構造の知識、映像言語の語彙、生成モデルの特性理解をあわせ持つ。曖昧に置いた部分を具体的な選択肢として提示し、足りない情報を質問として返してくる。たとえば「雨の路地で別れ話をする二人」という一行から、三幕構成のビート、ショットの粒度、レンズの焦点距離、光源の方向、生成モデルに渡すプロンプトの骨格までを一気に展開できる。
任せる領域と、人間が握る領域
任せてよいのは、構造の提案、抜け漏れの指摘、語彙の変換、選択肢の列挙である。逆に握るべきは、作品の意図、登場人物の感情の核、どこで視聴者を驚かせるかという演出の判断だ。この線引きを曖昧にしたまま全部を丸投げすると、平均的で無難なだけの映像が量産される。逆にすべて自分で決めてからアシスタントに渡すと、速くなるどころか手間が増える。
実務的には「案を三つ出させる」「それぞれの長所と短所を書かせる」「選ぶのは自分」という運用がもっとも効率がよい。選択肢の生成は機械の得意分野であり、選択は人間の責任領域である。この分業を守るだけで、同じツールでも成果物の質が大きく変わる。
向いている案件・向いていない案件
向いているのは、短尺のSNS動画、商品紹介、教育コンテンツ、プレゼン用のコンセプト映像、社内合意形成のための絵コンテなど、反復と修正が前提の案件だ。尺が短く、カット数が限られ、目的が明確なほどアシスタントの精度は上がる。
一方、長編の物語や繊細な感情の機微が主目的の作品では、アシスタントは補助に留めるべきだ。全体構造の整理には向くが、台詞の温度や沈黙の設計は、人間が最後に書き直す前提で使う。得意・不得意を最初に把握しておくと、途中で方針を変える手戻りを防げる。
制作フローの全体像
実際のワークフローを分解すると、次の五つのフェーズになる。
- 企画の言語化:誰に、何を、どの尺で届けるのかを決める
- 構成の設計:ログライン、ビート、シーン分割を組む
- ショット設計:カット割り、カメラ、ライティングをプロンプト化する
- キーフレーム生成:画の基準を作り、一貫性を固定する
- 映像生成と検証:生成、比較、修正、書き出しを行う
重要なのは、フェーズ4と5を行き来しながら前のフェーズへ戻る前提で組むことだ。一直線に進めようとすると、後半でキャラクターの顔が変わり、ライティングが崩れ、結局すべて作り直すことになる。
各フェーズの成果物を決めておく
フェーズごとに「何をもって完了とするか」を定義しておくと、進行が止まらない。企画なら4項目のメモ、構成ならビート表、ショット設計なら番号付きのショットリスト、キーフレームなら代表カットの静止画、検証なら採用カットの一覧である。成果物が明確だと、アシスタントへの指示も自然に具体化する。
短尺と長尺でフローを変える
15秒から60秒の短尺では、フェーズ2を省略して企画メモから直接ショットリストへ進んでよい。一方で3分を超える作品では、シーン分割とビート表を必ず挟む。ここを省略すると、中盤の緊張感が失われ、視聴者が離脱する構成になりやすい。
フェーズ1:企画メモを演出可能な素材に変える
最初の指示は長い説明である必要はない。むしろ短く、しかし判断に必要な情報が揃っている方が精度が上がる。最低限そろえたいのは次の四点だ。
- 目的:誰のどんな行動を引き出したいのか(視聴、購入、理解、共有)
- トーン:静か、軽快、緊張感、ユーモア、ドキュメンタリー調など
- 尺:15秒、30秒、60秒、3分
- 制約:登場人物の人数、避けたい表現、納品形式、撮影不可能な要素
この四点を先に固めるだけで、返ってくる構成案の解像度は大きく変わる。「かっこいい動画」といった形容詞だけでは、アシスタントは無難な一般論しか返せない。
入力が曖昧なときに起きること
目的が曖昧なまま進めると、構成案が「説明」と「感情」のどちらに寄るのか決まらない。結果として、前半は商品説明、後半は情緒的なカットというちぐはぐな構成になる。尺が曖昧だと、カット数が過剰になり、1カットあたりの秒数が短すぎて何が映っているか伝わらない。制約を伝えていないと、生成モデルでは再現しにくい要素が平気で混ざってくる。
ログラインを一行で書く
企画メモが整ったら、まず一行のログラインに圧縮する。「誰が、何を望み、何に妨げられ、どうなるか」の四要素が入っていれば十分だ。この一行は後のすべての工程で判断基準になる。迷ったときは「このカットはログラインに貢献しているか」に戻ればよい。
フェーズ2:シナリオと物語構造を組み立てる
構成設計では、アシスタントに物語構造のテンプレートを適用させる。三幕構成、ヒーローズ・ジャーニー、起承転結、問題解決型など、目的に応じて使い分ける。短尺の広告であれば「問題提示→解決策→証拠→行動喚起」の四拍子が扱いやすい。
三幕構成をテンプレートとして使う
第一幕で状況と欲求を提示し、第二幕で障害と変化を積み上げ、第三幕で決着をつける。アシスタントには各幕の役割と目標時間を明示してから展開を書かせると、構成の偏りが減る。たとえば60秒なら第一幕15秒、第二幕30秒、第三幕15秒という配分を先に決めておく。
シーン分割とビート表
次にシーンへ分割し、各シーンに「誰が」「どこで」「何をする」「何が変わる」を一行ずつ書く。これがビート表になる。ビート表の段階で感情の起伏を確認し、平坦な区間があれば削るか統合する。ここで削った1シーンは、後工程の数十カットを節約する。
セリフとナレーションの扱い
セリフは情報を運ぶが、生成映像では口の動きの同期が難しい。長い説明台詞は避け、短い一言か、ナレーションで補う構成が現実的だ。ナレーション原稿は、1文を20文字前後に抑えると読み上げと字幕の両方に収まる。
フェーズ3:ショットリストと絵コンテ指示への変換
シナリオを映像に変換する工程では、テキストを「撮影可能な単位」に翻訳する。ここが最も専門的で、アシスタントの価値がはっきり出る部分だ。
ショットの粒度を決める
1ショットは3秒から5秒を目安にする。生成モデルは長い尺を一度に扱うのが苦手で、つなぎ目も目立ちやすい。短いカットをつなぐ方が、映像全体の安定感は高くなる。まずは「ロング、ミディアム、アップ、インサート」の四種類を意識して振り分けると、単調さを避けられる。
カメラワークとレンズの語彙
カメラの指示は、動きと視点に分けて書く。動きは固定、パン、ティルト、ドリー、ハンドヘルド、クレーン。視点はアイレベル、ローアングル、ハイアングル、俯瞰、主観。レンズは広角、標準、望遠、マクロといった語彙で焦点距離の印象を伝える。これらを組み合わせるだけで、同じ被写体でも意味が変わる。
ライティングとカラーの指定
光源の方向(逆光、斜光、正面光)、質(硬い、柔らかい)、時間帯(朝、夕方、夜)、色温度(暖色、寒色)を指定する。カラーは作品全体で統一した方がよく、各カットで変えるのは意図がある場合だけにする。
プロンプトを構造化する
生成モデルに渡すプロンプトは、次の順序で組み立てると安定する。
- 被写体とアクション
- 場所と時間帯
- カメラ(アングル、動き、レンズ感)
- ライティングと色
- スタイル(写実、アニメ、フィルム調など)
- 避けたい要素
この順序を固定しておくと、修正するときにどこを触ればよいかが明確になる。
フェーズ4:モデル選択とキーフレームの一貫性
映像生成モデルは用途によって得意分野が異なる。写実的な人物に向くもの、アニメ調の線を保つのが得意なもの、カメラの動きが滑らかなもの、短い尺の一貫性に強いものなど、特性はさまざまだ。
モデルを選ぶ判断基準
選定では次の四点を確認する。第一に、必要なスタイルを再現できるか。第二に、人物や小物の一貫性がどの程度保たれるか。第三に、生成にかかる時間と試行回数。第四に、商用利用や公開範囲の条件だ。迷ったら、代表的な1カットを複数のモデルで同時に試し、同じプロンプトで比較するのが最短の判断方法である。
キャラクターの一貫性を保つ
顔や服装が毎カット変わると、視聴者は物語を追えなくなる。対策は、代表カットで基準画像を作り、以降の生成でそれを参照させること。加えて、人物の記述を毎回同じ言葉で書く。髪型、服装、年齢感、体型をテンプレート化してコピーするだけで、ばらつきは大きく減る。
スタイルを固定する
スタイルの指定も同様に固定する。「35mmフィルム調、浅い被写界深度、自然光」のような短い定型句を全カットで使い回す。カットごとに雰囲気を変えたくなったら、それは構成の問題であることが多い。
フェーズ5:生成・検証・修正のループ
生成は一度で決めず、3回から5回の試行を前提に組む。同じプロンプトで複数回生成し、最も意図に近いものを選ぶ。ここで重要なのは、評価基準を先に決めておくことだ。
検証チェックリスト
- 意図した被写体とアクションが映っているか
- カメラの動きが不自然に揺れていないか
- 人物の顔や手が破綻していないか
- 前後のカットと色味がつながっているか
- 1カットの尺が編集で使える長さか
このチェックを通過しないカットは、無理に使わず再生成する。妥協してつなぐと、視聴者の集中は確実に途切れる。
よくある失敗と対処
よくある失敗は五つある。一つ目は、プロンプトに情報を詰め込みすぎて意図が曖昧になるケース。対処は要素を削り、1カット1メッセージに絞ることだ。二つ目は、カメラの動きを指示しすぎて画面が酔うケース。対処は動きのあるカットを全体の三割程度に抑えること。
三つ目は、同じ人物が別人になるケース。基準画像の参照と記述のテンプレート化で対処する。四つ目は、明るさがカットごとにばらつくケース。ライティングと色温度の記述を統一し、編集で軽く補正する。五つ目は、尺が足りずに編集で切れないケース。余裕を持って長めに生成しておく。
チームで回すための運用設計
個人制作なら気にならないが、複数人で回すと命名とバージョンの管理が崩れやすい。カット番号、シーン番号、試行回数をファイル名に含めるだけで、後の差し替えが格段に楽になる。
命名規則とバージョン管理
例として「s02_c07_take3_modelA」のような形式を決めておく。どのシーンの、何番目のカットで、何回目の試行かを一目で判断できる。プロンプトも同じ番号でテキスト保存し、映像と対応させる。
レビューのタイミング
レビューは三回に分けると効率がよい。第一回はビート表の段階で構成を確認する。第二回はキーフレームの段階で画の方向性を確認する。第三回は映像の段階で細部を確認する。早い段階での修正は安く、遅い段階での修正は高い。
よくある質問
アシスタントに脚本を全部書かせてもよいですか
短尺の構成整理や選択肢の列挙には向くが、最終稿は人間が書く前提が安全だ。とくに感情の機微や台詞のリズムは、意図を理解している書き手が仕上げる方が質が高い。
絵コンテは何枚作ればよいですか
15秒なら6枚から10枚、60秒なら15枚から25枚が目安だ。ただし枚数より、各カットの目的が説明できることの方が重要である。
生成モデルは一つに絞るべきですか
プロジェクト単位では絞る方が一貫性は保ちやすい。ただしカットの性質によって得意分野が違う場合は、キーフレームだけ別モデルで作るといった併用も有効だ。
プロンプトは日本語と英語のどちらがよいですか
多くの生成モデルは英語の指示で安定する。ただし構成設計や台詞の検討は日本語で行い、生成用プロンプトだけ翻訳する流れが実務的である。
どこから自動化すべきですか
構成の整理、ショットリストの下書き、プロンプトの定型化から始めるのが安全だ。演出の判断や最終的な選定まで自動化すると、作品の個性が失われやすい。
まとめ:速度より判断の質を上げる
AIアシスタントを使う目的は、作業を速くすることだけではない。判断の材料を素早く並べ、比較し、選ぶ回数を増やすことにある。試行回数が増えれば、結果として質の高いカットが残る。
最初に取り組むべきは、企画の四点セット(目的、トーン、尺、制約)を毎回書く習慣だ。次に、ビート表を挟んでからショットリストへ進む。さらに、基準画像と定型プロンプトで一貫性を固定し、検証チェックリストで選別する。この四つを守るだけで、同じツールでも出力の安定感は大きく変わる。
ツールは入れ替わっても、ワークフローの考え方は残る。どのモデルを使うにしても、構造を先に決め、語彙を固定し、検証を仕組み化する。この順序を守ることが、短時間で納得のいく映像にたどり着く最短の道である。


