映像制作の現場では長年、脚本を読み込み、絵コンテを描き、ショットリストを組み、撮影順を決めるという工程を、経験を積んだディレクターが担ってきた。この作業は「センスの問題」と捉えられがちだが、実際には分解可能な手順の集合体である。生成AIが1カット単位の画質を大きく引き上げた今、差がつくのは画質そのものではなく、連続するカットをつないだときに立ち上がる「映画らしさ」——視線の誘導、感情の起伏、空間の連続性——を設計できるかどうかだ。本記事では、AIアシスタントをディレクター役として使いながら、ショットデザインとストーリーテリングを両輪で組み立てる実践的なワークフローを、具体的な手順・判断基準・つまずきやすいポイントとともに整理する。
ショット設計と物語設計を分けて考える理由
生成AIの映像は、1カットだけを見れば驚くほど完成度が高い。しかし10カット並べた瞬間に破綻することが多い。この破綻は大きく2種類に分けられる。ひとつは空間的な破綻で、人物の顔つき、髪型、衣装、照明、背景のつながりがカットごとにずれる現象だ。もうひとつは構造的な破綻で、カットはつながっているのに因果関係や感情の流れが途切れ、観客が「今どの局面を見せられているのか」を見失う現象である。
この2つは原因が違うため、対策も分けなければならない。空間的な破綻はショット設計(誰を、どこから、どの距離で、どう動かして撮るか)で解決する。構造的な破綻は物語設計(何を、どの順番で、どれだけの強度で見せるか)で解決する。両者を同時にいじると、どこを直せば改善するのか分からなくなる。
分けて考える最大の利点は、レビューの精度が上がることだ。カットの絵が気に入らないならショット設計を修正すればよい。つなぎの流れが退屈なら物語設計に戻ればよい。この切り分けができるだけで、修正の往復回数は劇的に減る。
実務での推奨順序は次のとおりである。まず物語設計でビート(物語上の節目)を決める。次に各ビートをショットに分解する。その後で生成し、最後に編集で尺を詰める。逆順、つまり生成した素材を見ながら物語を後付けする進め方は、素材の引力に引っ張られて話が散らかりやすい。
脚本をショットリストへ分解する手順
脚本からショットリストを作る作業は、AIアシスタントに任せられる部分と、人間が判断すべき部分がはっきり分かれる。任せてよいのは機械的な分解、人間が握るべきは「このカットで観客に何を感じてほしいか」という意図である。
シーンの境界を機械的に検出する
最初の作業は、脚本をシーン単位に切ることだ。基準は「場所・時間・登場人物の組み合わせが変わる地点」である。AIに投げる場合は「場所、時間帯、登場人物の3要素が変化する箇所を境界として抽出し、各シーンの目的を1行で要約せよ」と指示すると精度が安定する。要約が似通ったシーンが並んだら、それは統合できるか、逆にもっと差をつけるべきサインだ。
カットに役割を割り当てる
ショットリストの質は、各カットの役割が言語化されているかどうかで決まる。よく使う役割は次の6種類に整理できる。
- 確立カット:場所と時間を観客に伝える。情報量が多く、動きは少ない方がよい。
- 導入カット:人物を紹介する。表情と持ち物で性格を示す。
- 進行カット:行動を進める。テンポを上げる役割を担う。
- 反応カット:台詞や出来事に対する感情の変化を映す。映画的な説得力の大半はここで生まれる。
- 転換カット:状況が変わる瞬間。構図や明るさを意図的に崩すと効果的。
- 締めカット:余韻を作る。長めに取り、動きを止める。
役割を書かずに生成を始めると、全部が「進行カット」になり、単調な映像になる。とくに反応カットが抜けると、物語が「説明」に見えてしまう。
尺の初期値を決めておく
生成前に各カットのおおよその秒数を決めておくと、あとで尺を詰める作業が楽になる。目安として、確立カットは3〜5秒、導入カットは2〜3秒、進行カットは1.5〜3秒、反応カットは1〜2秒、転換カットは2〜4秒、締めカットは4〜8秒。台詞があるカットは台詞の長さに合わせ、間を0.5秒ほど足す。この初期値は編集で必ず動くが、初期値がないと「なんとなく長い映像」になる。
キャラクターとロケーションの一貫性を保つ
一貫性は、AI映像制作で最も多くの時間を奪う問題である。そして最も解決しやすい問題でもある。理由は単純で、必要なのは才能ではなく記録だからだ。
キャラクターシートを先に作る
生成を始める前に、主要人物ごとに参照用の画像を3〜5枚用意する。正面、斜め45度、横顔、全身、そして表情のバリエーションだ。ポイントは、背景をできるだけシンプルにし、照明条件をそろえること。背景が毎回変わると、モデルは人物ではなく背景の違いを学習してしまい、顔が安定しない。
参照画像は「最も多く登場するシーン」の衣装と照明で作るのが実用的だ。物語の大半が夜の室内なら、参照画像も夜の室内で作る。昼のシーンだけ別途作り直す方が、全編を昼基準で作るより破綻が少ない。
衣装・小道具・時間帯を台帳で管理する
スプレッドシートでよいので、シーンごとに「登場人物/衣装/小道具/時間帯/天候/場所」を一覧にする。この台帳があると、生成時に毎回同じ記述をコピーでき、記述ゆれによる不一致を防げる。逆に台帳がないと、同じシーン内でコートの色が変わる、時計が消える、髪が伸びるといった事故が起きる。
とくに厄介なのは小道具だ。手に持っている物は変化しやすく、しかも観客の目に入りやすい。物語上意味のある小道具は、台帳で「登場シーン」「状態変化」まで書き出すとよい。
環境の連続性をチェックする
場所の一貫性は、人物より見落とされやすい。同じ部屋のはずなのに窓の位置が変わる、机の上の物が増減する、壁の色が変わる。対策は、各ロケーションの「基準カット」を1枚決め、生成のたびにそれと見比べることだ。基準カットは編集で実際に使わなくてもよい。比較用の参照として保持しておくだけで効果がある。
映画的なカメラワークを設計する
カメラワークは「かっこいい動き」を足す作業ではない。観客の注意と感情をどこに置くかを決める作業である。したがって、先に意図があり、あとから動きが決まる。
ショットサイズは心理的距離
ショットサイズは情報量と感情の近さを同時に決める。ロングショットは状況を客観的に見せ、観客を安全な位置に置く。ミディアムショットは会話と行動の基本単位になる。クローズアップは感情を強制的に近づけ、観客に共感を要求する。
初心者がやりがちな失敗は、全カットをミディアムショットで統一することだ。安定はするが、感情の起伏が平坦になる。逆にクローズアップを連続させると、観客は疲れ、緊張が持続しない。基本は「ロングで状況、ミディアムで行動、クローズで感情」の往復である。
カメラの動きは3種類に整理する
動きは無限にあるように見えて、実務では3種類に整理できる。
- 固定:三脚に載せたような静止。情報を落ち着いて提示したいときに使う。
- 追従:被写体を追う動き。パン、ティルト、トラッキング。観客を被写体に同行させる。
- 移動:カメラ自体が空間を進む動き。ドリー、クレーン、手持ち。場面の空気を変え、テンションを上げる。
重要なのは、動きを入れるなら「なぜ動かすのか」を一言で言えるようにすることだ。理由が言えない動きは、編集で必ず削られる。
レンズ感と被写界深度
広角は空間を広く見せ、遠近感を強調する。望遠は背景を圧縮し、人物を背景から分離する。被写界深度が浅い映像は視線の誘導が強く、結果として「映画的」に見えやすい。ただし全カットを浅い深度にすると、観客は場所を把握できなくなる。場所を見せたいカットは深めに、感情を見せたいカットは浅めに、と役割で切り替えるとよい。
プロンプトへの落とし込み方
生成時の記述は、感覚的な形容詞より具体的な物理条件の方が効く。「かっこいい」より「カメラは低位置、被写体に向かってゆっくり前進、背景は軽いボケ」。動きを指示するときは、カメラの動きと被写体の動きを分けて書くこと。両方を同時に指定すると、モデルはどちらかを犠牲にする。
ストーリーアークとペース配分を調整する
物語設計は、感情の量と順番を決める作業である。ここを曖昧にしたまま生成に入ると、カット単体は美しいのに全体が退屈な映像になる。
ビートシートで感情の山を作る
ビートシートとは、物語を10〜15個の節目に分解し、それぞれに「観客が知る情報」と「観客が感じる感情」を書き添えたものである。AIに「このプロットを12のビートに分解し、各ビートについて『新しく分かる情報』と『期待される感情』を1行ずつ書け」と依頼すると、骨格が短時間で可視化できる。
ビートを並べたら、感情の強度を確認する。山がひとつしかない構成は、長尺では中だるみする。大きな山の前に小さな山を置くと、全体のリズムが締まる。
感情曲線を数値化する
感情は数値化できる。各ビートに1〜10の強度を割り当て、横軸に時間、縦軸に強度を取って折れ線を描く。理想は緩やかな上昇と、急激な下落、そして再上昇である。平坦な区間が長すぎる場合は、そこに情報の追加か、小さな障害を挿入する。
この曲線はカット設計にも直結する。強度が低い区間はショットサイズを大きめに、強度が高い区間は細かく刻む。カットの長さそのものが感情の表現になる。
尺配分の目安
3分の映像なら、導入に20〜30秒、展開に90〜120秒、転換に15〜25秒、結末に25〜40秒という配分が扱いやすい。尺が足りないと感じたら、台詞を足すのではなく反応カットを足す。感情の納得感は、説明ではなく反応で生まれる。
テーマとモチーフを視覚的に一貫させる
テーマは台詞で語ると説教になり、視覚で反復すると余韻になる。AI映像では、モチーフの反復がとくに効果を発揮する。同じ色、同じ構図、同じ物体を、文脈を変えて繰り返すだけで、観客は意味を読み取る。
色と光のルールを決める
冒頭で色のルールを決めておくと、カット間の統一感が自然に生まれる。たとえば「主人公が安全な場所にいるときは暖色、追い詰められるときは寒色」。このルールを台帳のシーン一覧に列として追加しておけば、生成時の記述がぶれない。
照明も同様に、光源の方向と強さをシーンごとに固定する。同じ部屋の会話シーンで光源の向きが変わると、観客は無意識に違和感を覚える。
反復モチーフの台帳を作る
モチーフは3つ以内に絞るのが扱いやすい。例として、窓、水面、時計、線路、特定の色の布。それぞれについて「初出シーン」「再登場シーン」「意味の変化」を記録しておく。編集段階でモチーフの登場回数が3回未満なら、追加カットを生成する価値がある。
生成タスクを管理する
カット数が20を超えると、作業の失敗は技術ではなく管理から生まれる。どのファイルが最新か分からない、同じカットを二度生成した、参照画像を間違えた、といった事故である。
命名規則とテイク管理
ファイル名には「シーン番号/カット番号/テイク番号/状態」を含める。例として s03_c07_t02_ok のような形式だ。日付は入れない。日付は後で並べ替えの邪魔になり、どのテイクが採用かは分からない。採用テイクには明確な印をつけ、それ以外は別フォルダに退避する。
生成キューを意図的に組む
生成は時間がかかるため、待ち時間の使い方が生産性を左右する。おすすめは、似た条件のカットをまとめて投入すること。同じキャラクター、同じ場所、同じ照明のカットを連続して生成すると、モデルの状態が近く、結果のばらつきが小さくなる。
逆に、難易度の高いカット(複数人物、激しい動き、特殊な構図)は単独で投入し、結果を確認しながら進める。まとめて投入すると、失敗したときに何が原因か分からなくなる。
バージョンを残す
うまくいったカットでも、参照画像や記述を上書きしないこと。あとで「別のシーンにも同じ人物を出したい」となったとき、その成功パターンが唯一の手がかりになる。成功した記述はテンプレートとして保存し、次回の出発点にする。
よくある失敗と対処法
- 顔が毎回変わる:参照画像の背景と照明をそろえる。人物の記述順序を固定する。
- 手や指が崩れる:手が画面に大きく写る構図を避け、ミディアムショットに落とす。
- カメラが勝手に動く:動きの指示を減らし、まず静止で安定させる。
- 色がカットごとに揺れる:シーン単位で色温度を明記し、ポストで統一する前提で撮る。
- 人物が増減する:人数を記述に明示し、群衆は背景として扱う。
- 台詞の尺が合わない:台詞は後から収録し、映像は尺を多めに生成する。
- 動きが速すぎる:速度の形容詞を外し、動きの方向だけを指定する。
- 全部のカットが同じに見える:ショットサイズを意図的に3段階で振り分ける。
- 編集でつながらない:つなぎ目は前後カットの視線方向を合わせる。
- 最後の余韻がない:締めカットを長めに生成し、動きを止める。
こうした失敗の多くは、生成の精度ではなく設計の曖昧さに由来する。同じ失敗が2回起きたら、そのカットを再生成する前に台帳と役割定義を見直すこと。
ツール選定の判断基準
AI映像ツールは増え続けており、機能表だけを見ても選べない。実務では次の順で確認すると失敗が少ない。
- 一貫性の仕組み:参照画像を何枚使えるか、人物と場所を別々に固定できるか。
- カメラ制御:動きの種類を指定できるか、静止を確実に再現できるか。
- 尺と解像度:1カットの最大長と書き出し解像度が用途に足りるか。
- 編集機能:カットの並べ替え、尺の調整、書き出しまでを一箇所でできるか。
- 修正のしやすさ:部分的な再生成ができるか、全体を作り直す必要があるか。
- 共有と書き出し形式:チームで確認できるか、編集ソフトに渡せる形式か。
最初から有料の上位プランを契約する必要はない。まず1シーンだけを最後まで作り、ワークフローが回るかを確認する。回らない原因が機能不足なのか、設計不足なのかを切り分けてから投資を判断するのが堅実である。
よくある質問
1本の映像に何カット必要か
1分あたり15〜25カットが目安になる。3分なら50〜70カット。ただしカット数は目的ではなく、感情の変化の数で決まる。感情の変化が10回なら、10前後のまとまりで考え、その中でショットサイズを振る方が自然だ。
絵コンテは必須か
必須ではないが、簡単なものでも作る価値は大きい。AIアシスタントに「各カットの構図、ショットサイズ、カメラの動き、登場人物を表形式で出せ」と依頼すれば、絵を描かなくても設計図になる。文章だけのショットリストより、構図が言語化されたリストの方が生成の精度が上がる。
スマートフォンでも制作できるか
設計と生成は可能だが、確認作業は大きな画面の方が圧倒的に速い。とくに色の揺れや小道具の不一致は、小さい画面では見落とす。制作の最終確認だけでもPCで行うことを勧める。
音声や音楽はどうするか
映像を先に完成させ、尺が確定してから音を当てる方が調整は少ない。逆に音を先に作ると、映像の尺を音に合わせる必要が生じ、ショット設計が歪む。台詞ものは、まず無音で編集し、その後に収録する流れが扱いやすい。
生成がうまくいかないときは何を疑うか
順番は決まっている。まず参照画像、次に記述の具体性、次にカットの難易度、最後にツールの限界。多くの場合、参照画像の不統一か、1つの記述に動きを詰め込みすぎていることが原因である。
どのくらいの期間で習得できるか
1シーンを最後まで作り切る経験を3回繰り返せば、おおよその勘所はつかめる。重要なのは、毎回同じ手順を踏むこと。手順を固定すると、うまくいかなかった原因が特定できるようになる。
チームで分担する場合の注意点
台帳と命名規則を最初に共有することが最優先である。分担するなら、人物の一貫性を担当する人、カメラ設計を担当する人、編集を担当する人に分けると衝突が少ない。全員が同じカットを触ると、参照画像が混ざり、一貫性が崩れる。
まとめ:設計が先、生成は後
映画的なショットデザインとストーリーテリングは、特別な才能ではなく、順序立てた設計の積み重ねで到達できる。物語のビートを決め、ビートをショットに分解し、各カットに役割を与え、参照素材と台帳で一貫性を守る。この流れを固定すれば、生成AIは「それらしい映像」ではなく「伝わる映像」を出してくれる。
逆に、この順序を飛ばして生成から始めると、どれだけ画質が上がっても作品にはならない。カットは材料であり、作品は設計図の上にしか建たない。まず1シーン、3分の短い作品でよいので、最後まで通してみること。その一回の完走が、次の制作を確実に速くする。


