知的なハードSFをAIで作るということ
時間のねじれ、巨大構造物、静寂に満ちた宇宙船、そして観客の理解をほんの少しだけ先行する情報設計。こうした「頭で観る」タイプのSFは、AI動画生成と相性が良い。理由は三つある。
第一に、AIは現実離れしたスケールの建築物や風景を、違和感なく描き出せる。第二に、重厚で低彩度な照明設計や、曇天・逆光・暗部中心の画面は、動画生成モデルが得意とする領域だ。第三に、カットが長く動きが抑制された演出では、細部の破綻が観客の目につきにくい。
ただし、相性が良いことと簡単であることは別だ。AI動画は「1カットを美しく作る」ことは得意だが、「90分の物語を通じて同じ世界を保つ」ことは苦手である。とくに時間構造を複雑に扱う作品では、フレーム単位の見た目よりも、因果関係の連続性のほうが重要になる。本記事では、時間・空間・音の3層を設計し、生成と編集を分けて管理する実践的なワークフローを解説する。
企画段階:時間・空間・音の3層レイヤーで分解する
AI生成を始める前に、企画を3つのレイヤーに分解しておくと、後の工程が驚くほど楽になる。ここを飛ばしてプロンプトを書き始めると、美しいが繋がらないカットが大量に生まれる。
時間レイヤー:因果の地図を先に描く
最初に作るべきは、絵コンテではなく「時間の地図」だ。表計算でもノートでも構わないので、次の4列を埋めていく。
- シーン番号
- 物語内の時刻(作中時間)
- 観客に提示する順序(上映順)
- 直前のシーンとの因果的な接続
この4列があるだけで、「なぜこのカットの次にこのカットが来るのか」を毎回説明できるようになる。AI生成ではカット単位で発注するため、この接続情報がプロンプトに埋め込まれていないと、映像は簡単に別の物語へ流れていく。
空間レイヤー:世界のルールを一行で決める
次に、世界の物理ルールを短い文章で固定する。たとえば「重力は地球と同等だが、特定の施設内だけ時間の進み方が遅い」「大気は薄く、空は常に灰色」「光源は自然光と、無機質な白色パネルのみ」。
ルールは多いほど良いわけではない。3〜5行で十分だ。大事なのは、その後のすべてのショットで同じルールを参照すること。AIは指示された瞬間の画面を最適化するので、世界の法則は人間が一貫して運び続ける必要がある。
音響レイヤー:静寂を設計する
大作SFの緊張感は、音楽よりも「音の不在」で作られることが多い。低く持続する低周波、遠くで鳴る金属音、そして突然訪れる無音。この3つをあらかじめ設計しておくと、編集段階で映像の粗を音で補正できる。
具体的には、シーンごとに「常時鳴っている環境音」「断続的な効果音」「音楽が入るかどうか」をメモしておく。AI生成した映像はどうしても動きが滑らかでない箇所が出るが、低い持続音と適切な無音を重ねるだけで、その瑕疵は観客の意識から外れる。
ショットリストとプロンプト設計の実践
ショット記述の基本文法
1カットにつき、必ず同じ順序で情報を書く。順序を固定すると、モデル間の乗り換えや再生成のときに差分が把握しやすくなる。
| 項目 | 記入内容の例 | 役割 |
|---|---|---|
| 被写体 | 宇宙服の技術者、1名 | 誰が映るか |
| 動作 | 端末を操作し、顔を上げる | 何をするか |
| 環境 | 円形の管制室、全面ガラス | どこで |
| 光 | 逆光、白色パネル、低照度 | 明暗の設計 |
| レンズ感 | 35mm相当、浅い被写界深度 | 質感の設計 |
| カメラ | ゆっくりドリーイン | 動きの設計 |
| 尺 | 4秒 | 編集の前提 |
この表をカット数だけ並べたものが、実質的なプロンプト台本になる。文章を毎回ゼロから書くより、表を埋めてから1行に変換するほうが圧倒的に速く、ぶれない。
カメラワークの語彙を揃える
「ゆっくり寄る」「静かに引く」「固定」「真上から降りる」など、使う語彙を10種類以内に絞る。語彙が増えるほど、カット間のリズムは崩れる。とくに時間構造を扱う作品では、カメラの動きが視聴者の理解を助ける手がかりになるため、動きの意味を固定することが重要だ。
たとえば「時間が巻き戻る場面では必ずカメラを後退させる」「別世界線では必ず固定カメラにする」といったルールを決めておくと、説明台詞に頼らずに構造を伝えられる。
ネガティブ指定で破綻を減らす
生成が崩れる典型パターンは決まっている。指の本数、余分な手足、画面内の文字やロゴ、不自然な髪の流れ、過剰な被写界深度、意図しない人物の増殖。これらは毎回ネガティブ側に明記する。
加えて「カメラの急なパン」「手ぶれ」「ズーム」も、作品のトーンによっては禁止したほうがよい。AIは指示がないと派手な動きを足したがる傾向があるため、抑制の指示は明示的に書く。
視覚的一貫性を守る参照画像ワークフロー
3つの台帳をつくる
一貫性は才能ではなく管理で担保する。最低限、次の3つの台帳を用意する。
- キャラクター台帳:正面・横・背面の静止画、衣装の色コード、身長の目安、特徴的な小物
- プロップ台帳:重要アイテムの形状、素材、色、傷や汚れの程度
- 環境台帳:主要ロケーションの広角カット、光源の位置、床と壁の素材
台帳は画像だけでなく、短い言語記述を添える。画像だけでは、モデルが別の角度から見たときに同一性を保てないことがある。言語と画像の二重指定が効く。
前後フレーム制御と画像→動画の併用
カットの始点と終点を静止画で固定し、その間を生成させる手法は、連続性の維持に非常に強い。とくに人物が歩く、扉が開く、乗り物が通過するといった動作では、始点と終点を決めておくだけで破綻が激減する。
また、重要なカットは画像生成でルックを固めてから動画化する。動画生成から始めると、構図・照明・衣装がすべて同時に揺れるため、修正の手がかりが失われる。静止画で「正解」を作っておけば、動画側でぶれたときに比較対象が存在する。
ルックの固定:色とレンズ感
作品全体のカラーパレットを5色以内で決め、それを数値や言葉で共有する。暗部に青、中間調に灰色、ハイライトにごく淡い白。この程度の単純なルールでも、カット間の統一感は大きく変わる。
レンズ感も統一する。広角の歪みを使うカットと、望遠の圧縮を使うカットを混在させると、同じ世界に見えなくなる。ロケーションごとに使う画角を決めておくのが安全だ。
ツールの役割分担と選定基準
生成モデルの選び方
動画生成モデルは、大きく3タイプに分けて考えると選びやすい。
- 制御重視型:始点・終点の指定や、カメラ指示への追従性が高い。長回しや連続性が必要なカットに向く。
- 質感重視型:人物の肌、布、光の描写が豊か。アップの芝居に向くが、動きの一貫性は劣ることがある。
- 速度重視型:短いカットを大量に試すのに向く。テスト生成や、編集で細かく切る前提の素材づくりに適する。
作品全体を1つのモデルで統一する必要はない。ただし「どのシーンをどのタイプで作るか」を先に決めておかないと、質感の差が目立つ。ロケーション単位・光の状態単位でモデルを固定するのが実務的だ。
静止画・編集・音の担当
| 工程 | 目的 | 代表的な選択肢 | 選定のポイント |
|---|---|---|---|
| 静止画生成 | ルック開発、参照画像 | 画像生成ツール全般 | 同一キャラの再現性 |
| 動画生成 | カット素材 | 動画生成ツール全般 | 制御性と尺の上限 |
| アップスケール | 解像度と質感補正 | 動画補正ツール | 時間方向のちらつき抑制 |
| 編集・合成 | 時間構造の構築 | 一般的な編集ソフト | タイムラインの扱いやすさ |
| 音声 | 台詞、環境音、音楽 | 音声合成・楽曲生成ツール | 尺合わせとトーン統一 |
重要なのは、生成ツールに編集まで任せないこと。時間構造の組み立ては必ず編集ソフトのタイムラインで行う。生成側で凝った編集をしようとすると、再生成のたびに構造が壊れる。
制作ワークフロー:7ステップ
ステップ1:ログラインと時間の地図
1行のログラインと、前述の時間の地図を書く。ここで「観客がどこで何を理解するか」を決めておく。AI生成は情報の出し方を制御しにくいので、理解の順序は脚本側で握る。
ステップ2:ルック開発
キーとなる3〜5カットを静止画で作り込む。色、光、素材感、衣装をここで確定させる。この段階で納得できないものは、動画にしても納得できない。
ステップ3:ショットリストとプロンプト表
全カットを表に落とし、前述の文法で1行プロンプトに変換する。尺も必ず書く。尺が決まっていないと、編集で切る前提の素材になり、構図が破綻する。
ステップ4:テスト生成と再現性の確認
各ロケーションから1カットずつテスト生成し、同じプロンプトで再度生成して、どれだけ近い結果が出るかを確認する。再現性が低い設定は、本生成の前に必ず修正する。
ステップ5:本生成
カットごとに3〜5テイク生成し、最も破綻の少ないものを採用する。採用基準は「美しさ」ではなく「前後のカットと繋がるか」。単体で美しくても繋がらない素材は捨てる。
ステップ6:編集・合成・アップスケール
編集ソフトで並べ、不要部分を切る。VFX要素(画面内モニター、光のフレア、粒子)を重ね、最後にアップスケールする。順序を逆にすると、合成の縁が目立つ。
ステップ7:音響とカラー
環境音、効果音、音楽、台詞を配置し、全体のカラーを整える。ここで各カットの色を揃え、明度差を調整すると、別々に生成した素材が同じ作品に見え始める。
よくある失敗と処方箋
時間が破綻する
原因はほぼ「因果情報をプロンプトに書いていないこと」。直前のカットの状態(人物の位置、手に持っている物、光源)を1行で書き足すだけで改善する。
顔と衣装が変わる
参照画像1枚では足りない。複数角度の参照と、色コードの言語指定を併用する。衣装は「素材+色+ディテール」の3要素で書く。
物理が不自然
落下、衝突、水しぶきは苦手分野だ。こうしたカットは尺を短くし、音と編集で見せる。無理に長回しにしない。
カメラが暴れる
ネガティブ指定で「パン、ズーム、手ぶれ」を禁じ、ポジティブ側で動きを1つだけ指定する。カメラの動きは1カット1種類が原則。
画面が過剰に細かい
情報量が多すぎると、視聴者は物語を追えない。前景の要素を減らし、被写界深度で整理する。AIは放っておくと装飾を足す。
音と映像がずれる
尺の端数を切り捨て、音の頭を数フレーム早める。低い持続音を敷くと、動きの硬さが聴覚的に隠れる。
公開前の品質チェックリスト
- 時間の地図と実際の並びが一致しているか
- 同じロケーションの光源方向が全カットで揃っているか
- 主要キャラクターの衣装と髪が全カットで同一か
- 画面内に不要な文字・ロゴが写っていないか
- カメラの動きが1カット1種類に収まっているか
- カットの尺が編集のリズムに合っているか
- 無音の区間が意図的に配置されているか
- 色温度がシーン間で急変していないか
- アップスケール後のちらつきが許容範囲か
- 冒頭30秒で世界のルールが伝わるか
FAQ:制作の疑問に答える
Q. 1カットの長さはどれくらいが適切ですか。
A. 生成の安定性を考えると4〜6秒が扱いやすい。長いカットが必要な場合は、同じ構図で複数生成し、編集で繋いで疑似的な長回しを作る。
Q. 静止画から始めるべきか、動画生成から始めるべきか。
A. ルック開発は静止画、動作の生成は動画、と役割を分けるのが最も効率的だ。最初から動画で詰めようとすると、修正の基準が失われる。
Q. 人物の同一性はどこまで担保できますか。
A. 参照画像の複数角度+言語による特徴記述+前後フレーム制御の3点を組み合わせれば、実用レベルに近づく。それでも完全ではないため、顔のアップは最小限にし、後ろ姿や手元、シルエットで見せる演出も併用したい。
Q. プロンプトは日本語と英語のどちらが良いですか。
A. 英語のほうが細かいニュアンスが通りやすい場面が多い。ただし日本語で構造を設計し、英語に変換する二段階方式にすると、思考の整理と精度を両立できる。
Q. 作業時間を短縮する最大のコツは。
A. 台帳とプロンプト表を先に作り、テスト生成で再現性を確認してから本生成に入ること。行き当たりばったりで生成を繰り返すより、結果的に数倍速い。
Q. 学習のために最初に作るべき作品は。
A. 3分、1ロケーション、登場人物1人、台詞なしの短編を勧める。時間構造の実験だけに集中でき、破綻の原因も特定しやすい。
次の一歩:小さく作って大きく育てる
知的なハードSFをAIで作る作業は、技術の習得というより、管理の設計に近い。時間の地図、空間のルール、音の設計。この3枚の紙を先に用意し、生成はその紙に従わせる。順番を守るだけで、作品の完成度は驚くほど安定する。
まずは3分の短編を1本、最後まで通してみてほしい。最後まで通した経験だけが、次の長編の判断材料になる。

