Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画で時間構造を操るハードSF映画の作り方:視覚的一貫性を保つ実践ワークフロー

Sep 23, 2026

知的なハードSFをAIで作るということ

時間のねじれ、巨大構造物、静寂に満ちた宇宙船、そして観客の理解をほんの少しだけ先行する情報設計。こうした「頭で観る」タイプのSFは、AI動画生成と相性が良い。理由は三つある。

第一に、AIは現実離れしたスケールの建築物や風景を、違和感なく描き出せる。第二に、重厚で低彩度な照明設計や、曇天・逆光・暗部中心の画面は、動画生成モデルが得意とする領域だ。第三に、カットが長く動きが抑制された演出では、細部の破綻が観客の目につきにくい。

ただし、相性が良いことと簡単であることは別だ。AI動画は「1カットを美しく作る」ことは得意だが、「90分の物語を通じて同じ世界を保つ」ことは苦手である。とくに時間構造を複雑に扱う作品では、フレーム単位の見た目よりも、因果関係の連続性のほうが重要になる。本記事では、時間・空間・音の3層を設計し、生成と編集を分けて管理する実践的なワークフローを解説する。

企画段階:時間・空間・音の3層レイヤーで分解する

AI生成を始める前に、企画を3つのレイヤーに分解しておくと、後の工程が驚くほど楽になる。ここを飛ばしてプロンプトを書き始めると、美しいが繋がらないカットが大量に生まれる。

時間レイヤー:因果の地図を先に描く

最初に作るべきは、絵コンテではなく「時間の地図」だ。表計算でもノートでも構わないので、次の4列を埋めていく。

  • シーン番号
  • 物語内の時刻(作中時間)
  • 観客に提示する順序(上映順)
  • 直前のシーンとの因果的な接続

この4列があるだけで、「なぜこのカットの次にこのカットが来るのか」を毎回説明できるようになる。AI生成ではカット単位で発注するため、この接続情報がプロンプトに埋め込まれていないと、映像は簡単に別の物語へ流れていく。

空間レイヤー:世界のルールを一行で決める

次に、世界の物理ルールを短い文章で固定する。たとえば「重力は地球と同等だが、特定の施設内だけ時間の進み方が遅い」「大気は薄く、空は常に灰色」「光源は自然光と、無機質な白色パネルのみ」。

ルールは多いほど良いわけではない。3〜5行で十分だ。大事なのは、その後のすべてのショットで同じルールを参照すること。AIは指示された瞬間の画面を最適化するので、世界の法則は人間が一貫して運び続ける必要がある。

音響レイヤー:静寂を設計する

大作SFの緊張感は、音楽よりも「音の不在」で作られることが多い。低く持続する低周波、遠くで鳴る金属音、そして突然訪れる無音。この3つをあらかじめ設計しておくと、編集段階で映像の粗を音で補正できる。

具体的には、シーンごとに「常時鳴っている環境音」「断続的な効果音」「音楽が入るかどうか」をメモしておく。AI生成した映像はどうしても動きが滑らかでない箇所が出るが、低い持続音と適切な無音を重ねるだけで、その瑕疵は観客の意識から外れる。

ショットリストとプロンプト設計の実践

ショット記述の基本文法

1カットにつき、必ず同じ順序で情報を書く。順序を固定すると、モデル間の乗り換えや再生成のときに差分が把握しやすくなる。

項目 記入内容の例 役割
被写体 宇宙服の技術者、1名 誰が映るか
動作 端末を操作し、顔を上げる 何をするか
環境 円形の管制室、全面ガラス どこで
光 逆光、白色パネル、低照度 明暗の設計
レンズ感 35mm相当、浅い被写界深度 質感の設計
カメラ ゆっくりドリーイン 動きの設計
尺 4秒 編集の前提

この表をカット数だけ並べたものが、実質的なプロンプト台本になる。文章を毎回ゼロから書くより、表を埋めてから1行に変換するほうが圧倒的に速く、ぶれない。

カメラワークの語彙を揃える

「ゆっくり寄る」「静かに引く」「固定」「真上から降りる」など、使う語彙を10種類以内に絞る。語彙が増えるほど、カット間のリズムは崩れる。とくに時間構造を扱う作品では、カメラの動きが視聴者の理解を助ける手がかりになるため、動きの意味を固定することが重要だ。

たとえば「時間が巻き戻る場面では必ずカメラを後退させる」「別世界線では必ず固定カメラにする」といったルールを決めておくと、説明台詞に頼らずに構造を伝えられる。

ネガティブ指定で破綻を減らす

生成が崩れる典型パターンは決まっている。指の本数、余分な手足、画面内の文字やロゴ、不自然な髪の流れ、過剰な被写界深度、意図しない人物の増殖。これらは毎回ネガティブ側に明記する。

加えて「カメラの急なパン」「手ぶれ」「ズーム」も、作品のトーンによっては禁止したほうがよい。AIは指示がないと派手な動きを足したがる傾向があるため、抑制の指示は明示的に書く。

視覚的一貫性を守る参照画像ワークフロー

3つの台帳をつくる

一貫性は才能ではなく管理で担保する。最低限、次の3つの台帳を用意する。

  1. キャラクター台帳:正面・横・背面の静止画、衣装の色コード、身長の目安、特徴的な小物
  2. プロップ台帳:重要アイテムの形状、素材、色、傷や汚れの程度
  3. 環境台帳:主要ロケーションの広角カット、光源の位置、床と壁の素材

台帳は画像だけでなく、短い言語記述を添える。画像だけでは、モデルが別の角度から見たときに同一性を保てないことがある。言語と画像の二重指定が効く。

前後フレーム制御と画像→動画の併用

カットの始点と終点を静止画で固定し、その間を生成させる手法は、連続性の維持に非常に強い。とくに人物が歩く、扉が開く、乗り物が通過するといった動作では、始点と終点を決めておくだけで破綻が激減する。

また、重要なカットは画像生成でルックを固めてから動画化する。動画生成から始めると、構図・照明・衣装がすべて同時に揺れるため、修正の手がかりが失われる。静止画で「正解」を作っておけば、動画側でぶれたときに比較対象が存在する。

ルックの固定:色とレンズ感

作品全体のカラーパレットを5色以内で決め、それを数値や言葉で共有する。暗部に青、中間調に灰色、ハイライトにごく淡い白。この程度の単純なルールでも、カット間の統一感は大きく変わる。

レンズ感も統一する。広角の歪みを使うカットと、望遠の圧縮を使うカットを混在させると、同じ世界に見えなくなる。ロケーションごとに使う画角を決めておくのが安全だ。

ツールの役割分担と選定基準

生成モデルの選び方

動画生成モデルは、大きく3タイプに分けて考えると選びやすい。

  • 制御重視型:始点・終点の指定や、カメラ指示への追従性が高い。長回しや連続性が必要なカットに向く。
  • 質感重視型:人物の肌、布、光の描写が豊か。アップの芝居に向くが、動きの一貫性は劣ることがある。
  • 速度重視型:短いカットを大量に試すのに向く。テスト生成や、編集で細かく切る前提の素材づくりに適する。

作品全体を1つのモデルで統一する必要はない。ただし「どのシーンをどのタイプで作るか」を先に決めておかないと、質感の差が目立つ。ロケーション単位・光の状態単位でモデルを固定するのが実務的だ。

静止画・編集・音の担当

工程 目的 代表的な選択肢 選定のポイント
静止画生成 ルック開発、参照画像 画像生成ツール全般 同一キャラの再現性
動画生成 カット素材 動画生成ツール全般 制御性と尺の上限
アップスケール 解像度と質感補正 動画補正ツール 時間方向のちらつき抑制
編集・合成 時間構造の構築 一般的な編集ソフト タイムラインの扱いやすさ
音声 台詞、環境音、音楽 音声合成・楽曲生成ツール 尺合わせとトーン統一

重要なのは、生成ツールに編集まで任せないこと。時間構造の組み立ては必ず編集ソフトのタイムラインで行う。生成側で凝った編集をしようとすると、再生成のたびに構造が壊れる。

制作ワークフロー:7ステップ

ステップ1:ログラインと時間の地図

1行のログラインと、前述の時間の地図を書く。ここで「観客がどこで何を理解するか」を決めておく。AI生成は情報の出し方を制御しにくいので、理解の順序は脚本側で握る。

ステップ2:ルック開発

キーとなる3〜5カットを静止画で作り込む。色、光、素材感、衣装をここで確定させる。この段階で納得できないものは、動画にしても納得できない。

ステップ3:ショットリストとプロンプト表

全カットを表に落とし、前述の文法で1行プロンプトに変換する。尺も必ず書く。尺が決まっていないと、編集で切る前提の素材になり、構図が破綻する。

ステップ4:テスト生成と再現性の確認

各ロケーションから1カットずつテスト生成し、同じプロンプトで再度生成して、どれだけ近い結果が出るかを確認する。再現性が低い設定は、本生成の前に必ず修正する。

ステップ5:本生成

カットごとに3〜5テイク生成し、最も破綻の少ないものを採用する。採用基準は「美しさ」ではなく「前後のカットと繋がるか」。単体で美しくても繋がらない素材は捨てる。

ステップ6:編集・合成・アップスケール

編集ソフトで並べ、不要部分を切る。VFX要素(画面内モニター、光のフレア、粒子)を重ね、最後にアップスケールする。順序を逆にすると、合成の縁が目立つ。

ステップ7:音響とカラー

環境音、効果音、音楽、台詞を配置し、全体のカラーを整える。ここで各カットの色を揃え、明度差を調整すると、別々に生成した素材が同じ作品に見え始める。

よくある失敗と処方箋

時間が破綻する

原因はほぼ「因果情報をプロンプトに書いていないこと」。直前のカットの状態(人物の位置、手に持っている物、光源)を1行で書き足すだけで改善する。

顔と衣装が変わる

参照画像1枚では足りない。複数角度の参照と、色コードの言語指定を併用する。衣装は「素材+色+ディテール」の3要素で書く。

物理が不自然

落下、衝突、水しぶきは苦手分野だ。こうしたカットは尺を短くし、音と編集で見せる。無理に長回しにしない。

カメラが暴れる

ネガティブ指定で「パン、ズーム、手ぶれ」を禁じ、ポジティブ側で動きを1つだけ指定する。カメラの動きは1カット1種類が原則。

画面が過剰に細かい

情報量が多すぎると、視聴者は物語を追えない。前景の要素を減らし、被写界深度で整理する。AIは放っておくと装飾を足す。

音と映像がずれる

尺の端数を切り捨て、音の頭を数フレーム早める。低い持続音を敷くと、動きの硬さが聴覚的に隠れる。

公開前の品質チェックリスト

  • 時間の地図と実際の並びが一致しているか
  • 同じロケーションの光源方向が全カットで揃っているか
  • 主要キャラクターの衣装と髪が全カットで同一か
  • 画面内に不要な文字・ロゴが写っていないか
  • カメラの動きが1カット1種類に収まっているか
  • カットの尺が編集のリズムに合っているか
  • 無音の区間が意図的に配置されているか
  • 色温度がシーン間で急変していないか
  • アップスケール後のちらつきが許容範囲か
  • 冒頭30秒で世界のルールが伝わるか

FAQ:制作の疑問に答える

Q. 1カットの長さはどれくらいが適切ですか。

A. 生成の安定性を考えると4〜6秒が扱いやすい。長いカットが必要な場合は、同じ構図で複数生成し、編集で繋いで疑似的な長回しを作る。

Q. 静止画から始めるべきか、動画生成から始めるべきか。

A. ルック開発は静止画、動作の生成は動画、と役割を分けるのが最も効率的だ。最初から動画で詰めようとすると、修正の基準が失われる。

Q. 人物の同一性はどこまで担保できますか。

A. 参照画像の複数角度+言語による特徴記述+前後フレーム制御の3点を組み合わせれば、実用レベルに近づく。それでも完全ではないため、顔のアップは最小限にし、後ろ姿や手元、シルエットで見せる演出も併用したい。

Q. プロンプトは日本語と英語のどちらが良いですか。

A. 英語のほうが細かいニュアンスが通りやすい場面が多い。ただし日本語で構造を設計し、英語に変換する二段階方式にすると、思考の整理と精度を両立できる。

Q. 作業時間を短縮する最大のコツは。

A. 台帳とプロンプト表を先に作り、テスト生成で再現性を確認してから本生成に入ること。行き当たりばったりで生成を繰り返すより、結果的に数倍速い。

Q. 学習のために最初に作るべき作品は。

A. 3分、1ロケーション、登場人物1人、台詞なしの短編を勧める。時間構造の実験だけに集中でき、破綻の原因も特定しやすい。

次の一歩:小さく作って大きく育てる

知的なハードSFをAIで作る作業は、技術の習得というより、管理の設計に近い。時間の地図、空間のルール、音の設計。この3枚の紙を先に用意し、生成はその紙に従わせる。順番を守るだけで、作品の完成度は驚くほど安定する。

まずは3分の短編を1本、最後まで通してみてほしい。最後まで通した経験だけが、次の長編の判断材料になる。

Alexander

Alexander