なぜプロシージャル生成とAI映像生成を掛け合わせるのか
Unityのプロシージャル生成が得意とするのは、広大な地形、植生の分布、建物の反復、道路網の分岐、洞窟の形状といった「構造」を、シード値とパラメータから機械的に作り出すことだ。同じ世界観を保ったまま、ロケーションだけを数十パターン量産できる。これは美術スタッフが手作業でモデリングする場合と比べて、桁違いの速度でバリエーションを確保できるという意味を持つ。
対して生成AIによる映像制作が得意なのは、質感の解釈、光の情緒、被写体のディテール、映像全体のトーンだ。プロンプトや参照画像を通じて「雨上がりのネオン街」「水彩画のような淡い夕景」といった抽象度の高い指示を、ピクセルレベルの表現に落とし込める。
この二つを直結させると、構造はプロシージャルに、質感はAIに、という分担が成立する。ところが実際に手を動かすと、多くのチームが同じ壁にぶつかる。環境のバリエーションが増えるほどスタイルがばらつき、AI側がUnityの空間情報を理解できず、合成の段階で接地や影が破綻する。この記事では、その壁を一つずつ分解し、再現可能なワークフローとして組み立てていく。
役割分担を先に決める
最初に決めるべきは技術ではなく責任範囲だ。プロシージャル生成側が出力するのは、形状、配置、カメラ、深度、法線、セグメンテーションマスクといった「空間的な事実」である。AI生成側が担うのは、その事実に質感とスタイルを与える「解釈」だ。
この線引きを曖昧にしたまま進めると、AIに形状まで作らせようとして破綻したり、逆にUnity側でテクスチャをすべて焼き込んでAIの利点を消してしまったりする。まず「誰が何を決めるか」を表に落とすところから始めたい。
よくある誤解
「AIに任せれば3Dエンジンは不要になる」という誤解がある。しかし、カメラの動き、被写体の接地、遮蔽関係、影の落ち方が物理的に正しくない映像は、どれだけ質感が美しくても視聴者に違和感を与える。逆に「3Dで全部作ればAIは不要」という誤解もあるが、人手では到底まかないきれない量の質感バリエーションを、AIは短時間で提示してくれる。両者は競合ではなく、工程の異なる層を担当する。
ワークフロー全体像を5つのステージで捉える
連携ワークフローは、思いつきで組むと必ず破綻する。まず全体を5つのステージに分けて可視化しておこう。ステージを分ける目的は、失敗したときに「どの段階で壊れたのか」を切り分けられるようにすることにある。
ステージ1:プリプロダクション設計
世界観、映像の尺、カット数、画面比率、フレームレート、配色の方向性を決める。ここで決めた情報は、後工程のプロンプト、参照画像、カラースクリプトの基準になる。特に「避けたい表現」を先に言語化しておくと、AI生成のやり直しが激減する。
ステージ2:プロシージャル環境の構築
Unity側でシード値を管理し、地形、配置、ライティングのバリエーションを生成する。各バリアントには一意の識別子を付け、後から同じ環境を再現できる状態にしておく。再現できない環境は、AI生成との反復作業において致命的な障害になる。
ステージ3:AI映像生成
プロシージャル環境から抽出した参照フレーム、深度、マスクをもとに、AIで質感と動きを生成する。ここでは「カット単位」で作業を閉じることが重要で、シーン全体を一度に生成しようとすると修正コストが跳ね上がる。
ステージ4:合成と整合
AI生成の出力と、Unity側のカメラ情報、マスク、深度を合成する。接地、影、遮蔽、モーションブラーの方向を揃える工程だ。合成の段階で問題が見つかることが多いため、ここで初めて気づくのではなく、事前にチェック項目を用意しておきたい。
ステージ5:レビューと反復
カットを並べて通しで確認し、テンポ、色、光量の連続性を調整する。AI生成は同じプロンプトでも結果が揺れるため、採用カットを固定してから次のカットへ進む「ロック方式」が安定しやすい。
Unity側の準備:AIに渡せる形へデータを整える
この工程が、連携ワークフローの成否を最も大きく左右する。AIは賢いが、Unityのシーン構造をそのまま理解してくれるわけではない。渡し方を設計する必要がある。
シード値とバリアントの管理
プロシージャル生成では、シード値、パラメータセット、使用したスクリプトのバージョンをセットで記録する。たとえば「地形シード 4821 / 植生密度 0.7 / 岩のスケール分散 1.3」といった具合だ。これをカット番号と紐づけておけば、AI生成の結果が気に入らなかったときに、環境側を微調整して再生成できる。
記録がない状態で「あの感じをもう一度」と依頼が来るのが、最も時間を失うパターンである。自動でログを書き出す仕組みを最初に用意してしまうのが結局は速い。
エクスポートするプレートの種類
AI生成と合成のために、以下のプレートを書き出すのが実務的だ。
- カラー(トーンマッピング済みの鑑賞用)
- リニアのハイダイナミックレンジ画像
- 深度パス(正規化の基準を必ず記録する)
- 法線パス(ライティングの再解釈に有効)
- オブジェクト識別マスク(キャラクター、前景、背景、空)
- モーションベクター(動きの整合に使う)
すべてを毎回書き出す必要はない。カットの性質に応じて必要なパスだけを選ぶ。たとえば静的な風景カットなら深度とカラーだけで足りるが、キャラクターが走るカットではモーションベクターと識別マスクが効いてくる。
カメラパラメータとメタデータの標準化
焦点距離、センサーサイズ、画角、カメラ高、ロール、被写界深度の設定を、カットごとにテキストで書き出す。AI側のプロンプトや合成設定にこの数値を反映させることで、レンズ感の不一致を減らせる。
特に焦点距離は効果が大きい。広角で撮ったカットを望遠的な圧縮表現で生成してしまうと、同じ場所のはずなのに別の空間に見えてしまう。数値を必ず引き継ぐ習慣をつけたい。
命名規則を先に決める
scene01_shotA_v003_beauty.png のような命名規則を最初に固定する。命名がばらつくと、スクリプトによる一括処理が書けなくなり、手作業の突合作業が発生する。手作業の突合はミスの温床であり、後半になるほど効いてくる。
スタイルの一貫性を設計する
プロシージャル生成の最大の利点は多様性だが、AI生成と組み合わせる場面では、その多様性がスタイルのばらつきとして表面化する。ここを制御するのがワークフロー設計の中心になる。
参照画像は「セット」で作る
1枚の参照画像だけを渡すと、AIはその1枚に過剰に寄り、他の要素を無視することがある。環境の参照は、少なくとも次の3種類を用意したい。
- 全体のトーンを示すワイドショット
- 質感と素材感を示すクローズアップ
- ライティングの方向と色温度を示す逆光または側光のカット
この3枚をセットで使い、それぞれの役割をプロンプトで明示すると、生成結果の安定度が大きく変わる。
プロンプトを階層化する
プロンプトは一枚岩で書かず、階層に分ける。上位層は作品全体で固定する要素(世界観、時代、色調、レンズ感)。中位層はシーン単位で変える要素(天候、時間帯、場所の性格)。下位層はカット単位で変える要素(被写体の動作、カメラの動き、強調したい質感)。
上位層を固定しておけば、シーンをまたいでも世界観が崩れにくい。逆に上位層を毎回書き直すと、カットごとに別作品のような見た目になる。
カラースクリプトと色変換の扱い
撮影後の色調整で使う色変換の情報は、AI生成の段階で先に決めておくほうがよい。生成後に強く色を寄せると、ディテールが潰れて質感の差が消えてしまう。
実務的には、AI生成の出力はやや平板に、色は控えめに着地させ、その後で作品共通の色変換をかける。こうすると全カットに同じ色の基準が適用され、統一感が生まれる。
スタイルのドリフトを検知する仕組み
同じプロンプトを使い続けても、参照画像の差し替えやモデルの切り替えで少しずつ絵柄がズレていく。これを検知するために、各カットから代表フレームを1枚抜き、一覧にして並べる「コンタクトシート」を毎回作る。並べた瞬間にズレは目視で分かる。数値で管理するよりも、この目視チェックのほうが速くて確実だ。
AI生成キャラクターと環境のインタラクション設計
キャラクターが環境の中に立つとき、視聴者が無意識に確認している情報は決まっている。接地、影、遮蔽、スケール感。この4つが揃っていれば、質感が多少粗くても違和感は出にくい。
接地と影を最優先にする
キャラクターの足元と地面の接触点がずれると、どんなに顔が美しくても不自然に見える。Unity側で得られる接地位置の情報を、AI生成の後処理または合成時に必ず反映させる。影は、環境側のライティング方向と一致させる。太陽の向きがカットごとに変わっていると、時間の連続性が壊れる。
マスクを活用した遮蔽処理
プロシージャル環境の手前に草、柵、柱などがある場合、キャラクターの一部が隠れる。AI生成はこの遮蔽関係を理解しないことが多いため、識別マスクを使って手前の要素を後から重ねる。あるいは、生成の段階でマスクを条件として渡し、遮蔽部分を避けさせる。
この処理を怠ると、キャラクターが草を突き抜けて見えたり、逆に手前の要素が消えたりする。視聴者は「なんとなく変」と感じるが、原因を言語化しにくい。だからこそ工程として明示的に扱うべきだ。
スケール感の基準を置く
プロシージャル生成はスケールを見失いやすい。木の高さ、階段の段差、ドアの高さ。人間の身長を基準にしたスケールの目安を、シーン内に必ず1つ置いておく。AI生成時にもその基準をプロンプトや参照画像で伝えると、巨大な建物と小さな人物のバランスが破綻しにくくなる。
動きとカメラワークの同期
カメラが動くカットでは、AI生成の動きとカメラの動きが二重に作用する。ここを揃えないと、視聴者は乗り物酔いのような不快感を覚える。基本方針は「カメラの動きはUnity側で決め、AIには被写体と質感の動きに集中させる」ことだ。カメラワークまでAIに委ねると、制御が効かなくなる。
ショットプランニングとモデル運用の実務
カット数が増えてくると、どのカットにどの生成手法を使うかという判断が作業効率を左右する。
絵コンテからショットリストへ
まず絵コンテを書き、それをショットリストに変換する。ショットリストには、カット番号、尺、カメラワーク、登場人物、必要な参照画像、使用する生成手法、担当者、進捗を列として持たせる。表計算で十分だ。
この表があると、進捗の把握が容易になり、抜け漏れも防げる。逆にこれがないと、終盤になって「このカット誰も作っていない」という事故が起きる。
生成手法の使い分け基準
すべてのカットを同じ手法で作る必要はない。判断の目安は次のとおりだ。
- 静的な風景で質感が主役のカット:参照画像主導の生成が向く
- 人物の演技が主役のカット:動きの再現性が高い手法を選ぶ
- 複雑な遮蔽があるカット:合成前提で要素を分けて生成する
- 短いカットの連続:テンポを優先し、ディテールの作り込みを抑える
カットの目的を先に言語化してから手法を選ぶと、判断がぶれない。
尺とテンポの設計
AI生成のカットは、つい長く見せたくなる。しかし実際の映像では、1カットの尺は短いほうが緊張感が出る。生成に時間をかけたカットほど長く使いたくなる誘惑があるが、編集のテンポを優先すべきだ。
目安として、アクションの連続では短めに刻み、情景を見せるカットではやや長めに取る。この緩急が、生成映像の単調さを防ぐ。
データ連携とパフォーマンス最適化
プロシージャル生成とAI生成の往復が増えると、データ量が急速に膨らむ。ここを設計しないと、ストレージと転送で作業が止まる。
フォルダ構造を固定する
プロジェクト単位、シーン単位、カット単位、バージョン単位で階層を固定する。たとえば project/scene01/shotA/v003/ の中に、プレート、マスク、メタデータ、生成結果を分けて置く。構造が固定されていれば、スクリプトで一括処理できる。
中間ファイルの形式選定
中間ファイルは、圧縮による劣化とファイルサイズのバランスで選ぶ。色情報を保ちたいプレートは可逆圧縮または非圧縮、確認用のプレビューは軽量な形式にする。深度パスはビット深度が重要で、8ビットでは階段状の縞が出やすい。
処理を分散する
生成処理は待ち時間が長い。1台のマシンで順番に処理すると、待ち時間だけで作業時間が埋まる。カット単位で並列に処理できる体制を組むと、体感速度が大きく変わる。
また、重い処理の前に軽いプレビューで構図を確認する「粗い反復」を挟むと、無駄な高品質生成を減らせる。まず低解像度で方向性を固め、採用が決まってから高品質で回す。
ストレージの寿命を意識する
バージョンをすべて残すと、数カットのプロジェクトでも容量がすぐに逼迫する。採用版、直前の1版、参照用の代表フレームを残し、それ以外は一定期間で整理する運用が現実的だ。ただし、シード値とパラメータの記録だけは必ず残す。これがあれば環境は再生成できる。
よくある失敗とトラブルシューティング
連携ワークフローで発生する問題は、ある程度パターン化されている。原因と対処をあらかじめ知っておくと復旧が速い。
ちらつき・フレーム間の揺れ
フレームごとに質感が微妙に変わり、パラパラとちらつく現象。原因は大きく3つある。参照画像の不足、動きの指定が曖昧、フレーム間で条件が変わっていること。対処としては、参照画像を増やし、動きの記述を具体化し、前フレームの出力を条件として引き継ぐ。
スタイルのドリフト
カットを進めるうちに絵柄が変わっていく現象。原因は上位層のプロンプトが固定されていないこと、または参照画像のセットがカットごとに違うこと。対処は、上位層のプロンプトをテンプレート化し、参照画像のセットを全カットで共有すること。
ライティングの不一致
太陽の向き、影の長さ、色温度がカット間で揃わない現象。プロシージャル環境のライティング設定をエクスポートし、それをAI生成の条件に含めることで改善する。特に影の方向は目立つので優先的に揃える。
解像度不足による破綻
生成解像度が低いと、細部が溶けて質感が失われる。アップスケールでごまかすと不自然な輪郭が出る。重要なカットは最初から高解像度で生成し、確認用の低解像度版とは別管理にする。
色が破綻する
色空間の扱いを誤ると、彩度が跳ねたり暗部が潰れたりする。リニアで処理し、表示用の変換は最後に一度だけかける。工程の途中で何度も色変換をかけると、情報が失われて戻せなくなる。
尺が合わない
生成したカットの尺が想定と合わず、編集で引き伸ばして不自然になる現象。生成前に尺を固定し、その尺で成立する動きを指示する。後から伸ばす前提の生成は避ける。
チーム運用・レビュー・ハンドオフ
個人作業なら不要でも、複数人で進める場合は運用設計が品質を決める。
バージョン管理の考え方
ファイル名にバージョンを持たせ、どの版が最新かを明確にする。加えて、誰がいつ何を変えたかを短く記録する。変更履歴は長文でなくてよい。「影の方向を修正」「参照画像を差し替え」程度で十分機能する。
レビューの単位を決める
カット単位で承認を取り、シーン単位で通し確認をする。カット単位の承認を飛ばしていきなり通しで見ると、修正が広範囲に波及する。承認の粒度を決めておくことが、結果として手戻りを減らす。
フィードバックの言語化
「なんか違う」というフィードバックは、AI生成において最も困る種類の指摘だ。そこで、フィードバックの観点をあらかじめ項目化しておく。色、光、構図、動き、質感、テンポ。どの項目に対する指摘なのかを特定するだけで、修正の打ち手が明確になる。
引き継ぎ資料の最小構成
プロジェクトを他者に渡すとき、最低限必要なのは次の情報だ。世界観の設定、上位層のプロンプト、参照画像のセット、シード値とパラメータの記録、カメラプリセット、命名規則、ディレクトリ構造。これが揃っていれば、受け取った側は同じ環境を再現できる。
よくある質問
Unityを使わずに同じことはできるか
可能だが、空間情報を別の方法で用意する必要がある。深度、カメラパラメータ、遮蔽マスクを別のツールで作れれば、考え方は同じように適用できる。重要なのはツール名ではなく、「空間的な事実をAIに渡す」という原則だ。
どこから始めるべきか
まず1カットだけ、プロシージャル環境からAI生成、合成までの工程を通してみる。そこで詰まった箇所が、自分のプロジェクトにおける本当の課題である。全体設計を先に固めようとすると、実際に手を動かす前に時間を使い切ってしまう。
生成結果が安定しないときは
参照画像、プロンプトの階層、シード値、解像度の4点を確認する。多くの場合、このうちのどれかが工程ごとに変わっている。変数を1つずつ固定していくと、原因が特定できる。
どのくらいのカット数から管理が必要になるか
10カットを超えたあたりから、表による管理がないと厳しくなる。逆に数カットの検証段階では、表を作るより手を動かしたほうが速い。規模に応じて管理の重さを変えるのが現実的だ。
クオリティと速度のバランスはどう取るか
カットの重要度で分けるのが基本だ。物語の要になるカットは時間をかけて作り込み、つなぎのカットはテンポ重視で割り切る。すべてのカットに同じ労力をかけると、全体の完成が遅れる。
生成物の権利や利用条件は
利用するツールや素材ごとに条件が異なるため、制作前に必ず確認する。特に、参照画像として使う素材の出所は明確にしておく。出所が不明な素材を参照に使うと、後工程で差し戻しになるリスクがある。
学習データを自作する必要はあるか
作品固有の質感を強く出したい場合には有効だが、まずは参照画像とプロンプトの設計を詰めるほうが費用対効果が高い。参照画像の設計で解決できる問題は多い。
まとめ:連携は「渡し方」で決まる
プロシージャル生成とAI映像生成の連携は、特別な魔法ではなく、工程設計の問題である。構造はリアルタイム3Dエンジンに、質感は生成AIに。その間に立つのは、シード値、深度、マスク、カメラパラメータ、命名規則といった地味なデータの受け渡しだ。
最初に押さえるべきは、役割分担、ステージ分割、データの標準化の3点である。この3点が整っていれば、参照画像の設計やモデルの使い分けといった上流の工夫が効いてくる。逆にここが崩れていると、どんなに優れた生成手法も安定して機能しない。
まずは1カットでよい。環境を作り、必要なプレートを書き出し、AIに渡し、合成し、通しで見る。この一周を最短で回したチームが、次のカットで必ず速くなる。

