フォトリアルAI動画が「実写級」に見える条件
実写級という言葉は便利だが曖昧でもある。4Kで書き出しても実写に見えない映像はいくらでもあるし、逆に短いカットなら驚くほど実写に近い映像も作れる。差を分けているのは解像度や計算量ではなく、次の5つの整合性だ。
1. 光の整合性。 画面内のすべての影は、同じ光源から説明できなければならない。顔の右側にハイライトがあるのに、机の上のコップの影が左に落ちていれば、視聴者は理由を言語化できないまま違和感を覚える。逆光なら輪郭にリムライトが出るし、窓光なら光源の方向は一方向に揃う。
2. 質感の多様性。 実写の画では、肌、布、金属、ガラス、木がそれぞれ違う反射を返している。AI生成映像が不自然に見える最大の原因は、すべての素材が同じツルツルした反射になっていることだ。肌には毛穴と産毛、布には織り目、金属には粗い反射と微妙な汚れ、ガラスには屈折と反射の混在が必要になる。
3. 動きの物理性。 人間の動きには必ず加速と減速がある。一定速度でスライドする被写体、慣性を無視した髪や衣装、重心が移動しない歩行は、たとえ1秒でも不自然に映る。
4. レンズの描写。 実写の映像は必ずレンズを通っている。被写界深度、周辺減光、わずかな収差、玉ボケの形。これらが欠けると、どこかCGめいた均一な画になる。スマートフォンで撮った映像にも、レンズなりの癖がある。
5. 時間的一貫性。 フレームが進むにつれて背景の小物が消えたり、シャツのシワが別物になったりしないこと。長回しに見えるカットほど、この一貫性が試される。
逆に、いわゆる「AIっぽさ」の正体はおおむね次のパターンに集約される。肌がプラスチックのように均一、輪郭が過剰にシャープ、髪の毛が溶けるように背景と混ざる、手や指の関節が崩れる、背景の文字が意味不明、カメラが常に一定速度で滑らかに動く、画面全体にパンフォーカスがかかる。これらはすべて、プロンプト設計とポストプロダクションの段階である程度抑え込める。
重要なのは、これらを生成モデルの性能だけに帰属させないことだ。同じモデルを使っても、参照画像の作り方、プロンプトの書き方、ショットの設計、編集の仕方で結果は大きく変わる。以下の章では、その差を生む具体的な手順を順に扱う。
制作パイプラインの全体像
フォトリアルな映像を安定して作るには、思いつきでプロンプトを打つのではなく、工程を分けて上流から固めていく。実写の撮影現場と同じで、準備の質がそのまま最終的な画の質になる。
| 工程 | 目的 | 主な成果物 | チェックポイント |
|---|---|---|---|
| 1. 企画・脚本 | 誰に何を伝えるかを決める | 企画メモ、尺、トーン | 尺と配信先が決まっているか |
| 2. デザイン設計 | 世界観と人物を固定する | キャラクターシート、ロケ資料 | 参照画像の枚数は足りているか |
| 3. ショットリスト | カット割りを先に決める | カット表、尺、カメラ指示 | 各カットの役割を一言で言えるか |
| 4. 生成 | カット単位で映像を作る | 各カットのクリップ | 光と人物が揃っているか |
| 5. 編集・ポスト | つなぎ、質感、音を整える | タイムライン、音声ミックス | つなぎ目が目立たないか |
| 6. 品質チェック | 破綻を潰して書き出す | 最終マスター | スマホ画面で違和感がないか |
この中で最も省略されやすいのが工程2と3だ。いきなり生成に入ると、カットごとに人物の顔も光もバラバラになり、後から揃える作業で膨大な時間を失う。逆に、参照画像とショットリストが固まっていれば、生成は作業に近くなり、判断のぶれが激減する。
各工程では「決定を固定する」という考え方も重要になる。衣装の色、時間帯、天候、レンズの焦点距離、カメラの高さ。これらを短い言葉や数値で明文化しておき、すべてのカットで同じ記述を使い回す。感覚で毎回書き直すと、必ずどこかで破綻する。
もう一つの原則は、カットを短く切ることだ。1カットを10秒つなぐより、2〜3秒のカットを積み重ねたほうが、破綻が露出する時間が短くなり、結果として実写らしさが上がる。映画の予告編が短いカットの連続で成立しているのは、情報量とリズムの問題だけではない。
プロンプト設計:被写体・光・レンズ・質感を具体化する
プロンプトは思いついた形容詞を並べるものではなく、撮影指示書に近い。実写の撮影で助監督が共有する情報、つまり「誰が」「何をしていて」「どこにいて」「どんな光で」「どんなレンズで」「どんな質感で」を順番に書く。
構造化テンプレート
基本の並びは次のとおりだ。
[被写体と人物描写] + [動作と感情] + [環境と時間帯] + [光源の種類と方向]
+ [レンズとカメラ設定] + [質感・フィルム特性] + [除外したい要素]
たとえば30代の女性がカフェで手紙を読むカットなら、次のように書く。
30代の女性、薄いシワのある白いシャツ、自然な肌の質感と毛穴、軽く前かがみになって
手紙を読む、集中した表情で時々まばたきする、木製のテーブル、湯気の立つコーヒーカップ、
午後3時の窓からの柔らかい自然光、左斜め上からのキーライト、右側に淡いフィルライト、
50mmレンズ、f/1.8、浅い被写界深度、わずかなフィルムグレイン、色温度5600K、
過剰なHDR、プラスチックのような肌、アニメ調、彩度の高すぎる色
日本語で書いてもよいが、対応モデルによっては英語のほうが指示の再現性が高いことがある。言語を切り替えると結果が変わる場合は、どちらかに統一したほうが一貫性を保ちやすい。
光の指定は「方向」と「柔らかさ」で決める
「美しい光」は指示として機能しない。使えるのは、光源の種類(自然光、窓光、蛍光灯、街灯、焚き火、スマホの画面光)、方向(正面、45度、逆光、真上、真下)、質(硬い、柔らかい、拡散)、色温度だ。
逆光は輪郭を分離させ、被写体を背景から浮かび上がらせる。ローキーの室内なら、窓からの一筋の光と、暗部の落ち込みで立体感が出る。逆に、フラットな正面光は破綻が目立ちにくいという実務的な利点もある。最初のテストでは、破綻の少ない柔らかい光から始めるのが安全だ。
実用的なコツとして、画面内に光源そのものを入れると説得力が増す。机の上のスタンド、奥の窓、背景のネオン。光源が見えていれば、視聴者は影の方向を無意識に納得する。
レンズとカメラ設定を数値で入れる
焦点距離と絞りは、被写界深度とパースに直結する。人物のバストアップなら50mmから85mm、環境を見せたいワイドなら24mmから35mm。f値が小さいほど背景がぼけ、被写体が分離する。
数値を入れる利点は再現性だ。「浅い被写界深度」と書くより「50mm、f/1.8」と書いたほうが、カット間でボケ量が揃いやすい。カメラの高さも指定できるなら指定する。目線の高さ、胸の高さ、地面すれすれ。高さが変わると、同じ場所でも別の空間に見える。
質感と「欠陥」を足す
実写らしさを最も手早く上げるのは、欠陥を足すことだ。完璧な画は嘘に見える。
- 肌:毛穴、産毛、わずかな赤み、汗の艶
- 布:織り目、シワ、ほつれ、洗濯による色落ち
- 環境:埃、水滴、指紋、床の傷
- 光学:レンズフレア、わずかな収差、周辺減光、フィルムグレイン
これらは「汚す」のではなく「物理的に説明できるノイズ」を足す作業だ。加えすぎると逆に汚く見えるので、書き出し後に10%ほど減らすつもりで指定するとよい。
除外指定は控えめに
ネガティブ指定は有効だが、長い呪文のようなリストは効きが悪くなることが多い。優先度の高い3〜5項目に絞る。たとえば「過剰なシャープネス、プラスチック質の肌、指の変形、背景の文字化け、彩度過多」程度だ。
一貫性を保つ:キャラクター・衣装・環境
カットをまたいで同じ人物に見えるかどうかは、フォトリアル映像の最大の難所だ。ここを制御できれば、作品としての説得力は一気に上がる。
参照画像を工程として作る
生成の前に、人物の参照画像を用意する。正面、斜め45度、横顔、全身、表情違い。可能なら同じ衣装で、同じ光の条件で揃える。これを1枚だけに頼ると、角度が変わるたびに別人になる。
複数の参照画像を同時に渡せる機能がある場合は、役割を分けて使うと精度が上がる。1枚目を顔の基準、2枚目を衣装、3枚目を髪型、4枚目をロケーションの基準にする。全部を1枚に詰め込むより、役割分担したほうが干渉が減る。
固定すべき変数を決める
一貫性のために固定するのは、次の項目だ。
- 人物の記述(年齢、髪、肌、体型、服装)
- シード値(対応している場合)
- プロンプトの語順と語彙
- 焦点距離、絞り、カメラの高さ
- 時間帯、天候、色温度
- 小道具の位置(カップ、鞄、椅子)
語順を変えるだけでも結果は揺れる。カットごとに文章を書き直すのではなく、テンプレートの可変部分だけを差し替える運用が最も安定する。
環境の連続性を台帳で管理する
ロケーションの連続性は、記憶では守れない。簡単な台帳を作る。
| 項目 | 記録する内容 |
|---|---|
| 時間帯 | 朝、昼、夕方、夜、曇天 |
| 光源 | 窓の位置、照明の種類、色温度 |
| 小道具 | 置き場所、向き、数量 |
| 衣装 | 色、素材、汚れの状態 |
| 天候 | 晴れ、雨、雨上がり、霧 |
たとえば前半で雨が降っていたなら、後半のカットでも地面の濡れと傘の水滴が残っていなければならない。この種の細部は、視聴者に明確には認識されないが、違和感として蓄積する。
ショット設計とカメラワークの作り方
生成してから構図を考えるのは非効率だ。先にカット表を作り、各カットの役割と尺を決める。
基本のショット構成
短い映像でも、次のリズムがあると実写らしくなる。
- 確立カット(ワイド):場所と時間を示す
- ミディアム:人物と状況を示す
- クローズアップ:感情と細部を見せる
- インサート:手元、小道具、質感を見せる
- リバース:相手役や視線の先を見せる
フォトリアルな質感は、実はインサートカットで最も効く。手元やテーブルの上の小物は、破綻が目立ちにくく、質感の説得力が高い。逆に顔のアップは最も破綻が露出するので、参照画像と光の設計に自信が持てるまで後回しにしてよい。
カメラモーションの語彙を統一する
カメラの動きは、動詞として明確に指定する。
- ゆっくりしたドリーイン/アウト
- 左右へのパン、上下へのティルト
- 被写体を中心にしたオービット
- 手持ちのわずかな揺れ
- 固定カメラ(三脚)
注意すべきは、動きの速度を必ず添えることだ。「ゆっくり」「ごくわずかに」といった副詞がないと、多くのモデルは一定速度の機械的な移動を生成する。手持ちの揺れを入れる場合は、振幅を小さく指定する。大きすぎると酔いを誘発する。
もう一つのコツは、被写体の動きとカメラの動きを同時に大きくしないことだ。人物が歩きながらカメラも大きく回り込むと、破綻率が跳ね上がる。どちらかを主役にする。
尺とテンポ
1カットあたり2〜4秒を基本にし、感情の山場だけを5秒以上にする。生成が得意なのは短いカットだ。長いカットは、途中で服のシワや背景が変わるリスクが高まる。
カット間は、アクションでつなぐと自然に見える。手を伸ばす動作の途中でカットを切り替える、視線の動きに合わせて切り替える。同じ画面サイズのカットを連続させないことも、単調さを避ける基本だ。
ライティングとカラーの設計
光は被写体を照らすだけでなく、物語の時間と感情を運ぶ。
3点照明を意識する
キーライト(主光)、フィルライト(補助光)、リムライト(輪郭光)。この3つを言葉で指定できると、立体感が一気に増す。顔が平らに見える映像は、多くの場合キーとフィルの比率が1対1に近く、リムがない。
キーとフィルの比率は、暗い側の落ち込みで調整する。4対1なら硬質で劇的、2対1なら自然で穏やか。インタビュー風なら2対1、広告の商品カットなら3対1あたりが扱いやすい。
リムライトは、被写体と背景を分離する。暗い背景に暗い服を着た人物を置くと、シルエットが溶けてしまう。肩や髪に細い光の線があるだけで、人物が背景から前に出る。
カラースクリプトを先に決める
映像全体の色の流れを先に決めておく。たとえば「導入は青みのある曇天、中盤は暖色の室内、結末は夕方のオレンジ」。この設計があると、カットごとの色温度が散らばらない。
色温度は数値で指定できる。5600Kは昼光、3200Kは暖色の室内、7000K以上は青い影。カットごとに混ぜると、途端に安っぽく見える。
グレーディングは肌色を基準に
編集での色調整は、肌色を基準にすると失敗しにくい。肌の赤みが不自然に強調されていないか、緑に寄っていないか。背景の色より、人物の肌を優先して合わせる。
コントラストを上げると実写的な締まりは出るが、上げすぎると影が潰れる。ハイライトとシャドウの両端を確認しながら、控えめに調整するのが安全だ。
ポストプロダクション:生成後をどう仕上げるか
生成したクリップは、そのままでは完成素材にならない。ここからの工程が、実写級に見えるかどうかの分かれ目になることが多い。
アップスケールとノイズの扱い
生成解像度は、書き出し解像度より低いことが多い。アップスケールは段階的に行うと品質が保ちやすい。2倍ずつ、必要な解像度まで上げる。
注意すべきは、デノイズのしすぎだ。ノイズを完全に消すと、肌がプラスチックになり、いわゆるAIっぽさが戻ってくる。むしろ、ごく薄いフィルムグレインを最後に足すほうが、映像全体が馴染む。
フレームレートと補間
24fpsの映像的な質感を狙うのか、60fpsの滑らかさを狙うのかを先に決める。補間は滑らかさを出す一方で、動きの物理性を壊すことがある。歩行や手の動きが「流体」のようになったら、補間を弱めるか切る。
スローモーションを使う場合も同じだ。元のフレームにない中間フレームを作ると、指や髪の形が崩れる。重要なカットでは、あらかじめ高フレームレートで生成しておくほうが安全だ。
つなぎ目の処理
カットのつなぎ目は、カットごとの色と明るさが揃っていないと目立つ。編集ソフトでカット間の露出とホワイトバランスを合わせるだけでも、印象は大きく変わる。
動きが連続するカットは、モーション方向を揃える。左から右への動きのあとに、右から左への動きをつなぐと、視聴者は方向を再計算する必要があり、そこで違和感が生まれる。
音の設計
音は画の粗を最もよく隠す。逆に、音が薄いと映像の破綻が目立つ。
- 環境音(室内の空調、街の遠音、雨)
- スポット音(足音、衣擦れ、カップを置く音)
- 音楽(テンポと感情の設計)
- ナレーションや会話
スポット音を画面の動きに合わせて置くだけで、映像の説得力は跳ね上がる。カップを置く瞬間に小さな音が鳴る。それが映像の物理性を補強する。無音の実写級映像は、実はほとんど存在しない。
品質チェックリストとよくある失敗
書き出す前に、次の項目を順に確認する。
- 人物の顔と髪がカット間で一致しているか
- 手と指の本数、関節の向きが正しいか
- 影の方向が全カットで一貫しているか
- 背景の小物、看板の文字が破綻していないか
- 鏡や窓の反射が不自然でないか
- カメラの動きが一定速度になっていないか
- 色温度がカット間で揺れていないか
- 音と動きが同期しているか
- スマートフォンの小さい画面で見ても破綻しないか
よくある失敗と修正
顔がカットごとに別人になる。 参照画像が少ないか、役割が混ざっている。顔用の参照を増やし、プロンプトの人物記述をコピーして使い回す。
全体に白っぽく眠い画になる。 キーライトが弱く、フィルが強すぎる。キーとフィルの比率を見直し、リムを足す。
不自然にツルツルしている。 デノイズ過多か、質感指定の不足。グレインを戻し、肌・布・金属の質感を個別に指定する。
動きが機械的に見える。 速度の副詞がない、またはカメラと被写体が同時に動いている。どちらかを固定する。
背景がカットごとに変わる。 ロケーションの記述が毎回違う。テンプレート化して固定する。
ユースケース別の最適化とツール選定
用途によって、優先すべき要素は変わる。
縦型ショート動画
最初の1秒で視聴を止める必要がある。人物のクローズアップか、動きの大きいインサートから始める。テロップ前提なら、画面の上部と下部に余白を確保し、被写体を中央よりやや上に置く。カットは1.5〜3秒と短く、テンポを優先する。
EC・商品カット
商品の質感が主役になる。マクロ寄りの焦点距離、柔らかい拡散光、反射のコントロールが鍵だ。回転や寄りの動きはゆっくりにし、1カット1メッセージに絞る。背景は無地か、文脈が伝わる最小限の小物にする。
企業広告・ブランド映像
人物の一貫性と光の設計が最も重要になる。カット数を絞り、尺を長めに取り、演技の自然さを優先する。ナレーションと音楽で情報を補い、映像は感情に集中させる。
ドキュメンタリー風
手持ちの揺れ、自然光、やや低いコントラスト、軽いグレイン。完璧に整えすぎないことが様式になる。ただし揺れの振幅は小さく保つ。
ツール選定の基準
ツールは流行ではなく、次の観点で選ぶ。
- 出力できる解像度と最大尺
- 参照画像を何枚まで使えるか
- 一貫性を保つ機能の有無
- カメラモーションの指定粒度
- 生成の安定性と所要時間
- 編集ソフトや書き出し形式との相性
- 利用条件と商用利用の扱い
複数のツールを併用する場合も、役割を固定する。たとえば画像生成で参照を作り、動画生成でカットを作り、別のツールでアップスケールする。役割が重複すると、作品全体のトーンが混ざる。
生成回数が増えるほど、時間も計算コストも増える。まず低解像度で構図と光を確定し、合格したカットだけを高解像度で作り直す順序が効率的だ。
FAQ
Q. 実写級に見せる最短の方法は何ですか。
光の方向を1つに統一し、肌と布の質感を明示し、フィルムグレインを薄く足すことです。この3点だけでも印象は大きく変わります。解像度を上げるより先に取り組む価値があります。
Q. 何回くらい生成し直す前提で考えればよいですか。
ショットの難易度によりますが、構図のテスト、光のテスト、本番の3段階で考えると整理しやすいです。最初から高解像度で作り込まず、低コストな条件で方向を固めてから仕上げに入るのが現実的です。
Q. 人物の顔を揃えるにはどうすればよいですか。
参照画像を角度違いで複数用意し、役割を分けて渡します。プロンプトの人物記述は一字一句同じものを使い回し、シードが固定できる場合は固定します。カットごとに文章を書き直すのが最も危険です。
Q. 手の破綻は避けられませんか。
完全には避けにくいですが、露出を減らせます。手を画面の端に置く、手前に小物を重ねる、手の動きをゆっくりにする、インサートで手元だけを別カットにする。この4つでかなり目立たなくなります。
Q. 長回しのカットは作れますか。
作れますが、破綻率は上がります。まず短いカットで世界観と人物を確定し、その参照と固定変数を使って長回しに挑戦する順序が安全です。長回しは編集でつなぎ目を隠さないため、すべてが露出します。
Q. 商用利用で気をつけることは何ですか。
利用するツールの規約、学習データの扱い、生成物の権利、肖像に類する表現の取り扱いを確認します。実在の人物に似た表現は避け、音楽や素材のライセンスも個別に確認してください。判断に迷う場合は法務の確認を優先します。
Q. 音はどこまで作るべきですか。
可能な限り作るべきです。環境音とスポット音を入れるだけで、映像の破綻は驚くほど目立たなくなります。逆に、作り込んだ映像に無音を合わせると、粗が前面に出ます。
まとめ:上流を固めれば、生成は作業になる
実写級のフォトリアルAI動画は、特別な一発のプロンプトから生まれるものではない。光の方向を1つに決め、人物と環境の参照を用意し、ショットリストを先に書き、カットを短く刻み、音で物理性を補強する。この積み重ねが、視聴者に説明できない違和感を消していく。
最初に取り組むべきは、道具を増やすことではなく、固定する変数を決めることだ。人物の記述、光の方向、焦点距離、時間帯、色温度。これらを台帳に書き、すべてのカットで同じ言葉を使う。それだけで、生成のやり直しは確実に減る。
そして、完璧な画を目指さないことも重要だ。実写の映像は、わずかなノイズ、わずかな揺れ、わずかな色の偏りを含んでいる。欠陥を消すのではなく、物理的に説明できる欠陥を足す。その視点に立てば、フォトリアルな映像制作は、モデルの性能競争ではなく、設計と観察の仕事になる。


