フォトリアリズムの現在地:なぜ物体検出と画像合成をセットで考えるのか
生成AIによるビジュアル制作は、いま大きな転換点にある。少し前まで「AIが作った画像」には、指の本数がおかしい、髪が溶けている、影の向きが光源と合っていない、背景のパースが破綻している、といった痕跡がほぼ必ず残っていた。現在では、こうした問題の多くが、モデル本体の改善と、生成の前後に行う「理解ベースの処理」の組み合わせによって解消されつつある。
ここで押さえておきたいのは、フォトリアリズムは単一モデルの性能だけでは達成できないという事実だ。写実性は大きく3つの層に分かれており、それぞれを別の技術が担当している。
- 構造の層:被写体の形、パーツの位置、パース、前後関係。物体検出、セグメンテーション、ポーズ推定が担う。
- 光学の層:光源の向きと強さ、反射、透過、影、大気による拡散。マテリアル推定とライティング再構成が担う。
- 意味の層:その場面が成立する文脈、ブランドの一貫性、キャラクターの同一性。参照画像とキャプション設計が担う。
物体検出は主に構造の層、画像合成は光学の層と意味の層に強く関わる。だからこそ、この2つは切り離さずに設計する必要がある。生成モデルを高性能な「筆」だとすれば、物体検出は「下書きの精度を測る定規」、画像合成は「彩色と配置の設計図」に近い。どれか一つが欠けると、完成品のどこかに必ず不自然さが残る。
「それらしい」と「実在する」を分けるもの
写実性の評価は、主観的に見えるが実際にはかなり分解できる。プロのレタッチャーやVFXアーティストが無意識に確認している観点を言語化すると、次の5つになる。
- 接地:被写体が地面や他の物体に正しく接しているか。浮いていないか。
- 光源整合:ハイライト、影、反射の向きがすべて同一の光源設計から導かれているか。
- 素材の一貫性:肌、布、金属、ガラスがそれぞれ固有の反射特性で描かれているか。
- スケール感:被写体と背景の大きさの比が物理的に成立しているか。
- 時間的一貫性:動画の場合、フレーム間で同一性と形状が保たれているか。
この5項目は、そのままチェックリストとして使える。逆に言えば、ここを外すとどれだけ解像度が高くても「AIっぽさ」が残る。
ビジネス側の変化
制作現場の関心は、数年前の「AIでどこまで作れるか」から「AIでどこまで安定して量産できるか」に移っている。広告のコンセプト検討、ECの商品ビジュアル展開、映画やCMのプリビズ、SNS向けの短尺動画など、用途は広がった。共通して求められるのは、速さよりも再現性だ。同じ人物、同じ商品、同じ照明設計を、別のアングルや別のシーンでも維持できるかどうかが、実務での採用可否を決める。
写実性を支える技術スタックの全体像
フォトリアルな出力を作るパイプラインは、大きく4つの工程に分かれる。それぞれで使う技術が異なるため、どこでつまずいているのかを切り分けることが上達の近道になる。
生成モデルの役割分担
現代の主流は拡散モデル系のアーキテクチャであり、ノイズから徐々に像を形成する過程で、テクスチャ、光、素材感を同時に最適化する。さらにトランスフォーマーベースの構造を取り入れたモデルが増え、長いプロンプトの解釈や、複数オブジェクトの関係性の保持が以前より安定した。
静止画に強いモデル、動画に強いモデル、編集や合成に強いモデルは、それぞれ得意分野が違う。たとえば映画的な画作りとショットの一貫性を重視するならRunway系の映像モデル、長尺で物語の流れを保つならSora系、参照画像に忠実なスタイル制御や高精細な仕上げならFlux系、複数の参照を組み合わせたキャラクターの同一性維持ならPixVerse系のマルチリファレンス機能、というように、目的別に使い分けるのが現実的だ。
物体検出・セグメンテーションの実務的な使い方
物体検出は「何がどこにあるか」を矩形で返す。セグメンテーションは「どのピクセルがその物体か」をマスクで返す。この2つは生成の前後で次のように使う。
- 生成前:素材の棚卸し。大量の参照画像から人物、商品、ロゴ、背景要素を自動で分類し、使える素材だけを抽出する。
- 生成中:マスク制御。残したい領域と作り変えたい領域を指定し、インペイントやアウトペイントをピンポイントで適用する。
- 生成後:検証。出来上がった画像に対して検出を走らせ、手の位置、物の重なり、文字の有無などを機械的にチェックする。
特に3つ目の「生成後の検出」は見落とされやすいが効果が大きい。人間の目は全体の印象に引っ張られるため、細部の破綻を見逃しやすい。検出モデルは容赦なく指の本数を数え、物体の重なりを指摘してくれる。
参照ベース生成と一貫性の技術
同一性の維持は、写実性と同じくらい重要だ。同じ人物を別カットで出す、同じ商品を別の背景に置く、といった要求は実務では日常的に発生する。ここで効くのが参照画像を使った条件付けである。顔、服装、質感、色味を参照として渡し、生成側がそれをどの程度厳密に守るかを制御する。制御が強すぎると動きが硬くなり、弱すぎると別人になる。このバランス調整が、現在の制作で最も職人的な工程になっている。
ツール選定の判断基準
「どのモデルが一番すごいか」という問いは、実務ではほとんど役に立たない。正しい問いは「この案件のこの工程に、どのモデルが合うか」である。判断基準を5つに整理する。
判断基準1:出力の種類(静止画・動画・編集)
静止画の最終納品が目的なら、ディテール再現と制御性の高い画像モデルを軸にする。動画が目的なら、時間的一貫性を重視した映像モデルを軸にし、キーフレームだけ画像モデルで作る分業が有効だ。既存素材の編集が目的なら、マスク制御と合成に強いモデルを選ぶ。
判断基準2:制御性と再現性
同じプロンプトと同じシードで同じ結果が得られるか。参照画像の影響度を数値で調整できるか。マスクを外部から渡せるか。これらができるモデルは、チーム制作や反復改善に向く。逆に一発勝負のラフ出しなら、制御性よりも発想の振れ幅を優先したほうがよい。
判断基準3:解像度とアップスケール経路
最終的に印刷物や大画面で使うなら、生成後のアップスケール工程が必須になる。単純な拡大は質感を失わせるため、ディテールを再構成するタイプのアップスケーラーを組み合わせる。ここで注意したいのは、アップスケールは破綻を隠してくれないという点だ。構造が崩れている画像を拡大すると、崩れも精細に見えてしまう。
判断基準4:速度とコスト
試行回数が品質に直結する工程では、1枚あたりの生成時間が短いモデルの価値が高い。逆に最終カットだけは時間をかけて高品質モデルに回す。この二段構えが、限られた時間で品質を最大化する定石である。
判断基準5:ライセンスと商用利用条件
生成物の商用利用可否、学習データの扱い、出力に対する権利の帰属は、モデルごとに条件が異なる。制作を始める前に、法務と確認しておくべき項目である。特に人物が写る案件、商標が映り込む案件では慎重さが求められる。
用途別の組み合わせ例
- ECの商品カット:高精細画像モデルでベース生成 → セグメンテーションで商品マスクを抽出 → 背景を合成 → 検出で商品の形状を検証。
- 広告のコンセプトボード:拡散モデルで大量ラフ → 目視で選別 → 参照画像を付けてスタイル統一 → 動画モデルで数秒のモーション確認。
- 短尺SNS動画:画像モデルでキービジュアル → 動画モデルで動きを付与 → フレーム単位で検出チェック → アップスケール。
- 長尺のプリビズ:映像モデルでショットをつなぐ → キャラクター参照を固定 → カメラワークの整合を確認。
実践ワークフロー前半:設計・素材準備・参照の作り方
写実性の8割は、生成を始める前の準備で決まる。ここを丁寧にやると、後の修正回数が激減する。
ステップ1:ショットリストと目的の明確化
最初に「何を伝える画か」を1文で書く。次に、その画に必要な要素を構造・光学・意味の3層に分解する。たとえば「朝のキッチンで女性がコーヒーを注ぐ」という画なら、構造は手とポットとカップの位置関係、光学は窓から差し込む逆光と湯気、意味はブランドの生活感あるトーン、となる。この分解が、後のプロンプト設計と検証項目に直結する。
ステップ2:参照画像の収集と整理
参照は多いほどよいわけではない。役割ごとに分けるのがコツだ。人物の同一性用、衣装用、ライティング用、背景用、カラーグレーディング用。それぞれ1〜3枚に絞り、解像度と明るさを揃えておく。暗すぎる参照、ぼけた参照、用途の異なる参照を混ぜると、モデルは混乱し、平均的な無難な絵に落ち着いてしまう。
ここで物体検出とセグメンテーションが役に立つ。収集した素材を自動処理し、人物、小物、背景をラベル付けしておけば、必要な参照を瞬時に取り出せる。素材が数百枚規模になると、この整理工程の有無が作業時間を大きく左右する。
ステップ3:プロンプトを光学の言語で書く
写実性を上げたいときは、形容詞を増やすより、光とカメラの言葉を使うほうが効く。具体的には次の要素を明示する。
- 光源:位置、硬さ(ソフトかハードか)、色温度、時間帯。
- レンズ:焦点距離の感覚、被写界深度、ボケの質。
- 素材:肌の質感、布の織り、金属の粗さ、ガラスの厚み。
- 空気:霧、埃、湯気、雨、レンズフレアの有無。
- 構図:アングル、高さ、被写体の位置、余白の取り方。
「美しい」「リアル」といった語は情報量がゼロに近い。一方「窓からの逆光、柔らかい拡散光、少し霞んだ空気、85mm相当の浅い被写界深度」は、モデルが再現すべき物理条件を具体的に示している。
ステップ4:ベースの構図を固める
いきなり高品質設定で回さない。まず低コストで10〜20パターン出し、構図とポーズの方向性を決める。この段階では細部の破綻は無視してよい。方向性が決まってから、その1枚を基準に解像度とディテールを上げていく。
実践ワークフロー中盤:生成・検出・合成の反復ループ
ここが実作業の中心になる。ポイントは、生成と修正を1回で終わらせず、検出を挟んだ短いループとして回すことだ。
ループの基本形
- ベース生成:構図が固まった状態で本番品質の画像を出す。
- 検出とマスク作成:手、顔、小物、背景の領域を自動で抽出する。
- 部分修正:崩れている領域だけをインペイントで作り直す。
- 光の整合:修正部分のハイライトと影を周囲に合わせる。
- 再検出:修正が新たな破綻を生んでいないか確認する。
このループを2〜3回転させると、驚くほど精度が上がる。全体を何度も再生成するより、壊れた部分だけを直すほうが速く、結果も安定する。
インペイントとアウトペイントの使い分け
インペイントは既存領域の置き換え、アウトペイントは領域の外側への拡張だ。実務では次のように使い分ける。
- 手や指の修正、髪の絡みの整理、小物の追加 → インペイント。
- 背景の延長、縦横比の変更、余白の追加 → アウトペイント。
- 商品の差し替え、ロゴの配置変更 → インペイントとマスク合成の併用。
注意点は、インペイントのマスクを大きくとりすぎないことだ。範囲が広いとモデルが文脈を失い、別の絵を作り始める。少しずつ、必要な分だけ直すのが鉄則である。
光と影を合わせる具体的な手順
合成で最も目立つ破綻は、影の不一致だ。手順を固定しておくと迷わない。
- 元画像の主光源の方向を特定する。影の伸びる向きとハイライトの位置から判断する。
- 追加する要素に、同じ方向から光が当たった場合の明暗を推定する。
- 接地部分に落ち影を作る。落ち影がないと必ず浮いて見える。
- 環境光による回り込みを加える。影の中が真っ黒だと不自然になる。
- 最後に全体の色温度とコントラストを揃える。
この5手順は、AI生成だけでなく、写真合成や3DCGの合成でもほぼ同じだ。写実性とは、最終的にこの物理整合をどれだけ丁寧に詰めたかで決まる。
マルチリファレンスで同一性を固定する
キャラクターや商品の同一性を保つには、複数の参照を同時に渡す方法が有効だ。正面、斜め、横、異なる照明の参照を組み合わせると、モデルは被写体の立体構造を推定しやすくなる。重要なのは、参照間で矛盾する情報を入れないことだ。髪型が違う、ロゴの位置が違う、色が違う参照を混ぜると、出力は平均化されて別人になる。
実践ワークフロー後半:動画と時間軸への拡張
静止画で写実性が確保できても、動画にすると別の課題が出る。時間軸の一貫性である。
フレーム間の一貫性を保つ
動画生成では、フレームごとに独立して生成すると必ずちらつく。これを防ぐには、キーフレームを先に固め、その間を補間する考え方で組む。最初と最後のフレームを指定し、中間を生成させる手法は、動きの予測可能性を高める。
また、動きの速いカットではモーションブラーが自然に入るかどうかが写実性を左右する。完全にシャープな動画は、かえってCGらしく見える。シャッタースピード相当の設定を意識するとよい。
カメラワークと物理挙動の整合
カメラを動かすと、被写体の前後関係とパースが同時に変化する。ここで破綻が出やすいのは、遮蔽関係だ。手前の物体が奥の物体を隠す順序が入れ替わると、視聴者は即座に違和感を覚える。生成後に物体検出を各フレームに走らせ、物体の位置関係が単調に変化しているかを確認すると、破綻の早期発見につながる。
物理挙動では、次の3点を確認する。
- 重力:落下、跳ね、揺れの速度が自然か。
- 慣性:動き出しと止まりに加速と減速があるか。
- 相互作用:物が触れたときに相手が反応しているか。
アップスケールと仕上げ
最終工程では、解像度を上げながらノイズを整え、粒状感をわずかに加える。デジタル生成物はノイズがゼロになりがちで、それが逆に不自然さを生む。フィルムグレインを薄く乗せると、実写との親和性が上がる。
カラーグレーディングでは、影の色を寒色、ハイライトを暖色に寄せるなどの定石が今も有効だ。ただしやりすぎると嘘っぽくなる。参照となる実写カットを必ず横に並べて比較しながら詰める。
よくある失敗パターンと具体的な修正手順
失敗はパターン化できる。原因が分かれば対処も決まる。
手・髪・文字・反射が崩れる
手と髪は構造が複雑で、文字は意味の制約が強く、反射は物理の制約が強い。いずれも全体生成では失敗しやすい。対処は共通で、領域を切り出して個別に生成し、後から合成する。文字は可能なら生成ではなく、後工程で実フォントを載せるほうが確実だ。反射は周囲の環境を写し込む必要があるため、参照画像に反射対象を含めておく。
影が浮く、接地感がない
原因はほぼ二つ。落ち影の欠如と、環境光の欠如だ。落ち影を追加し、影の中に周囲からの回り込み光を加える。接地部分には物体の重さに応じた接触影の濃さの変化を付ける。軽い物体は薄く、重い物体は濃く、輪郭を締める。
同一性がドリフトする
カットをまたぐうちに顔が変わる現象だ。原因は参照の不足か、参照間の矛盾、あるいはプロンプトの記述が毎回変わっていることにある。参照セットを固定し、プロンプトの人物記述部分をテンプレート化して使い回すことで改善する。
のっぺりしてプラスチックに見える
過剰なノイズ除去と過剰なシャープ化が原因だ。肌の毛穴、布の織り目、金属の微小な傷といった高周波のディテールが失われると、素材感が消える。アップスケールの設定を見直し、ディテール再構成の強い処理を選ぶ。同時に、生成時に素材感を明示する記述を追加する。
人物が不自然に整いすぎる
左右対称すぎる顔、完璧すぎる肌は、実在感を損なう。非対称性を許容する指示を入れ、わずかな肌のムラや髪の乱れを残す。広告では特に、完璧さよりも生々しさが説得力を生む場面が多い。
品質チェックリスト:出荷前に行う確認項目
納品前の確認を属人的な勘に頼ると、品質がばらつく。次のチェックリストを標準化しておくと、チーム全体の底上げになる。
目視チェックの観点
- 光の向きは全要素で一致しているか。
- 影は接地しており、濃さが物理的に妥当か。
- 素材ごとの反射特性が描き分けられているか。
- 奥行きとスケールの比が成立しているか。
- 視線誘導が意図した順序になっているか。
- 等倍と縮小の両方で見て破綻がないか。
機械チェックの観点
- 物体検出で想定外の物体が検出されないか。
- 文字らしき領域が残っていないか(誤字化した文字は特に危険)。
- 手足の本数と関節の位置が妥当か。
- 動画ではフレーム間の被写体位置が連続しているか。
- 生成物のメタデータと作業ログが残っているか。
承認フローの作り方
最終判断は人間が行う。ただし、判断の基準を事前に言語化し、チェックリストとして共有しておく。修正が必要な場合は、どの項目がどの基準を外れているかを記録する。この記録が蓄積すると、自チーム固有の失敗パターンが見えてくる。
権利・倫理・運用ガバナンス
写実的な出力が容易になった分、配慮すべき点も増えた。技術より運用の設計が問われる領域である。
肖像・商標・著作権
実在人物に似た出力を商用利用する場合は、許諾の有無を必ず確認する。著名人に限らず、一般人の顔であっても、特定可能なレベルであれば問題になり得る。商標やロゴは、生成モデルが学習している場合に意図せず映り込むことがある。最終確認で検出モデルを使い、ロゴらしき領域を洗い出す運用が有効だ。
学習データと出自の記録
どの素材を参照し、どのモデルで生成し、どの工程を経たのかを記録しておく。この記録は、後から問い合わせがあった場合の説明責任を果たすために必要になる。手間はかかるが、商用制作では必須の運用だ。
開示の方針
AI生成であることの開示が必要かどうかは、媒体と業界の慣行によって異なる。方針を事前に決め、社内で統一しておく。判断に迷う場合は、開示する側に倒すほうが長期的なリスクは小さい。
よくある質問(FAQ)
Q1. 物体検出は生成とどう関係するのですか
生成モデルは「絵を作る」役割、物体検出は「何がどこにあるかを判定する」役割です。検出結果を使ってマスクを作れば、直したい領域だけを狙って再生成できます。また生成後の検証にも使え、人間が見落とす破綻を機械的に発見できます。
Q2. フォトリアルな画像を作るのに一番効く設定は何ですか
単一の設定ではなく、光とカメラの言語化、参照画像の整理、部分修正の反復、この3つの組み合わせです。特に参照画像の質と一貫性の影響が大きいです。
Q3. 動画でキャラクターが別人になります
参照セットを固定し、カットごとに人物記述をテンプレート化してください。参照間で矛盾する情報を入れないことも重要です。それでも揺れる場合は、カットを短く分割し、キーフレームを先に固める方法が有効です。
Q4. 手の崩れはどう直せばよいですか
全体を再生成せず、手の領域にマスクを当ててインペイントします。マスクは指の輪郭より少しだけ広くとり、関節の向きをプロンプトで補足します。数回繰り返すほうが、一度に大きく作り直すより成功率が高いです。
Q5. 解像度を上げると不自然になります
単純拡大は質感を失わせます。ディテールを再構成するタイプのアップスケーラーを使い、その後に薄く粒状感を加えてください。また、拡大前に構造の破綻を直しておくことが前提です。
Q6. どのモデルを選べばよいか迷います
まず用途を静止画・動画・編集のどれかに分類し、次に制御性、解像度、速度、ライセンスの順で絞り込みます。最終カットだけ高性能モデル、ラフは高速モデルという二段構えが現実的です。
Q7. チーム制作で品質を揃えるコツはありますか
参照セット、プロンプトテンプレート、チェックリスト、承認フローの4つを共有資産として整備することです。個人の勘に依存する工程を減らすほど、品質は安定します。
Q8. どこまでが現実的な自動化の範囲ですか
素材整理、マスク生成、破綻検出、解像度変換は自動化に向きます。最終的な構成判断と光の整合の追い込みは、現時点では人間の関与が品質を大きく左右します。
まとめ:写実性は工程設計で決まる
フォトリアルな表現を追求するとき、多くの人はモデルの性能に注目する。しかし実際の品質を決めているのは、構造を理解する工程、光を整合させる工程、同一性を固定する工程、そして破綻を検出して直す工程の積み重ねだ。物体検出はその全体に効く縁の下の力持ちであり、画像合成はその成果を一枚に統合する仕上げの技術である。
まずは小さく始めるとよい。1枚の画像で、参照を3枚に絞り、光の言葉でプロンプトを書き、生成後に検出を走らせ、崩れた部分だけを直す。この一連の流れを10回繰り返すだけで、自分の制作物の弱点がどこにあるのかが見えてくる。モデルは日々更新されるが、この工程設計の考え方は、ツールが変わっても長く使える資産になる。

