Fotorealizm w Unreal Engine to problem pipeline'u, a nie renderera
Współczesne silniki graficzne nauczyły nas, że oświetlenie globalne w czasie rzeczywistym jest osiągalne. Lumen liczy odbicia i przenikanie światła, Nanite pozwala wprowadzić do sceny geometrię o milionach trójkątów, a path tracing w trybie offline domyka resztę. Mimo to wiele projektów nadal wygląda „plastikowo”. Powód rzadko tkwi w samym rendererze. Tkwi w tym, co do niego trafia: w geometrii bez skali, w materiałach bez historii zużycia, w oświetleniu bez intencji i w kamerze, która nie ma motywacji.
Generatywne modele wideo i obrazu zmieniły ten obraz w ciągu ostatnich kilku lat. Dziś można wygenerować fotorealistyczne tło, zamieć piaskową, ujęcie z drona nad klifem albo zbliżenie na mokry asfalt w kilka minut, bez ekipy i bez wyjazdu. To ogromna zmiana w prewizualizacji i w produkcji elementów tła. Nie oznacza jednak, że da się pominąć pracę nad strukturą sceny. Klip z modelu tekst-do-wideo jest płaski, pozbawiony głębi i najczęściej nie ma nic wspólnego z realną skalą świata, który budujesz w silniku.
Dlatego warto myśleć o generatywnym AI nie jako o zamienniku pipeline'u, ale jako o dodatkowym, bardzo szybkim źródle referencji i materiału pośredniego. Poniższy przewodnik opisuje workflow, w którym generowane klipy i tekstury trafiają do Unreal Engine w sposób kontrolowany: z zachowaniem skali, kierunku światła, spójności materiałowej i logiki kamery.
Trzy poziomy wierności środowiska
Przed pierwszym promptem warto ustalić, do czego właściwie dąży projekt. W praktyce spotyka się trzy poziomy:
- Prewizualizacja – generowane klipy służą tylko do pokazania kierunku artystycznego. Nikt nie przenosi ich do finalnego renderu, więc błędy w fizyce i skali są akceptowalne.
- Tło i matte painting – generowany materiał staje się warstwą środowiska, ale kamera filmowa pozostaje kontrolowana przez silnik lub przez tracking.
- Hybryda produkcyjna – generowany klip jest komponowany z renderem w silniku, z aktorem lub pojazdem w pierwszym planie. Tu tolerancja na błędy jest minimalna.
Każdy poziom wymaga innej dyscypliny. Największym błędem początkujących jest traktowanie prewizualizacji jak materiału finalnego – to prowadzi do scen, które wyglądają dobrze w izolacji i rozsypują się po dodaniu drugiego ujęcia.
Podział pracy: co robi generatywne AI, a co Lumen i Nanite
Najważniejsza decyzja w całym workflow brzmi: które elementy obrazu powstaną w silniku, a które poza nim. Od tej decyzji zależy wszystko – od rozdzielczości tekstur po sposób komponowania ujęć.
Co realnie wnosi generowane wideo
Modele tekst-do-wideo i obraz-do-wideo są znakomite w czterech obszarach:
- Atmosfera i pogoda – zamglenia, deszcz, pył zawieszony, dym, śnieg. To elementy, które w silniku wymagają wielu warstw cząstek i kompromisów wydajnościowych.
- Odległe plany – góry, horyzont, miasta na drugim brzegu rzeki. Rzadko potrzebują interakcji, a bardzo zyskują na realistycznej niedoskonałości.
- Referencje materiałowe – zdjęcia mokrego betonu, zmurszałego drewna, rdzy. Doskonałe źródło do budowy map PBR.
- Warianty kompozycji – szybkie sprawdzenie, jak wygląda scena w innym świetle, o innej porze dnia, z innego kąta.
Czego nie przeniesiesz z klipu do silnika
Z drugiej strony generowane wideo nie dostarcza geometrii, nie ma spójnej siatki kolizji, nie zna twojej skali, a jego światło rzadko da się dopasować do świateł w scenie. Klip nie zawiera też informacji o materiale – to tylko kolory, nie surowe wartości. Dlatego nigdy nie traktuj wygenerowanego ujęcia jako gotowej warstwy, którą „się nakłada”. Traktuj je jako płaską fotografię, którą trzeba zintegrować.
Praktyczna zasada: jeśli element ma być dotknięty przez postać, oświetlony własnym światłem lub sfilmowany z ruchu kamery w silniku – buduj go w silniku. Jeśli jest tłem, atmosferą albo powierzchnią do dalszej obróbki – można go wygenerować.
Referencje i blokowanie środowiska przed pierwszym promptem
Największy wzrost jakości w całym pipeline nie pochodzi z lepszego modelu, ale z lepszego przygotowania. Zanim napiszesz pierwszy prompt, zablokuj podstawy:
- Skala – wysokość postaci, szerokość drzwi, rozstaw latarni. Zbuduj w silniku prosty box level z modułami referencyjnymi. Bez tego wygenerowane tło będzie miało przypadkową skalę.
- Kierunek światła – ustal azymut i wysokość słońca oraz temperaturę barwową. Zapisz to jako notatkę produkcyjną i wrzucaj do każdego promptu.
- Paleta – trzy do pięciu kolorów dominujących plus jeden akcent. Modele generatywne uwielbiają nasycone, teatralne barwy, które psują realizm.
- Typ obiektywu – 24 mm, 35 mm, 50 mm. Ogniskowa determinuje perspektywę, a tej nie da się poprawić w postprodukcji.
- Materiały bazowe – beton, stal, szkło, drewno. Ustal, z czego zbudowany jest świat, zanim zaczniesz go generować.
Dopiero mając te pięć punktów, warto przejść do promptowania. W praktyce oszczędza to dziesiątki nieudanych generacji, bo od razu odrzucasz ujęcia, które nie pasują do ustalonego kierunku.
Kontrola kadrowania jako narzędzie reżyserskie
Jedną z najbardziej niedocenianych funkcji nowoczesnych generatorów jest możliwość określenia kadru, ruchu kamery i kompozycji. Jeśli model pozwala ustawić pozycję kamery, rodzaj ruchu i czas trwania, korzystaj z tego świadomie. Wygenerowanie sześciu ujęć tej samej sceny z tej samej pozycji kamery, ale o różnych porach dnia, daje zestaw, który można porównać i wybrać – zamiast zgadywać.
Tekstury i materiały: od promptu do map PBR
Materiał to miejsce, w którym fotorealizm wygrywa lub przegrywa. Silnik potrafi wyrenderować wspaniałe oświetlenie, ale jeśli powierzchnia nie ma zmienności, od razu widać, że jest cyfrowa.
Workflow generowania tekstury
- Zbierz referencję – wygeneruj lub znajdź zdjęcie powierzchni w równomiernym, rozproszonym świetle. Unikaj mocnych cieni, bo zostaną wypalone w teksturze.
- Wyodrębnij albedo – usuń wpływ oświetlenia, wyrównaj ekspozycję, sprawdź, czy nie ma gradientu. Albedo powinno być niemal płaskie w jasności.
- Zbuduj mapę normalnych – z wysokości lub z analizy jasności. Pamiętaj, że normalna z konwersji jasności to zawsze kompromis.
- Dodaj roughness i AO – chropowatość decyduje o realizmie bardziej niż kolor. Mokre powierzchnie mają niską chropowatość i wyraźne odbicia, suche – wysoką i rozproszone.
- Zadbaj o kafelkowanie – użyj wariantów, przesunięć, nakładek i zaburzeń, żeby uniknąć widocznej siatki powtórzeń.
Spójność materiałowa w całym levelu
Najczęstszy problem dużych środowisk to „wyspy stylu”: jedna ściana wygląda jak z innego projektu niż druga. Aby tego uniknąć, prowadź arkusz materiałów – nazwa, źródło, skala kafelkowania, zakres chropowatości, czy materiał reaguje na zabrudzenia. Kiedy dodajesz nowy materiał, porównaj go z sąsiadem w tej samej scenie i przy tym samym oświetleniu. Jeśli kontrast lub nasycenie odbiega o więcej niż kilkanaście procent, popraw go od razu, a nie po złożeniu całej sceny.
Skala, szum i normalne
Trzy detale, które psują najwięcej tekstur:
- Zła skala – kafelki 2×2 metry na betonie wyglądają jak tapeta. Zawsze sprawdzaj teksturę na ścianie o znanej wysokości.
- Szum – modele generatywne dodają drobny szum, który po skompresowaniu zamienia się w mazę. Delikatny odszum przed budową normalnych ratuje sytuację.
- Zbyt mocne normalne – przesadzone wypukłości wyglądają jak relief. Realistyczne powierzchnie mają płytkie, subtelne zmiany.
Oświetlenie: przenoszenie intencji świetlnej do Lumen
Jeśli wygenerowałeś klip referencyjny, jego najcenniejszą częścią nie jest bryła, ale nastrój świetlny. Da się go przenieść do silnika, ale wymaga to rozłożenia obrazu na składowe.
Kierunek, temperatura, kontrast
Zacznij od trzech pytań: skąd pada światło główne, jaka jest jego temperatura i jaki jest stosunek jasności między światłem a cieniem? Odpowiedzi przenieś do sceny jako wartości, nie jako wrażenie. W praktyce oznacza to ustawienie kierunku światła kierunkowego, temperatury w kelwinach, intensywności oraz – co najważniejsze – poziomu światła wypełniającego z nieba i odbić.
Mgła wolumetryczna i światło praktyczne
Atmosfera, którą generowane wideo oddaje tak dobrze, w silniku powstaje z mgły wolumetrycznej, rozproszenia i świateł praktycznych. Trzy wskazówki:
- Mgła działa najlepiej, gdy ma zmienną gęstość z wysokością – inaczej wygląda jak mleko.
- Światła praktyczne (latarnie, okna, neony) powinny mieć widoczne źródło i realną moc, inaczej scena traci wiarygodność.
- Odbicia na mokrych powierzchniach podbijają realizm bardziej niż jakikolwiek inny efekt, ale tylko jeśli roughness jest poprawnie ustawiony.
Kiedy dograć światło ręcznie
Generowane ujęcia mają zwykle jedno dominujące źródło i miękkie cienie. Scena filmowa potrzebuje kontrastu i kierunkowości. Nie bój się dodać światła kluczowego, które nie istnieje w wygenerowanym klipie – o ile jest uzasadnione w świecie sceny (okno, otwór w dachu, reflektor pojazdu).
Kompozycja kinowa i spójność ujęć oraz postaci
Kompozycja w środowiskach wirtualnych jest trudniejsza niż w plenerze, bo brakuje naturalnych ograniczeń. Kamera może znaleźć się wszędzie, więc trzeba jej te ograniczenia nadać.
Reguły, które warto trzymać
- Jedna linia akcji na ujęcie – oko widza potrzebuje punktu zaczepienia. W rozległym środowisku ustaw leading lines (krawędź ulicy, tor, rząd latarni).
- Warstwy głębi – pierwszy plan, środek, tło. Generowane tła są często „płaskie”, więc pierwszy plan dodawaj z silnika: element architektury, roślinność, pojazd.
- Spójny ruch kamery – jeśli w jednym ujęciu kamera jedzie po łuku, w kolejnym nie zmieniaj nagle na pionowy najazd bez powodu narracyjnego.
Spójność postaci i rekwizytów w wielu scenach
Postać jest najtrudniejszym elementem do utrzymania w spójności. Jeśli używasz generowanych klipów, w których pojawia się człowiek, ryzykujesz zmianę rysów twarzy, ubioru, a nawet proporcji między ujęciami. Rozwiązania:
- Utrzymuj osobną bibliotekę referencji postaci – przód, profil, plecy, w tym samym oświetleniu.
- Traktuj generowane ujęcia z postaciami jako prewizualizację, a finalne ujęcia realizuj w silniku z jedną, zatwierdzoną wersją modelu.
- Rekwizyty, które pojawiają się w kilku scenach, buduj raz i instancjonuj. Zmiana koloru kubka między ujęciami to klasyczny błąd ciągłości.
Integracja klipów z renderem: tracking, deep plate, relight
Gdy masz wygenerowany materiał i render z silnika, pozostaje je połączyć. To etap, na którym większość projektów zyskuje albo traci całą wiarygodność.
Camera tracking i solve
Jeśli w wygenerowanym klipie kamera się porusza, musisz odtworzyć ten ruch w silniku. Trzy podejścia:
- Solve z klipu – śledzenie punktów charakterystycznych. Działa dobrze na materiale z wyraźną teksturą i bez ruchomych obiektów na pierwszym planie.
- Ręczne odtworzenie ruchu – jeśli klip ma delikatny, jednostajny ruch (dron, steadycam), odtworzenie go w silniku jest często szybsze niż solve.
- Kamera w pełni w silniku – renderujesz scenę z dokładnie zaplanowanym ruchem i używasz wygenerowanego materiału tylko jako warstwy tła w oknach, na horyzoncie lub za przezroczystą powierzchnią.
Deep plate i relight
Najbardziej zaawansowana technika polega na użyciu klipu jako warstwy z głębią, co pozwala na częściowe przeniesienie ruchu kamery i relight. Wymaga to jednak rozbicia klipu na warstwy i oszacowania głębi – proces kosztowny, ale dający najlepsze rezultaty przy złożonych ujęciach.
Kiedy odpuścić integrację
Jeśli po trzech próbach klip nadal nie pasuje do oświetlenia, nie walcz z nim. Wykorzystaj go jako czystą referencję atmosfery i odbuduj scenę w silniku. To często szybsze niż dalsza walka z niedopasowanym materiałem, a efekt bywa lepszy.
Typowe błędy i jak ich unikać
Poniższa lista pochodzi z najczęstszych problemów w projektach hybrydowych:
- Brak blokady skali. Objawy: drzwi wyglądają jak wrota, latarnie jak wieże. Rozwiązanie: box level z referencjami przed generowaniem.
- Niespójne oświetlenie między ujęciami. Objawy: cień pada raz w lewo, raz w prawo. Rozwiązanie: notatka produkcyjna z azymutem i temperaturą, wklejana do każdego promptu.
- Tekstury bez chropowatości. Objawy: wszystko wygląda jak plastik. Rozwiązanie: zawsze dodawaj roughness i testuj w silniku, nie w przeglądarce zdjęć.
- Przesadzone efekty atmosferyczne. Objawy: scena tonie w mgle. Rozwiązanie: mgła z gradientem wysokości i umiarkowana gęstość.
- Zbyt wiele detali w tle. Objawy: obraz mieni się i rozprasza. Rozwiązanie: redukcja detalu daleko od kamery, więcej spokoju w kompozycji.
- Brak pierwszego planu. Objawy: scena wygląda jak makieta. Rozwiązanie: dodaj element blisko kamery, choćby fragment konstrukcji.
- Zmiana wyglądu postaci. Objawy: bohater wygląda inaczej w każdym ujęciu. Rozwiązanie: jedna zatwierdzona wersja modelu i biblioteka referencji.
- Ignorowanie ruchu kamery. Objawy: tło przesuwa się inaczej niż render. Rozwiązanie: rozwiąż ruch kamery przed komponowaniem, nie po.
Trzy workflowy pod różne budżety i terminy
Szybka prewizualizacja dla klienta
Cel: pokazać kierunek w jeden dzień. Generuj 6–10 klipów w różnych porach dnia, złóż je w animatik z muzyką i podpisami. Nie buduj geometrii poza prostymi bryłami. Nie przejmuj się spójnością między ujęciami – to nie jest etap produkcyjny.
Środowisko tła dla wirtualnej produkcji
Cel: fotorealistyczne otoczenie za oknem lub na horyzoncie. Wygeneruj panele tła w wysokiej rozdzielczości, dopasuj kierunek światła do planu zdjęciowego, wyrównaj kolory na podstawie próbki z kamery. W silniku buduj tylko to, co widz dotknie lub co rzuca cień na aktora.
Hybrydowa scena z aktorem
Cel: pełna integracja. Tu kolejność jest kluczowa: plan zdjęciowy i pomiar światła, potem tracking, potem render w silniku, a na końcu dobór lub generowanie tła pod zmierzony ruch kamery. Generowanie tła na początku to najczęstszy błąd tego typu produkcji.
FAQ i checklista wdrożeniowa
Czy generowane wideo może zastąpić budowę środowiska?
Nie w produkcji, w której kamera się porusza i w której występuje aktor. Może zastąpić część pracy nad tłem, atmosferą i referencjami, ale nie geometrię ani interakcję.
Ile czasu zajmuje przygotowanie blokady sceny?
W prostym środowisku od kilku godzin do jednego dnia. To czas, który zwraca się wielokrotnie, bo eliminuje konieczność przerabiania materiałów i oświetlenia po fakcie.
Jak sprawdzić, czy tekstura jest wystarczająco dobra?
Obejrzyj ją na powierzchni o znanej skali, przy docelowym oświetleniu, z odległości, z której będzie widoczna w kadrze. Jeśli wygląda dobrze tylko w powiększeniu, nie jest gotowa.
Co zrobić, gdy model nie utrzymuje spójności postaci?
Używaj go do ujęć bez twarzy i bez zbliżeń, a postać realizuj w silniku. Alternatywnie stosuj referencję obrazową postaci w każdym promptcie i sprawdzaj wynik przy 100% powiększeniu.
Czy warto generować mapy normalnych z obrazu?
Jako punkt wyjścia – tak. Do finalnych materiałów lepiej zbudować wysokość ręcznie lub z modelu, bo konwersja z jasności daje artefakty na krawędziach.
Checklista przed renderem finalnym
- Skala potwierdzona na module referencyjnym.
- Kierunek i temperatura światła zgodne z notatką produkcyjną.
- Wszystkie materiały mają roughness, AO i sprawdzone kafelkowanie.
- Ruch kamery rozwiązany i zgodny między warstwami.
- Postacie i rekwizyty w jednej, zatwierdzonej wersji.
- Pierwszy plan, środek i tło obsadzone.
- Mgła i atmosfera sprawdzone na trzech różnych ujęciach.
Fotorealizm nie wynika z jednego narzędzia. Wynika z dyscypliny: konsekwentnej skali, przemyślanego światła i kontroli tego, co realnie trafia do silnika. Generatywne modele dają niesamowite tempo pracy nad wizją, ale to pipeline decyduje, czy widz uwierzy w świat, który zbudowałeś.




