Fotorealizm w generatywnych obrazach i wideo nie wynika z jednego magicznego słowa w promptcie. To efekt zgodności kilku warstw informacji: kształtu podmiotu, kierunku światła, mikrotekstury materiału, optyki kamery i ziarna obrazu. Kiedy jedna z tych warstw zgrzyta — na przykład skóra wygląda jak plastik, a tło jest podejrzanie sterylne — mózg widza natychmiast rozpoznaje render i cała scena traci wiarygodność.
Ten przewodnik to praktyczne omówienie pracy z fotorealistycznymi postaciami i tłami oraz łączenia ich w spójne ujęcia, które później można animować w narzędziach do generowania wideo. Zamiast listy zaklęć znajdziesz tu strukturę promptu, kryteria wyboru wariantów, sposób budowania karty postaci, techniki dopasowania światła i perspektywy oraz workflow od briefu do gotowego klipu.
Czym fotorealizm różni się od „ładnego renderu"
Większość modeli potrafi dziś wygenerować obraz, który na pierwszy rzut oka wygląda dobrze. Problem pojawia się przy drugim spojrzeniu: skóra jest zbyt gładka, oczy zbyt symetryczne, cień zbyt miękki, a tło pozbawione przypadkowości. Realistyczne zdjęcie zawiera dziesiątki drobnych „defektów", które nasz mózg czyta jako dowód obecności fizycznego świata.
Do najważniejszych sygnałów fotorealizmu należą:
- Niedoskonałość powierzchni. Pory, meszek, kurz, odcisk palca na szkle, mikropęknięcia farby, lekko nierówna krawędź ubrania.
- Fizykalnie sensowne światło. Jedno dominujące źródło, spójny kierunek cieni, delikatne odbicia tam, gdzie faktycznie występują, brak „podświetlenia od nikąd".
- Optyka obiektywu. Głębia ostrości, winieta, aberracja chromatyczna na krawędziach, ograniczony zakres dynamiki, lekkie rozmycie ruchu.
- Ziarno i kolorystyka. Szum matrycy, niewielkie odchylenia balansu bieli, obecność barw brudnych, nie w pełni nasyconych.
- Kompozycja z niedoskonałością. Kadr jak z ręki, lekko przekrzywiony horyzont, element częściowo zasłaniający plan pierwszy.
Prompt, który pomija te warstwy, zwykle produkuje obraz „plakatowy": zbyt czysty, zbyt równomiernie doświetlony i zbyt symetryczny. Fotorealizm to nie kwestia mocy modelu, lecz precyzji opisu.
Anatomia promptu: cztery warstwy, które decydują o realizmie
Zamiast wrzucać do promptu kilkanaście przypadkowych przymiotników, podziel opis na cztery warstwy. Każda odpowiada za inny typ sygnału, a razem tworzą spójny przekaz dla modelu.
Warstwa podmiotu i kostiumu
Opisz, kto lub co jest w kadrze, w jakim wieku, z jaką sylwetką, w jakim ubraniu i w jakim stanie. Zamiast „piękna kobieta" napisz „kobieta około trzydziestu lat, kręcone ciemne włosy związane niedbale, dzianinowy sweter w kolorze owsianym, lekko przetarty na łokciu". Konkretne rzeczowniki działają lepiej niż wartościujące przymiotniki.
Warto też określić stan emocjonalny i mikropozycję: „patrzy nieco w bok, usta rozluźnione, ramiona opuszczone". Modele częściej popełniają błędy w dłoniach i oczach, więc zadbaj o to, żeby dłonie były opisane jako częściowo ukryte albo zajęte przedmiotem — to zmniejsza ryzyko artefaktów.
Warstwa światła i optyki
To najczęściej pomijana, a najbardziej wpływowa część promptu. Określ kierunek światła, jego charakter i kolor: „miękkie światło z okna po lewej, temperatura około 5200 K, delikatny fill od jasnej ściany po prawej". Dodaj parametry obiektywu: ogniskowa, przysłona, odległość od podmiotu.
portret, 50 mm, f/2.0, odległość 1,2 m, światło okna z lewej,
cień pod nosem i brodą, subtelny kontur światła na policzku,
brak dodatkowego oświetlenia studyjnego
Taki zapis daje modelowi gotową „fizykę sceny" i zwykle eliminuje nienaturalne, równomierne doświetlenie całej twarzy.
Warstwa materiału i mikrotekstury
Wymień trzy do pięciu materiałów i ich zachowanie: „wełna lekko mechaci się na ramionach, skóra ma widoczne pory i drobne przebarwienia, szkło w oknie ma smugę po przetarciu". Materiały to najszybsza droga do realizmu, ponieważ niosą ze sobą informację o świetle — matowe rozprasza, błyszczące odbija, półprzezroczyste przepuszcza.
Warstwa kompozycji i kamery
Określ plan, kąt, wysokość kamery i kadrowanie: „plan średni, kamera na wysokości klatki piersiowej, lekkie pochylenie w prawo, postać w prawej tercji". Dodaj drobne niedoskonałości kadru: „horyzont 1,5 stopnia od poziomu, fragment krzesła w lewym dolnym narożniku". Ten ostatni szczegół jest zaskakująco skuteczny — sygnalizuje modelowi, że scena istnieje poza kadrem.
Spójność postaci w wielu ujęciach
Fotorealistyczna postać, która zmienia rysy twarzy między ujęciami, psuje całą produkcję. Spójność nie bierze się z długiego promptu, lecz z powtarzalnej, zamrożonej definicji.
Karta postaci jako dokument produkcyjny
Zbuduj jednorazowo kartę postaci i używaj jej w każdym ujęciu. Powinna zawierać:
- identyfikator i nazwę roboczą postaci,
- wiek, wzrost, typ sylwetki,
- kształt twarzy, kształt nosa, typ oczu, kształt brwi, usta,
- włosy: kolor, gęstość, uczesanie, poziom wilgotności,
- znaki szczególne: blizna, pieprzyk, asymetria, okulary,
- garderobę z numerami wariantów,
- paletę kolorów postaci,
- stałe parametry optyki i światła dla tej postaci.
Karta działa jak kontrakt: cokolwiek zmieniasz w scenie, ta część promptu pozostaje identyczna. Zapisuj ją w pliku tekstowym i kopiuj bez modyfikacji — ręczne przepisywanie prowadzi do cichych zmian sformułowań, które model interpretuje inaczej.
Referencje obrazowe i kontrola podobieństwa
Wiele narzędzi pozwala podać obraz referencyjny lub kilka referencji i sterować siłą ich wpływu. Praktyczna zasada: jedna referencja twarzy, jedna referencja garderoby, jedna referencja stylu świetlnego. Mieszanie wielu referencji o podobnej roli powoduje uśrednianie cech i twarz staje się nieokreślona.
Siłę podobieństwa ustawiaj stopniowo. Zbyt wysoka wartość kopiuje również oświetlenie i kompozycję referencji, co psuje scenę. Zbyt niska gubi tożsamość. Zacznij od wartości środkowej, a potem reguluj tylko w jednym kierunku na raz, notując efekt.
Kontrola klatka po klatce
Jeśli budujesz sekwencję wideo, nie generuj od razu długiego klipu. Najpierw przygotuj trzy do pięciu klatek kluczowych tej samej sceny: wejście postaci, zbliżenie, zmianę pozy, wyjście z kadru. Dopiero potem animuj przejścia między nimi, używając trybu obraz-do-wideo z pierwszą i ostatnią klatką.
Taki podział daje dwie korzyści: pełną kontrolę nad wyglądem postaci oraz znacznie mniej artefaktów ruchu, bo model nie musi wymyślać nagłych zmian wyglądu.
Fotorealistyczne tła: przestrzeń, która nie zdradza generatora
Tło jest trudniejsze od postaci, ponieważ widz nie skupia na nim uwagi i właśnie dlatego szybciej wychwytuje fałsz. Dobre tło to nie dekoracja, lecz zbiór przekonujących wskazówek przestrzennych.
Perspektywa i skala
Ustal jedną, spójną perspektywę i wynikającą z niej skalę. Opisz punkt zbiegu, poziom linii horyzontu i relację wielkości obiektów. Przykład: „wnętrze kuchni, kamera 1,6 m nad podłogą, blat w jednej trzeciej wysokości kadru, drzwi w tle o wysokości 2 m".
Błędy skali — zbyt duże krzesło, zbyt niski sufit, okno rozmiaru drzwi — pojawiają się nawet wtedy, gdy pojedyncze elementy wyglądają przekonująco. Warto wymienić w promptcie dwa lub trzy obiekty referencyjne o znanej wielkości, na przykład krzesło, drzwi i kubek na blacie.
Światło zastane
Tła powinny mieć własne, logiczne źródło światła, które zgadza się ze światłem postaci. Jeśli w prompcie postaci dominuje okno z lewej, w tle nie może pojawić się silny blask z prawej. Opisz źródła: „dwa okna po lewej z roletami, ciepłe światło popołudniowe, w głębi świecąca lampa nad stołem".
Warto też zaznaczyć poziom ekspozycji i zakres tonalny: „okna przepalone o pół działki, cienie w kącie czytelne, ale głębokie". Ograniczony zakres dynamiki to jeden z najbardziej niedocenianych sygnałów realizmu.
Głębia, kurz i powietrze
Prawdziwa przestrzeń nigdy nie jest krystalicznie czysta. Dodaj warunki atmosferyczne wewnątrz pomieszczenia: „widoczny pył w smudze światła, lekkie rozproszenie w głębi, miękkie przejście ostrości na dalszym planie". Mgła, dym, para i kurz nie tylko budują nastrój, ale też maskują niedokładności generowania w oddali.
W plenerze pomocne są warstwy odległości: pierwszy plan ostry, drugi plan lekko rozmyty, trzeci plan rozmyty i rozjaśniony. To klasyczna perspektywa atmosferyczna, którą modele rozumieją, jeśli opisać ją wprost.
Integracja postaci i tła: jak uniknąć efektu wycinanki
Najczęstszy problem w generatywnych scenach to postać wklejona w tło. Powstaje, gdy nie zgadzają się cztery parametry: kierunek światła, twardość cienia, poziom ziarna oraz głębia ostrości.
Praktyczna checklista integracji:
- Kierunek światła. Ten sam azymut i ta sama wysokość źródła w opisie postaci i tła.
- Temperatura barwowa. Ta sama wartość lub świadomy kontrast: chłodne tło, ciepła postać.
- Cień kontaktowy. Opisz cień pod stopami, na krześle, przy ścianie. Bez niego postać „leży" na obrazie.
- Spójność ostrości. Jeśli tło jest rozmyte z powodu małej przysłony, postać nie może być ostra na całej głębokości.
- Ziarno. Ziarno musi być jednolite w całym kadrze, a nie tylko na twarzy.
- Interakcja fizyczna. Postać powinna dotykać czegoś: blatu, framugi, tkaniny. Dotyk zakotwicza ją w przestrzeni.
- Kolor odbić. Ciepła podłoga odbija się na spodzie ubrań, zielona ściana zmienia barwę cieni.
Jeśli scena nadal wygląda sztucznie, najczęściej winna jest nie postać, a zbyt równomierne oświetlenie tła. Wprowadź jedną wyraźną dominantę świetlną i pozwól reszcie kadru pogrążyć się w półcieniu.
Wagi, negatywy i kolejność instrukcji
Modele generatywne nie czytają promptu jak człowiek. Pierwsze słowa mają zwykle większy wpływ, a im dalej w tekście, tym słabszy sygnał. Dlatego najważniejsze elementy — typ ujęcia, główny podmiot, główne światło — umieszczaj na początku.
Wiele narzędzi obsługuje składnię wag, na przykład podwójne nawiasy lub zapis z dwukropkiem i liczbą. Zamiast zgadywać, stosuj prostą zasadę: zwiększaj wagę tylko wtedy, gdy element konsekwentnie znika z obrazu w kolejnych próbach.
Negatywne prompty działają najlepiej jako lista konkretnych artefaktów, nie ogólnych pojęć. Zamiast „brzydko" wpisz rzeczy, które faktycznie się pojawiają:
plastikowa skóra, wygładzona twarz, dodatkowe palce,
zniekształcone dłonie, nakładające się zęby, tęczówki bez detalu,
HDR, nadmierne wyostrzenie, podwójne krawędzie, rozmyte logo,
fałszywy tekst na ubraniach
Uwaga na sprzeczności. Jeśli w prompcie prosisz o „miękkie światło" i jednocześnie o „wyraziste kontrasty", model wybierze jeden z sygnałów losowo, a wynik będzie niestabilny między próbami.
Iteracja i ocena: jak testować warianty bez chaosu
Realistyczny obraz rzadko wychodzi za pierwszym razem. Kluczem jest metodyczne zmienianie jednej zmiennej na raz i prowadzenie notatek.
Praktyczna rubryka oceny w skali od jednego do pięciu punktów, dla każdego wymiaru osobno:
- realizm skóry i materiałów,
- spójność tożsamości postaci z kartą,
- zgodność światła postaci i tła,
- poprawność anatomii,
- wiarygodność przestrzeni i skali,
- brak artefaktów tekstowych i krawędziowych.
Zapisuj dla każdej próby: numer wariantu, zmieniony fragment promptu, ustawienia ziarna, wynik oceny. Po kilkunastu próbach zobaczysz wzorce — na przykład że konkretne sformułowanie o świetle zawsze poprawia realizm o punkt, a nadmiar przymiotników estetyzujących zawsze szkodzi.
Przy testach siatki wariantów warto generować od czterech do sześciu obrazów z identycznym ziarnem i tylko jednym zmienionym parametrem. Pozwala to oddzielić wpływ promptu od losowości generatora.
Najczęstsze błędy i szybkie poprawki
Zbyt równomierne światło. Objaw: twarz bez cieni, tło jasne w każdym punkcie. Poprawka: wskaż jedno źródło i opisz, gdzie cienie padają.
Plastikowa skóra. Objaw: brak porów, jednolita gładkość, lekki połysk. Poprawka: dodaj opis mikrotekstury, drobnych przebarwień i naturalnego matu, wprowadź ziarno.
Efekt HDR. Objaw: widoczne detale w każdym cieniu i w każdym świetle jednocześnie. Poprawka: ogranicz zakres tonalny, pozwól oknom się przepalić, a kątom pogrążyć w mroku.
Nadmiar przymiotników. Objaw: obraz nieprzewidywalny, raz dobry, raz absurdalny. Poprawka: zamień „piękny, magiczny, niezwykły" na rzeczowniki i parametry techniczne.
Niespójna ostrość. Objaw: postać ostra, tło ostre, ale przejście między nimi rozmazane w dziwnym miejscu. Poprawka: ustal jedną płaszczyznę ostrości i opisz ją liczbowo.
Brak zakotwiczenia. Objaw: postać unosi się nad podłogą. Poprawka: dodaj cień kontaktowy i fizyczny kontakt z obiektem.
Powtarzalne tekstury. Objaw: ta sama faktura ściany powtórzona jak tapeta. Poprawka: opisz zmiany — „farba łuszczy się przy framudze, przy podłodze ciemniejsza".
Workflow produkcyjny: od briefu do gotowego klipu
Poniższy proces sprawdza się zarówno w przypadku pojedynczego obrazu, jak i kilkunastu ujęć składanych w krótki film.
Pierwszy krok: brief i lista ujęć. Zdefiniuj, ile ujęć potrzebujesz, co każde z nich pokazuje i jaki ma czas trwania. Dla wideo wygodnie jest pracować w blokach od trzech do pięciu sekund.
Drugi krok: karta postaci i karta sceny. Przygotuj dwie zwięzłe definicje tekstowe. Karta sceny opisuje światło, wnętrze lub plener, paletę i parametry optyki. Powinna być wspólna dla wszystkich ujęć w danej lokalizacji.
Trzeci krok: klatki kluczowe. Wygeneruj statyczne obrazy dla najważniejszych momentów. Ocena klatek jest tańsza i szybsza niż ocena ruchu — poprawki wprowadzasz jeszcze przed animacją.
Czwarty krok: animacja. W trybie obraz-do-wideo opisuj przede wszystkim ruch kamery i ruch podmiotu, a nie wygląd. Wygląd jest już w klatce startowej. Dobre prompty ruchu są krótkie: „powolny najazd kamery, lekki obrót głowy w prawo, włosy poruszają się od przeciągu".
Piąty krok: montaż i ujednolicenie. Złóż klipy, dopasuj tempo, dodaj ziarno i delikatną korekcję barwną na całości. Wspólny grading potrafi uratować różnice między ujęciami, natomiast brak gradingu natychmiast je ujawnia.
Szósty krok: kontrola jakości. Obejrzyj materiał raz bez dźwięku i raz w zwolnionym tempie. Artefakty ruchu najłatwiej wychwycić przy zatrzymaniu klatki w połowie przejścia.
Jak dopasować narzędzie do poziomu realizmu
Nie każde zadanie wymaga maksymalnej wierności. Kieruj się typem sceny i tym, co robisz z materiałem dalej:
- Szybkie koncepty i storyboardy. Zależy Ci na kompozycji i nastroju, nie na mikroteksturze. Wybierz narzędzie o wysokiej sterowalności kompozycją.
- Portrety i zbliżenia. Liczy się skóra, oczy i oświetlenie. Potrzebujesz modelu dobrze radzącego sobie z twarzami i referencjami tożsamości.
- Szerokie plenery. Priorytetem jest spójna perspektywa, warstwy głębi i horyzont.
- Ujęcia z ruchem postaci. Ważna jest stabilność tożsamości między klatkami oraz brak deformacji w ruchu.
- Materiał pod dalszą obróbkę. Sprawdź, czy narzędzie pozwala eksportować bez agresywnej kompresji i czy zachowuje metadane.
Najlepszy wynik często daje połączenie: jedno narzędzie do klatek kluczowych, drugie do animacji, a montaż i grading w klasycznym edytorze. Trzymanie się jednego programu „od początku do końca" rzadko jest optymalne, choć bywa wygodne.
Praktyczny szablon promptu do wielokrotnego użytku
Poniższy układ sprawdza się w większości przypadków. Wypełniaj go konsekwentnie, a wyniki staną się powtarzalne.
[typ ujęcia] [podmiot z karty postaci] [akcja lub pozycja]
[kierunek i charakter światła] [temperatura barwowa]
[tło z karty sceny] [warunki atmosferyczne]
[obiektyw, przysłona, odległość, wysokość kamery]
[materiały i mikrotekstura]
[ziarno, zakres tonalny, niedoskonałości kadru]
Kluczowa zasada: kolejność warstw odpowiada sile ich wpływu. Typ ujęcia i podmiot zawsze na początku, ziarno i drobne niedoskonałości na końcu. Nie mieszaj warstw — opis światła nie powinien sąsiadować z opisem kostiumu, bo utrudnia to późniejszą edycję pojedynczego fragmentu.
FAQ: pytania, które pojawiają się najczęściej
Dlaczego moja postać wygląda dobrze na obrazie, a źle w wideo?
Najczęściej dlatego, że klatka kluczowa była generowana w innym ustawieniu niż materiał animowany. Używaj tej samej klatki jako punktu startowego i opisuj w prompcie ruchu wyłącznie to, co ma się zmienić.
Jak długi powinien być prompt?
Długość nie jest celem. Prompt powinien zawierać wszystkie cztery warstwy i nic ponadto. Powyżej pewnego progu każdy dodatkowy przymiotnik osłabia pozostałe sygnały.
Czy warto używać wielu obrazów referencyjnych?
Tak, ale w różnych rolach. Jedna referencja tożsamości, jedna garderoby, jedna światła. Kilka referencji tej samej roli powoduje uśrednienie cech i utratę wyrazistości.
Jak uzyskać spójne tło w kilku ujęciach?
Zbuduj kartę sceny z opisem światła, palety i skali, a następnie stosuj ją bez zmian. Zmieniaj wyłącznie pozycję kamery i kadr.
Dlaczego cienie wyglądają nienaturalnie?
Zwykle brakuje informacji o kierunku i wysokości źródła. Dodaj wysokość (na przykład „światło 2,5 metra nad podłogą, 40 stopni od osi kamery"), a cień sam się ustawi.
Ile wariantów generować na jedno ujęcie?
Przy gotowej karcie postaci i sceny wystarczy od czterech do ośmiu. Bez kart liczba prób rośnie lawinowo, a spójność między ujęciami i tak się rozjeżdża.
Czy ziarno i niedoskonałości naprawdę mają znaczenie?
Tak, i to większe niż większość detali geometrycznych. Ziarno, winieta i lekkie rozmycie ruchu to sygnały, których nie da się podrobić w „czystym" renderze, a które widz odczytuje jako dowód obecności kamery.
Jak poprawić dłonie?
Najprościej: nie pokazuj ich w pełni. Opisz dłoń trzymającą kubek, dłoń w kieszeni, dłoń poza kadrem. Jeśli dłonie muszą być widoczne, umieść je w warstwie podmiotu z opisem pozycji palców i unikaj skomplikowanych gestów.
Fotorealizm w generatywnej AI to dyscyplina rzemieślnicza: karta postaci, karta sceny, cztery warstwy promptu, kontrola światła i cierpliwa iteracja. Kiedy opanujesz ten zestaw, przestaniesz walczyć z losowością modelu, a zaczniesz świadomie budować obrazy, które wyglądają jak zarejestrowane, a nie wygenerowane.




