Dlaczego stare nagrania tracą jakość — i co realnie da się odzyskać
Każde archiwalne nagranie jest zapisem kompromisu między technologią swoich czasów a warunkami, w jakich powstało. Kaseta VHS przenosiła około 240 linii obrazu, MiniDV oferowało 720×576 przy przeplocie, pierwsze konsumenckie kamery cyfrowe pracowały w 640×480, a wczesne telefony zapisywały 176×144 przy bardzo niskim bitrate. Do tego dochodzą błędy ekspozycji, drgania ręki, przesterowane audio i dziesięciolecia przechowywania w warunkach, których nie znosi żadna taśma magnetyczna.
Najważniejsza zasada, którą trzeba zrozumieć przed sięgnięciem po jakiekolwiek narzędzie: modele AI nie odzyskują informacji, których w pliku nie ma. Przewidują najbardziej prawdopodobny wygląd pikseli na podstawie wzorców nauczonych na milionach innych obrazów. To doskonałe narzędzie do rekonstrukcji struktury — faktury skóry, krawędzi budynków, liści, tkanin — ale zawodne tam, gdzie liczy się wierność konkretowi: w twarzach, dokumentach, tablicach rejestracyjnych, logotypach i napisach.
Dlatego przed rozpoczęciem pracy warto rozdzielić problemy na trzy grupy.
Degradacja, którą AI redukuje dobrze:
- szum analogowy i ziarno taśmy,
- przeplot oraz artefakty „grzebienia”,
- bloki i rozmazania typowe dla starej kompresji MPEG,
- drgania kamery,
- zaniżony kontrast i podbarwienia kolorów.
Degradacja, którą AI poprawia częściowo:
- rozdzielczość — realnie 2× do 4× z przekonującym rezultatem, powyżej tego zwykle kosztem realizmu,
- ostrość krawędzi,
- czytelność twarzy widocznych w średnim planie,
- stabilność barw w scenach z mieszanym światłem.
Degradacja, której nie naprawisz:
- brakujące klatki i urwane fragmenty ruchu,
- przepalona ekspozycja lub czernie bez danych,
- tekst i drobne detale poniżej progu rozdzielczości,
- zniekształcenia powstałe w wyniku złego deinterlace’u wykonanego jeszcze przed digitalizacją.
Ta lista nie jest teoretyczna. Determiniuje kolejność wszystkich operacji w pipeline’ie i tłumaczy, dlaczego dwa razy droższy model nie zawsze daje lepszy efekt końcowy.
Anatomia pipeline'u: kolejność operacji ważniejsza niż narzędzia
W praktyce największe różnice między amatorskim a profesjonalnym wzmacnianiem jakości nie wynikają z wyboru modelu, lecz z kolejności kroków. Sprawdzona sekwencja wygląda tak:
- Ingest i master — digitalizacja lub skopiowanie materiału do formatu pośredniego o wysokim bitrate.
- Korekcja techniczna — deinterlacing, detelecine, usunięcie artefaktów kompresji, odszumianie, stabilizacja.
- Upscaling — zwiększenie rozdzielczości na możliwie „czystym” materiale.
- Restauracja szczegółów — kontrolowane wyostrzanie, opcjonalna rekonstrukcja twarzy.
- Korekcja kolorów — balans, krzywe, wyrównanie scen, delikatne ziarno.
- Interpolacja klatek — tylko jeśli docelowo potrzebne jest 50/60 fps.
- Eksport i archiwizacja — wersja do oglądania plus bezstratny master.
Dwie reguły ratują większość projektów. Po pierwsze: nigdy nie upscaluj przed odszumieniem, bo model wzmocni szum i potraktuje go jak detal. Po drugie: każdą zmianę testuj na 10–20-sekundowym wycinku z najtrudniejszej sceny — nie na pierwszej minucie nagrania. Najtrudniejsza scena to zwykle ujęcie z szybkim ruchem, twarzą w półprofilu i mieszanym światłem.
Warto też zaakceptować, że pipeline jest iteracyjny. Po upscalingu często okazuje się, że trzeba wrócić do etapu odszumiania, bo część artefaktów uwidoczniła się dopiero w wyższej rozdzielczości.
Przygotowanie materiału źródłowego
Ingest: jakość wejścia wyznacza sufit
Zanim cokolwiek przetworzysz, zadbaj o jak najlepszy plik wejściowy. Jeśli digitalizujesz taśmę, użyj przechwytywania bezstratnego lub w wysokim bitrate (ProRes 422 HQ, DNxHR HQX, FFV1). Nagrywanie od razu do H.264 z niskim bitrate to najczęstszy błąd — kompresja „wypala” artefakty, których potem żaden model nie usunie bez utraty detalu.
Deinterlacing i tempo
Materiał z kamer analogowych i wczesnych cyfrowych jest zwykle przeplotowy. Wybierz algorytm oparty na ruchu (klasa bwdif, yadif z trybami, QTGMC), a nie proste „przeplatanie połówek”. Sprawdź kolejność pól — błędna kolejność daje efekt drgającego obrazu, którego nie da się już cofnąć.
Jeśli materiał pochodzi z telekina (film 24p zapisany jako 29,97), zastosuj detelecine, aby odzyskać oryginalne klatki. Zostawienie telekina przed upscalingiem powoduje, że model uczy się duplikować naprzemienne pola i rozmywa ruch.
Odszumianie z zachowaniem ziarna
Rozróżnij szum od ziarna. Szum analogowy i bloki kompresji należy usuwać, natomiast naturalne ziarno filmowe bywa częścią estetyki i warto je zachować lub odtworzyć na końcu. Najlepsze rezultaty daje łagodne odszumianie czasowo-przestrzenne: kilka ujęć w oknie czasowym plus kontrola nad kanałami chroma, które psują się szybciej niż luminancja.
Stabilizacja i kadr
Stabilizacja zużywa margines kadru — zaplanuj od 5 do 10% przycięcia. Jeśli nagranie ma charakter dokumentalny, rozważ pozostawienie naturalnego drgania: nadmierna stabilizacja tworzy „płynącą” geometrię, która wygląda sztucznie przy archiwalnych ujęciach.
Segmentacja materiału
Podziel nagranie na segmenty o podobnych cechach: statyczne wywiady, dynamiczne sceny, ujęcia nocne, materiały o bardzo różnym poziomie szumu. Różne segmenty wymagają różnych ustawień, a jeden globalny preset prawie zawsze oznacza kompromis w obie strony.
Jakie zadania realizują modele AI
Upscaling
Współczesne modele do zwiększania rozdzielczości łączą warstwy konwolucyjne (dobrze radzące sobie z lokalną fakturą) z mechanizmami uwagi (lepiej rozumiejącymi kontekst i strukturę). W praktyce liczy się nie nazwa architektury, ale trzy parametry: współczynnik skali, sposób dzielenia obrazu na kafle oraz sposób traktowania krawędzi kadru. Kafle zapobiegają przekroczeniu pamięci karty graficznej, ale zbyt duże nakładanie się kafli mnoży czas obliczeń bez widocznej korzyści.
Najbezpieczniejsza strategia to skala 2× w jednym przebiegu i ponowna ocena jakości przed drugim przebiegiem. Podwajanie rozdzielczości cztery razy „na raz” daje obraz ostry, lecz plastikowy.
Odszumianie i usuwanie bloków kompresji
Modele odszumiające mają tryby od „delikatnego” do „agresywnego”. Tryb agresywny usuwa ziarno wraz z drobną fakturą skóry i tkanin, dlatego najlepiej pracować w dwóch łagodnych przebiegach. Warto rozdzielić odszumianie luminancji od chrominancji — większość szumu koloru znika już przy pierwszym przebiegu.
Interpolacja klatek
Modele interpolacji generują klatki pośrednie, co pozwala przejść z 25 na 50 fps lub z 30 na 60 fps. Efekt bywa spektakularny w sporcie i tańcu, ale w materiałach z dużym ziarnem i rozmyciem ruchu prowadzi do tzw. artefaktów galarety. Interpolację stosuj po upscalingu, nigdy przed.
Rekonstrukcja twarzy
Modele rekonstrukcji twarzy potrafią przywrócić czytelne rysy z bardzo słabego materiału. Ryzyko jest jednak wysokie: przy twarzach odwróconych, zasłoniętych lub w ruchu model potrafi wygenerować rysy, których nigdy nie było. Zawsze porównuj wynik z oryginałem klatka po klatce i stosuj maski ograniczające ingerencję do obszaru twarzy.
Kolorowanie i korekcja barw
Automatyczne kolorowanie ma sens głównie dla materiałów czarno-białych o dobrym kontraście i wyraźnych twarzach. W pozostałych przypadkach lepszym rozwiązaniem jest ręczna korekcja: balans bieli, krzywe, selektywne nasycenie i wyrównanie scen. Samo podbicie nasycenia na starym materiale ujawnia podbarwienia i szum koloru.
Kryteria wyboru narzędzia
Sprzęt i czas przetwarzania
Upscaling jest operacją wymagającą GPU. Karta z 8 GB pamięci poradzi sobie z materiałem 720p w podziale na kafle, ale 4K w czasie rzeczywistym wymaga więcej zasobów. Realny czas przetwarzania licz raczej w godzinach niż minutach: 10 minut materiału 480p do 1080p to zwykle kilkanaście do kilkudziesięciu minut pracy na przeciętnej karcie. Przetwarzanie na CPU jest możliwe, ale przy dłuższych nagraniach niepraktyczne.
Kontrola artystyczna
Największa różnica między narzędziami to nie maksymalna ostrość, ale zakres kontroli: możliwość podglądu porównawczego, masek, oddzielnych ustawień dla luminancji i chroma, suwaka między „wiernością” a „rekonstrukcją”. Narzędzie bez trybu podglądu A/B skazuje cię na zgadywanie.
Batch i automatyzacja
Jeśli przetwarzasz archiwum rodzinne złożone z dziesiątek plików, liczy się obsługa kolejek, folderów obserwowanych i skryptów wsadowych. Możliwość zapisania presetu i zastosowania go do setki plików jest warta więcej niż pojedyncze, spektakularne demo.
Licencje i prywatność
Materiały rodzinne, wywiady i dokumenty zawierają dane wrażliwe. Sprawdź, czy przetwarzanie odbywa się lokalnie, czy w chmurze, i jak długo pliki pozostają na serwerach. Do zastosowań komercyjnych zweryfikuj warunki licencji modeli — niektóre są ograniczone do użytku niekomercyjnego.
Workflow krok po kroku: 30 minut nagrania rodzinnego
Załóżmy, że masz 30 minut nagrania z kamery VHS w rozdzielczości 720×576, z przeplotem i sporym szumem.
Krok 1 — master bezstratny. Zdigitalizowany plik zapisz jako FFV1 lub ProRes. To twoje archiwum; nigdy nie pracuj na jedynym egzemplarzu.
ffmpeg -i vhs_capture.avi -c:v ffv1 -level 3 -c:a pcm_s16le master.mkv
Krok 2 — korekcja techniczna. Deinterlacing, detelecine i łagodne odszumianie w jednym przebiegu.
ffmpeg -i master.mkv -vf "bwdif=mode=send_frame:parity=auto:deint=all,hqdn3d=1.5:1.5:6:6" -c:v prores_ks -profile:v 3 prepped.mov
Krok 3 — ocena na wycinku. Wytnij 20 sekund z trudnej sceny, przepuść przez model w skali 2× i porównaj na dużym ekranie. Oceń trzy rzeczy: czy szum nie wrócił, czy krawędzie nie mają halo, czy twarze nie stały się „woskowe”.
Krok 4 — upscaling. Skala 2× dla całego materiału, z podziałem na kafle.
realesrgan-ncnn-vulkan -i frames -o upscaled -s 2 -n realesrgan-x4plus -t 128
Krok 5 — drugi przebieg, jeśli potrzebny. Materiał 720p → 1440p zwykle wystarcza. Jeśli celem jest 4K, drugi przebieg rób dopiero po korekcji kolorów i na sprawdzonym wycinku.
Krok 6 — kolor i ziarno. Wyrównaj sceny, popraw balans bieli, dodaj bardzo subtelne ziarno (1–3%) maskujące niedoskonałości i nadające materiałowi naturalność.
Krok 7 — eksport. Wersja do oglądania w H.264 lub H.265, plus bezstratny master do archiwum.
Cały proces dla 30 minut materiału to zwykle od kilku godzin do jednego dnia pracy, z czego większość to czas obliczeń, a nie twoja uwaga. Warto rozłożyć go na etapy i nie spieszyć się na etapie testów.
Typowe błędy i jak ich uniknąć
- Podwójny upscale w jednym przebiegu. Model 4× zastosowany do materiału 480p daje obraz ostry, ale pozbawiony naturalnej tekstury. Lepiej dwa razy po 2× z kontrolą pomiędzy.
- Zbyt agresywne odszumianie. Skóra staje się plastikowa, faktura tkanin znika, a oczy tracą blask. Testuj na zbliżeniach twarzy.
- Wyostrzanie po upscalingu bez limitu. Podbicie ostrości o 40–50% wygląda dobrze na zrzucie ekranu i fatalnie w ruchu — pojawia się migotanie krawędzi.
- Pominięcie audio. Stare nagrania mają często przesterowany dźwięk, buczenie sieciowe i szum taśmy. Delikatny filtr górnoprzepustowy i redukcja szumu robią dla odbioru więcej, niż się wydaje.
- Brak testu przed pełnym renderem. Zawsze testuj na wycinku z najtrudniejszej sceny i oglądaj go w ruchu, nie zatrzymany.
- Praca na jednym pliku. Trzymaj oryginał, master i wersję roboczą. Nadpisanie źródła to najdroższy błąd w całym procesie.
- Ignorowanie przeplotu. Upscaling materiału przeplotowego utrwala artefakty i sprawia, że późniejszy deinterlacing jest znacznie trudniejszy.
- Zbyt mocna kompresja na wyjściu. Zapis w H.265 z wysokim współczynnikiem kompresji niweczy godziny pracy modeli.
Eksport, kompresja i archiwizacja
Wersja do oglądania powinna być kompromisem między rozmiarem a jakością. Dla materiału 1080p sensowne są ustawienia H.264 z jakością stałą na poziomie 16–18 lub H.265 na poziomie 20–22. Materiał źródłowy i master zachowaj bezstratnie — dyski są tańsze niż ponowne przetwarzanie.
Do archiwum stosuj zasadę trzech kopii w dwóch lokalizacjach, z jedną poza domem. Dodaj plik tekstowy z opisem: data digitalizacji, użyty sprzęt, wersja modeli, ustawienia. Za pięć lat informacja, którym presetem powstała dana wersja, będzie bezcenna.
Nie zapomnij o metadanych: oryginalne znaczniki czasu, nazwy plików z datą, opcjonalnie transkrypcja audio. To one czynią archiwum użytecznym, a nie tylko ładnym.
Kiedy lepiej zostawić oryginał
AI nie jest właściwym narzędziem w każdym przypadku. Zostań przy oryginale, gdy:
- materiał ma wartość dowodową lub dokumentalną, a wierność jest ważniejsza niż estetyka,
- nagranie jest celowo ziarniste i stanowi część stylu (np. estetyka 16 mm),
- w kadrze znajdują się dokumenty, tablice, napisy lub twarze osób postronnych,
- przetwarzanie w chmurze jest wykluczone ze względów prywatności,
- degradacja jest tak głęboka, że rekonstrukcja oznaczałaby wymyślenie nowej treści.
W takich sytuacjach warto wykonać jedynie konserwatywną korekcję: stabilizację, balans kolorów i lekkie odszumianie — bez upscalingu i bez rekonstrukcji twarzy.
FAQ
Czy upscaling AI naprawdę poprawia jakość, czy tylko ją rozmywa?
Poprawia strukturę i ostrość krawędzi, ale nie odtwarza informacji, których nie ma w pliku. Efekt jest realny w skali 2–4×, powyżej tego granica realizmu zostaje przekroczona.
Ile materiału mogę przetworzyć w ciągu godziny?
Na przeciętnej karcie graficznej licz około 2–6 minut materiału 480p na godzinę pracy przy skali 2×. Wymagające modele twarzy spowalniają proces kilkukrotnie.
Czy powinienem najpierw odszumiać, czy upscalować?
Najpierw odszumiaj i deinterlacuj. Upscaling wzmacnia wszystko, co znajduje się w obrazie — także szum i artefakty kompresji.
Czy interpolacja klatek do 60 fps ma sens w starych nagraniach?
Tylko wtedy, gdy materiał zawiera dużo ruchu i ma niski poziom szumu. W pozostałych przypadkach efekt bywa nienaturalny.
Czy automatyczne kolorowanie jest wiarygodne?
W materiałach czarno-białych o dobrym kontraście daje przyzwoite rezultaty, ale kolory są interpretacją, a nie rekonstrukcją. Do celów historycznych lepiej pozostać przy wersji monochromatycznej.
Jaki format wybrać na master?
Bezstratny lub niemal bezstratny: FFV1, ProRes 422 HQ albo DNxHR HQX. H.264 i H.265 nadają się do dystrybucji, nie do archiwum.
Jak uniknąć „woskowych” twarzy?
Stosuj łagodne ustawienia rekonstrukcji, pracuj na maskach i zawsze porównuj wynik z oryginałem. Jeśli różnica jest widoczna przy normalnym odtwarzaniu — zmniejsz siłę modelu.
Czy warto przetwarzać całe archiwum naraz?
Nie. Zacznij od jednego najtrudniejszego pliku, wypracuj preset, a dopiero potem uruchom przetwarzanie wsadowe dla reszty materiału.
Dobre wzmacnianie starych nagrań to w równym stopniu wiedza techniczna, co cierpliwość i dyscyplina w porównywaniu wyników. Narzędzia AI są dziś wystarczająco mocne, by przywrócić archiwom drugie życie — pod warunkiem, że użyjesz ich w odpowiedniej kolejności i z odpowiednim umiarem.

