Super-rozdzielczość ESRGAN i GAN
ESRGAN wykorzystuje konkurencję między generatorem a dyskryminatorem, aby uzyskać realistyczne szczegóły podczas skalowania obrazów w górę, wykraczające poza rozmytą interpolację.
Przegląd
It matters because it set the template for photo-realistic super-resolution that still influences tools today.
Głębokie nurkowanie
ESRGAN (Enhanced Super-Resolution Generative Adversarial Network), wprowadzony w 2018 roku, ulepszony w stosunku do wcześniejszego SRGAN. Wykorzystuje generator zbudowany z gęstych bloków resztkowych (RRDB), które układają wiele gęstych połączeń bez normalizacji wsadowej, co według autorów było przyczyną artefaktów. Odrębna sieć dyskryminatorów próbuje odróżnić zdjęcia w wysokiej rozdzielczości od wygenerowanych, zmuszając generator do tworzenia halucynacji przekonujących tekstur, takich jak włosy, cegły i liście. ESRGAN łączy w sobie trzy straty: utratę treści w pikselach, utratę percepcji zmierzoną na mapach obiektów VGG przed aktywacją oraz utratę kontradyktoryjną. Wprowadzono także „relatywistyczny” dyskryminator, który ocenia, czy prawdziwe obrazy wyglądają bardziej realistycznie niż fałszywe, co usprawnia trening wyostrzania. Firma ESRGAN zwyciężyła w konkursie superrozdzielczości percepcyjnej PIRM 2018.
Wgląd techniczny
Kluczową ideą jest zamiana dokładności pikseli na realizm percepcyjny. Straty pikseli na poziomie średniej MSE w porównaniu z wiarygodnymi teksturami, co daje gładki i rozmyty wydruk. Zamiast tego strata kontradyktoryjna wymusza wyświetlanie wielu realnie wyglądających obrazów, więc generator wybiera jedną ostrą, wiarygodną teksturę. Relatywistyczny średni dyskryminator firmy ESRGAN szacuje, o ile bardziej realistyczna jest prawdziwa łatka niż fałszywa, która przekazuje więcej informacji o gradiencie i tworzy wyraźniejsze krawędzie niż standardowy dyskryminator.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość ESRGAN i GAN Super-Resolution
Superrozdzielczość czystej sieci GAN jest coraz częściej łączona lub zastępowana przez szkielety transformatorów i moduły skalujące oparte na dyfuzji, które zapewniają bardziej stabilne uczenie i lepszą kontrolę. Mimo to generator RRDB firmy ESRGAN i przepis na percepcję i kontradyktorię pozostają mocnym, lekkim punktem odniesienia osadzonym w niezliczonych modach tekstur gier i narzędziach fotograficznych. Spodziewaj się modeli hybrydowych, które zachowują ostrość sieci GAN, jednocześnie wykorzystując różnorodność dyfuzji i kontekst dalekiego zasięgu transformatorów, a także ściślejszego wdrożenia na urządzeniu w celu skalowania w czasie rzeczywistym.
Implementacja w świecie rzeczywistym
Skalowanie tekstur o niskiej rozdzielczości w modach gier wideo (popularne w społeczności modderskiej „AI Upscale” w przypadku starszych tytułów na komputery PC)
Poprawianie starych fotografii rodzinnych lub zeskanowanych obrazów przed wydrukowaniem w większym formacie
Poprawianie zdjęć pochodzących z materiałów archiwalnych lub nagrań z monitoringu o niskiej rozdzielczości
Generowanie map tekstur o wysokiej rozdzielczości dla artystów 3D pracujących na podstawie małych obrazów referencyjnych
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the ESRGAN and GAN Super-Resolution quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Super-rozdzielczość obrazu
Często zadawane pytania
What is ESRGAN and GAN Super-Resolution?
ESRGAN wykorzystuje konkurencję między generatorem a dyskryminatorem, aby uzyskać realistyczne szczegóły podczas skalowania obrazów w górę, wykraczające poza rozmytą interpolację. Ma to znaczenie, ponieważ ustaliło szablon fotorealistycznej super rozdzielczości, która nadal ma wpływ na dzisiejsze narzędzia.
Do czego odnosi się „GAN” w ESRGAN?
GAN oznacza Generative Adversarial Network, konfigurację, w której generator i dyskryminator rywalizują podczas treningu.
Z jakiego elementu składowego korzysta głównie generator ESRGAN?
Generator ESRGAN wykorzystuje gęsto połączone bloki resztkowe (RRDB), gęsto połączone jednostki resztkowe, jako swoją podstawową strukturę.
Dlaczego autorzy ESRGAN usunęli z generatora normalizację wsadową?
Autorzy odkryli, że normalizacja wsadowa powodowała powstawanie nieprzyjemnych artefaktów w wynikach o super rozdzielczości, więc usunęli ją z bloków RRDB.
Jaki jest główny kompromis ESRGAN w porównaniu z metodami polegającymi wyłącznie na utracie pikseli?
Strata kontradyktoryjna powoduje, że wydruki uzyskują realistycznie wyglądające tekstury, nawet jeśli wartości poszczególnych pikseli różnią się od rzeczywistej.
Gdzie mierzona jest strata percepcyjna (VGG) firmy ESRGAN?
ESRGAN oblicza utratę percepcji na mapach obiektów VGG przed funkcją aktywacji, co według autorów dało ostrzejsze wyniki.