PRZEWODNIK Wizualnej AI

Odbudowa twarzy GFPGAN

GFPGAN to wyspecjalizowany model, który przywraca niskiej jakości, rozmyte lub stare zdjęcia twarzy w ostre, realistyczne portrety.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because faces are where people notice flaws most, and generic restorers often leave them smudged or uncanny.

Głębokie nurkowanie

GFPGAN (Generative Facial Prior GAN), wydany przez Tencent ARC Lab w 2021 r., przywraca zdegradowane twarze jednym przejściem do przodu. Jego podstawową sztuczką jest pożyczenie „generatywnego priorytetu twarzy” ze wstępnie przeszkolonej sieci StyleGAN2, która już wie, jak wyglądają realistyczne twarze. Zdegradowana twarz jest kodowana w utajonej przestrzeni StyleGAN2, a bogate, wyuczone statystyki twarzy kierują rekonstrukcją, dzięki czemu oczy, skóra i zęby wyglądają naturalnie. Aby zachować tożsamość i uniknąć halucynacji związanych z inną osobą, GFPGAN wykorzystuje warstwy transformacji cech przestrzennych z podziałem kanałów (CS-SFT), które łączą poprzednie elementy z cechami rzeczywistego obrazu wejściowego, równoważąc realizm z wiernością. Jest powszechnie dostępny w pakiecie z modułem skalowania tła Real-ESRGAN w narzędziach takich jak internetowe narzędzia do przywracania zdjęć.

Wgląd techniczny

Wstępnie przeszkolony StyleGAN2 działa jak stały dekoder pełen wiedzy o twarzy. Koder GFPGAN odwzorowuje zdegradowany sygnał wejściowy na wiele skal ukrytych i cech, a następnie modulacja CS-SFT wprowadza cechy przestrzenne specyficzne dla wejścia w każdej rozdzielczości, dzięki czemu sygnał wyjściowy pozostaje wierny prawdziwej osobie, a nie ogólnej przeciętnej twarzy. Szkolenie łączy w sobie utratę rekonstrukcji, stratę kontradyktoryjną oraz utratę tożsamości/percepcji i zasadniczo wymaga jedynie wcześniejszych, a nie sparowanych, wysokiej jakości referencji tej samej osoby.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość odbudowy twarzy GFPGAN

Renowacja twarzy zmierza w stronę rozwiązań dyfuzyjnych i konstrukcji transformatorów, które lepiej radzą sobie z poważną degradacją i ekstremalnymi pozami niż rozwiązania GAN. Przyszłe systemy będą łączyć blokowanie tożsamości, kontrolowane szczegóły i spójność czasową wideo, dzięki czemu przywrócone twarze pozostaną stabilne w różnych klatkach. Poręcze etyczne również mają znaczenie: ponieważ narzędzia te wymyślają wiarygodne szczegóły, oczekują etykiet pochodzenia, znaków wodnych i wyraźniejszego ujawnienia, że ​​odrestaurowana twarz to rekonstrukcja, a nie prawdziwa fotografia.

Implementacja w świecie rzeczywistym

Przywracanie starych, porysowanych fotografii rodzinnych krewnych do wyraźnych portretów

Wyostrzanie nieostrych zdjęć profilowych lub zeskanowanych zdjęć identyfikacyjnych

Czyszczenie twarzy ze skompresowanych zdjęć wideo lub o niskiej rozdzielczości

Poprawianie obrazów generowanych przez sztuczną inteligencję lub przeskalowanych obrazów, w których twarze są rozmazane

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GFPGAN Face Restoration quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Praktyczna renowacja Real-ESRGAN

Często zadawane pytania

What is GFPGAN Face Restoration?

GFPGAN to wyspecjalizowany model, który przywraca niskiej jakości, rozmazane lub stare zdjęcia twarzy w ostre, realistyczne portrety. Ma to znaczenie, ponieważ twarze są miejscem, w którym ludzie zauważają najwięcej wad, a konserwatorzy produktów generycznych często pozostawiają je rozmazane lub nieestetyczne.

Jaki wstępnie wyszkolony model zapewnia „generatywne priorytety twarzy” GFPGAN?

GFPGAN ponownie wykorzystuje wstępnie wytrenowany moduł StyleGAN2 jako stały dekoder, który już koduje wygląd realistycznych twarzy.

Jaki jest główny cel warstw CS-SFT firmy GFPGAN?

Funkcja przestrzenna z podziałem kanałów Warstwy transformacji wprowadzają funkcje specyficzne dla danych wejściowych, dzięki czemu przywrócona twarz pozostaje wierna prawdziwej osobie, a nie ogólnej twarzy.

Ile przejść do przodu zazwyczaj potrzebuje GFPGAN, aby przywrócić twarz?

GFPGAN zaprojektowano z myślą o wydajnym przywracaniu w jednym przebiegu, a nie o powolnej optymalizacji iteracyjnej.

Jaki model towarzyszący jest często łączony z GFPGAN w celu obsługi tła?

GFPGAN przywraca twarze, podczas gdy Real-ESRGAN skaluje i oczyszcza otaczające tło za pomocą wielu dołączonych narzędzi.

Czego NIE wymaga GFPGAN podczas szkolenia?

GFPGAN wykorzystuje ogólną analizę twarzy, więc nie wymaga dopasowanych, wysokiej jakości referencji każdej osoby poddawanej rekonstrukcji.