Stopniowy rozwój GAN
Uprawa progresywna trenuje sieć GAN, zaczynając od małych rozdzielczości i stopniowo dodając warstwy, aby uzyskać obrazy o wysokiej rozdzielczości.
Przegląd
It matters because it made stable, megapixel-quality GAN synthesis practical for the first time.
Głębokie nurkowanie
Wprowadzony przez Karrasa i in. (NVIDIA) w 2017 r., technologia progresywnego wzrostu (ProGAN) rozwiązuje problem niestabilności i powolności uczenia sieci GAN bezpośrednio w wysokiej rozdzielczości. Zarówno generator, jak i dyskryminator zaczynają od małych, przy 4x4 pikselach, ucząc się jedynie struktur o dużej skali. Nowe warstwy o dwukrotnie większej rozdzielczości (8x8, 16x16, aż do 1024x1024) są następnie dodawane symetrycznie do obu sieci w trakcie szkolenia. Co najważniejsze, każda nowa warstwa jest płynnie wprowadzana przy użyciu liniowej mieszanki alfa, dzięki czemu sieć nie jest zaskoczona nagłą zmianą architektury. Ucząc się podstawowych cech przed drobnymi szczegółami, trening jest bardziej stabilny, zbiega się szybciej i tworzy twarze o wysokiej wierności, które rozsławiły wyniki CelebA-HQ. W artykule wprowadzono także odchylenie standardowe minipartii i wyrównano tempo uczenia się, aby jeszcze bardziej ustabilizować szkolenie.
Wgląd techniczny
Zanikanie to najważniejsza sztuczka. Po dodaniu bloku o wyższej rozdzielczości jego sygnał wyjściowy jest miksowany z próbkowaną w górę wersją poprzedniej rozdzielczości przy użyciu współczynnika wagi alfa narastającego od 0 do 1. Dzięki temu wagi nowych warstw stopniowo się nagrzewają, zamiast zakłócać to, czego sieć już się nauczyła. W dyskryminatorze zachodzi proces symetryczny. Odchylenie standardowe Minibatch dodaje funkcję podsumowującą zmienność partii, zniechęcając generator do ograniczania wydajności.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość progresywnego wzrostu GAN
Uprawa progresywna była podstawą, na której zbudowano StyleGAN, ale StyleGAN2 później pokazał, że stała architektura z połączeniami pomijanymi i blokami resztkowymi może dorównać jej jakością bez harmonogramu etapowego, więc jawna uprawa wypadła z łask. Głębsze dziedzictwo pozostaje nadal: generowanie od zgrubnej do dokładnej pojawia się teraz w wieloskalowej dyfuzji, kaskadowych potokach o super rozdzielczości i upscalerach w przestrzeni utajonej. Zrozumienie postępującego wzrostu pozostaje cenne dla zrozumienia, dlaczego hierarchiczne uczenie się od niskiej do wysokiej częstotliwości stabilizuje trening generatywny.
Implementacja w świecie rzeczywistym
Tworzenie obrazów twarzy CelebA-HQ o wysokiej rozdzielczości, które wykazały syntezę GAN 1024x1024.
Generowanie wysokiej jakości próbek z innych dziedzin, takich jak sypialnie (LSUN) i obiekty na dużą skalę.
Służy jako architektoniczny punkt wyjścia, który StyleGAN rozszerzył w celu kontrolowanego generowania powierzchni.
Nauczanie zasady uczenia od zgrubnego do dokładnego, ponownie wykorzystywanej w kaskadowych i wieloskalowych potokach generatywnych.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Progressive Growing of GANs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Warunkowe sieci GAN
Często zadawane pytania
What is Progressive Growing of GANs?
Uprawa progresywna trenuje sieć GAN, zaczynając od małych rozdzielczości i stopniowo dodając warstwy, aby uzyskać obrazy o wysokiej rozdzielczości. Ma to znaczenie, ponieważ po raz pierwszy umożliwiło praktyczną syntezę stabilnej, megapikselowej jakości syntezy GAN.
W jaki sposób stopniowo rozwijający się GAN rozpoczyna trening?
Szkolenie rozpoczyna się od 4x4, gdzie sieci uczą się zgrubnej struktury, zanim zostaną dodane warstwy o wyższej rozdzielczości.
Jaka jest główna korzyść ze stopniowego zwiększania rozdzielczości?
Uczenie się podstawowych funkcji stabilizuje najpierw trening i przyspiesza konwergencję w porównaniu z atakiem na pełną rozdzielczość od początku.
Kiedy dodawana jest nowa warstwa o wyższej rozdzielczości, w jaki sposób jest ona wprowadzana?
Liniowe zanikanie łączy sygnał wyjściowy nowej warstwy z sygnałem wyjściowym o niższej rozdzielczości, próbkowanym w górę, dzięki czemu sieć dostosowuje się stopniowo.
Dlaczego warstwy są dodawane zarówno do generatora, jak i dyskryminatora?
Obie sieci rosną w tandemie, więc dyskryminator może oceniać obrazy w bieżącej rozdzielczości generatora.
Jaki jest cel wprowadzenia warstwy odchylenia standardowego minibatch w ProGAN?
Dołącza statystyki dotyczące zmienności partii, zachęcając generator do wytwarzania zróżnicowanych wyników zamiast zapadania się.