PRZEWODNIK Wizualnej AI

Stopniowy rozwój GAN

Uprawa progresywna trenuje sieć GAN, zaczynając od małych rozdzielczości i stopniowo dodając warstwy, aby uzyskać obrazy o wysokiej rozdzielczości.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it made stable, megapixel-quality GAN synthesis practical for the first time.

Głębokie nurkowanie

Wprowadzony przez Karrasa i in. (NVIDIA) w 2017 r., technologia progresywnego wzrostu (ProGAN) rozwiązuje problem niestabilności i powolności uczenia sieci GAN bezpośrednio w wysokiej rozdzielczości. Zarówno generator, jak i dyskryminator zaczynają od małych, przy 4x4 pikselach, ucząc się jedynie struktur o dużej skali. Nowe warstwy o dwukrotnie większej rozdzielczości (8x8, 16x16, aż do 1024x1024) są następnie dodawane symetrycznie do obu sieci w trakcie szkolenia. Co najważniejsze, każda nowa warstwa jest płynnie wprowadzana przy użyciu liniowej mieszanki alfa, dzięki czemu sieć nie jest zaskoczona nagłą zmianą architektury. Ucząc się podstawowych cech przed drobnymi szczegółami, trening jest bardziej stabilny, zbiega się szybciej i tworzy twarze o wysokiej wierności, które rozsławiły wyniki CelebA-HQ. W artykule wprowadzono także odchylenie standardowe minipartii i wyrównano tempo uczenia się, aby jeszcze bardziej ustabilizować szkolenie.

Wgląd techniczny

Zanikanie to najważniejsza sztuczka. Po dodaniu bloku o wyższej rozdzielczości jego sygnał wyjściowy jest miksowany z próbkowaną w górę wersją poprzedniej rozdzielczości przy użyciu współczynnika wagi alfa narastającego od 0 do 1. Dzięki temu wagi nowych warstw stopniowo się nagrzewają, zamiast zakłócać to, czego sieć już się nauczyła. W dyskryminatorze zachodzi proces symetryczny. Odchylenie standardowe Minibatch dodaje funkcję podsumowującą zmienność partii, zniechęcając generator do ograniczania wydajności.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość progresywnego wzrostu GAN

Uprawa progresywna była podstawą, na której zbudowano StyleGAN, ale StyleGAN2 później pokazał, że stała architektura z połączeniami pomijanymi i blokami resztkowymi może dorównać jej jakością bez harmonogramu etapowego, więc jawna uprawa wypadła z łask. Głębsze dziedzictwo pozostaje nadal: generowanie od zgrubnej do dokładnej pojawia się teraz w wieloskalowej dyfuzji, kaskadowych potokach o super rozdzielczości i upscalerach w przestrzeni utajonej. Zrozumienie postępującego wzrostu pozostaje cenne dla zrozumienia, dlaczego hierarchiczne uczenie się od niskiej do wysokiej częstotliwości stabilizuje trening generatywny.

Implementacja w świecie rzeczywistym

Tworzenie obrazów twarzy CelebA-HQ o wysokiej rozdzielczości, które wykazały syntezę GAN 1024x1024.

Generowanie wysokiej jakości próbek z innych dziedzin, takich jak sypialnie (LSUN) i obiekty na dużą skalę.

Służy jako architektoniczny punkt wyjścia, który StyleGAN rozszerzył w celu kontrolowanego generowania powierzchni.

Nauczanie zasady uczenia od zgrubnego do dokładnego, ponownie wykorzystywanej w kaskadowych i wieloskalowych potokach generatywnych.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Progressive Growing of GANs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Progressive Growing of GANs?

Uprawa progresywna trenuje sieć GAN, zaczynając od małych rozdzielczości i stopniowo dodając warstwy, aby uzyskać obrazy o wysokiej rozdzielczości. Ma to znaczenie, ponieważ po raz pierwszy umożliwiło praktyczną syntezę stabilnej, megapikselowej jakości syntezy GAN.

W jaki sposób stopniowo rozwijający się GAN rozpoczyna trening?

Szkolenie rozpoczyna się od 4x4, gdzie sieci uczą się zgrubnej struktury, zanim zostaną dodane warstwy o wyższej rozdzielczości.

Jaka jest główna korzyść ze stopniowego zwiększania rozdzielczości?

Uczenie się podstawowych funkcji stabilizuje najpierw trening i przyspiesza konwergencję w porównaniu z atakiem na pełną rozdzielczość od początku.

Kiedy dodawana jest nowa warstwa o wyższej rozdzielczości, w jaki sposób jest ona wprowadzana?

Liniowe zanikanie łączy sygnał wyjściowy nowej warstwy z sygnałem wyjściowym o niższej rozdzielczości, próbkowanym w górę, dzięki czemu sieć dostosowuje się stopniowo.

Dlaczego warstwy są dodawane zarówno do generatora, jak i dyskryminatora?

Obie sieci rosną w tandemie, więc dyskryminator może oceniać obrazy w bieżącej rozdzielczości generatora.

Jaki jest cel wprowadzenia warstwy odchylenia standardowego minibatch w ProGAN?

Dołącza statystyki dotyczące zmienności partii, zachęcając generator do wytwarzania zróżnicowanych wyników zamiast zapadania się.