PRZEWODNIK Wizualnej AI

Modele dyfuzji utajonej

Modele dyfuzji utajonej generują obrazy, uruchamiając proces dyfuzji w skompresowanej przestrzeni utajonej zamiast w surowych pikselach, co pozwala obniżyć koszty obliczeń.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

They are the engine behind Stable Diffusion and most modern open-source image generators.

Głębokie nurkowanie

Standardowy model dyfuzji uczy się odwracać proces szumu: zaczyna się od czystego szumu i stopniowo przekształca się w obraz. Robienie tego bezpośrednio na pikselach jest kosztowne, ponieważ obraz o wymiarach 512 x 512 ma setki tysięcy wartości. Rozpraszanie utajone, wprowadzone przez Rombacha i współpracowników w 2022 r., najpierw wykorzystuje wstępnie wyszkolony autoenkoder wariacyjny (VAE) do kompresji obrazu w małą ukrytą siatkę (często o wymiarach 64 x 64 x 4, około 48 razy mniejszą). Sieć dyfuzyjna U-Net uczy się następnie odszumiać wewnątrz tej zwartej ukrytej przestrzeni, kierując się tekstem za pomocą wzajemnej uwagi. Wreszcie dekoder VAE rekonstruuje piksele w pełnej rozdzielczości. Ta percepcyjna kompresja zachowuje semantycznie znaczące informacje, odrzucając jednocześnie niezauważalne szczegóły, dzięki czemu generowanie wysokiej jakości jest możliwe na konsumenckich procesorach graficznych.

Wgląd techniczny

Kluczową sztuczką jest oddzielenie kompresji percepcyjnej od modelowania generatywnego. VAE obsługuje szczegóły pikseli o wysokiej częstotliwości tylko raz, a U-Net modeluje jedynie utajoną dystrybucję o niższych wymiarach. Kondycjonowanie tekstu jest wprowadzane poprzez warstwy wzajemnej uwagi, w których funkcje przestrzenne sieci U-Net obsługują osadzanie tokenów z kodera tekstu, takiego jak CLIP. Ponieważ elementy ukryte są około 48 razy mniejsze niż piksele, każdy etap odszumiania jest znacznie tańszy zarówno w przypadku pamięci, jak i FLOPów.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość modeli dyfuzji utajonej

Utajona dyfuzja wykracza poza obrazy i obejmuje wideo (stabilna dyfuzja wideo), zasoby 3D i spektrogramy audio, a wszystko to przy użyciu tej samej receptury „kompresuj, a następnie odszumiaj”. Badania zmierzają w kierunku mniejszej liczby etapów próbkowania poprzez modele destylacji i konsystencji, lepszych VAE, które zachowują drobny tekst i twarze, oraz formuł o rektyfikowanym przepływie, takich jak te w Stable Diffusion 3, które prostują trajektorię generowania, zapewniając szybsze i ostrzejsze wyniki.

Implementacja w świecie rzeczywistym

Stable Diffusion generuje grafiki i projekty koncepcyjne z podpowiedzi tekstowych na pojedynczym konsumenckim procesorze graficznym

Adobe i Canva obsługują funkcje zamiany tekstu na obraz i wypełniania generatywnego oparte na ukrytych szkieletach dyfuzyjnych

Studia gier produkujące mapy tekstur, ikonki i grafiki koncepcyjne środowiska w celu przyspieszenia fazy przedprodukcyjnej

Zespoły ds. obrazów stockowych i marketingu tworzą makiety produktów marki i wizualizacje reklam bez sesji zdjęciowej

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Latent Diffusion Models?

Modele dyfuzji utajonej generują obrazy, uruchamiając proces dyfuzji w skompresowanej przestrzeni utajonej zamiast w surowych pikselach, co pozwala obniżyć koszty obliczeń. Są silnikiem stojącym za Stable Diffusion i najnowocześniejszymi generatorami obrazów typu open source.

Jaka jest główna innowacja modeli dyfuzji utajonej w porównaniu z dyfuzją w przestrzeni pikseli?

Utajona dyfuzja kompresuje obrazy do mniejszej przestrzeni utajonej przy użyciu VAE, więc kosztowne odszumianie odbywa się przy znacznie mniejszej liczbie wartości niż pełne piksele.

Który komponent kompresuje obraz w ukrytą przestrzeń, a następnie ją rekonstruuje?

Wstępnie wyszkolony moduł VAE koduje obraz w zwartą ukrytą siatkę, a jego dekoder rekonstruuje na końcu piksele w pełnej rozdzielczości.

W jaki sposób tekst jest zazwyczaj wstrzykiwany do odszumiającej sieci U-Net w procesie utajonej dyfuzji?

Osadzone tokeny z kodera tekstu są wprowadzane do warstw wzajemnej uwagi, umożliwiając funkcjom przestrzennym obsługę podpowiedzi.

Dlaczego działanie w przestrzeni ukrytej zmniejsza koszty obliczeń?

Czekaj — właściwym powodem jest to, że ukryta siatka jest znacznie mniejsza (często ~ 48x) niż obraz w pikselach, więc każdy krok odszumiania wymaga znacznie mniej FLOPów i ​​pamięci.

Który szeroko stosowany model open source spopularyzował utajoną dyfuzję?

Wydana w 2022 r. Stable Diffusion zapewniła utajone rozpowszechnienie na sprzęcie konsumenckim i masowe przyjęcie.