Modele dyfuzji utajonej
Modele dyfuzji utajonej generują obrazy, uruchamiając proces dyfuzji w skompresowanej przestrzeni utajonej zamiast w surowych pikselach, co pozwala obniżyć koszty obliczeń.
Przegląd
They are the engine behind Stable Diffusion and most modern open-source image generators.
Głębokie nurkowanie
Standardowy model dyfuzji uczy się odwracać proces szumu: zaczyna się od czystego szumu i stopniowo przekształca się w obraz. Robienie tego bezpośrednio na pikselach jest kosztowne, ponieważ obraz o wymiarach 512 x 512 ma setki tysięcy wartości. Rozpraszanie utajone, wprowadzone przez Rombacha i współpracowników w 2022 r., najpierw wykorzystuje wstępnie wyszkolony autoenkoder wariacyjny (VAE) do kompresji obrazu w małą ukrytą siatkę (często o wymiarach 64 x 64 x 4, około 48 razy mniejszą). Sieć dyfuzyjna U-Net uczy się następnie odszumiać wewnątrz tej zwartej ukrytej przestrzeni, kierując się tekstem za pomocą wzajemnej uwagi. Wreszcie dekoder VAE rekonstruuje piksele w pełnej rozdzielczości. Ta percepcyjna kompresja zachowuje semantycznie znaczące informacje, odrzucając jednocześnie niezauważalne szczegóły, dzięki czemu generowanie wysokiej jakości jest możliwe na konsumenckich procesorach graficznych.
Wgląd techniczny
Kluczową sztuczką jest oddzielenie kompresji percepcyjnej od modelowania generatywnego. VAE obsługuje szczegóły pikseli o wysokiej częstotliwości tylko raz, a U-Net modeluje jedynie utajoną dystrybucję o niższych wymiarach. Kondycjonowanie tekstu jest wprowadzane poprzez warstwy wzajemnej uwagi, w których funkcje przestrzenne sieci U-Net obsługują osadzanie tokenów z kodera tekstu, takiego jak CLIP. Ponieważ elementy ukryte są około 48 razy mniejsze niż piksele, każdy etap odszumiania jest znacznie tańszy zarówno w przypadku pamięci, jak i FLOPów.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość modeli dyfuzji utajonej
Utajona dyfuzja wykracza poza obrazy i obejmuje wideo (stabilna dyfuzja wideo), zasoby 3D i spektrogramy audio, a wszystko to przy użyciu tej samej receptury „kompresuj, a następnie odszumiaj”. Badania zmierzają w kierunku mniejszej liczby etapów próbkowania poprzez modele destylacji i konsystencji, lepszych VAE, które zachowują drobny tekst i twarze, oraz formuł o rektyfikowanym przepływie, takich jak te w Stable Diffusion 3, które prostują trajektorię generowania, zapewniając szybsze i ostrzejsze wyniki.
Implementacja w świecie rzeczywistym
Stable Diffusion generuje grafiki i projekty koncepcyjne z podpowiedzi tekstowych na pojedynczym konsumenckim procesorze graficznym
Adobe i Canva obsługują funkcje zamiany tekstu na obraz i wypełniania generatywnego oparte na ukrytych szkieletach dyfuzyjnych
Studia gier produkujące mapy tekstur, ikonki i grafiki koncepcyjne środowiska w celu przyspieszenia fazy przedprodukcyjnej
Zespoły ds. obrazów stockowych i marketingu tworzą makiety produktów marki i wizualizacje reklam bez sesji zdjęciowej
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Modele dyfuzji wideo
Często zadawane pytania
What is Latent Diffusion Models?
Modele dyfuzji utajonej generują obrazy, uruchamiając proces dyfuzji w skompresowanej przestrzeni utajonej zamiast w surowych pikselach, co pozwala obniżyć koszty obliczeń. Są silnikiem stojącym za Stable Diffusion i najnowocześniejszymi generatorami obrazów typu open source.
Jaka jest główna innowacja modeli dyfuzji utajonej w porównaniu z dyfuzją w przestrzeni pikseli?
Utajona dyfuzja kompresuje obrazy do mniejszej przestrzeni utajonej przy użyciu VAE, więc kosztowne odszumianie odbywa się przy znacznie mniejszej liczbie wartości niż pełne piksele.
Który komponent kompresuje obraz w ukrytą przestrzeń, a następnie ją rekonstruuje?
Wstępnie wyszkolony moduł VAE koduje obraz w zwartą ukrytą siatkę, a jego dekoder rekonstruuje na końcu piksele w pełnej rozdzielczości.
W jaki sposób tekst jest zazwyczaj wstrzykiwany do odszumiającej sieci U-Net w procesie utajonej dyfuzji?
Osadzone tokeny z kodera tekstu są wprowadzane do warstw wzajemnej uwagi, umożliwiając funkcjom przestrzennym obsługę podpowiedzi.
Dlaczego działanie w przestrzeni ukrytej zmniejsza koszty obliczeń?
Czekaj — właściwym powodem jest to, że ukryta siatka jest znacznie mniejsza (często ~ 48x) niż obraz w pikselach, więc każdy krok odszumiania wymaga znacznie mniej FLOPów i pamięci.
Który szeroko stosowany model open source spopularyzował utajoną dyfuzję?
Wydana w 2022 r. Stable Diffusion zapewniła utajone rozpowszechnienie na sprzęcie konsumenckim i masowe przyjęcie.