PRZEWODNIK Wizualnej AI

Próbniki DDPM i DDIM

DDPM i DDIM to dwa sposoby przeprowadzenia odwrotnego procesu modelu dyfuzyjnego, polegającego na stopniowym przekształcaniu losowego szumu w obraz.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

DDPM is the original stochastic recipe; DDIM is a faster, deterministic shortcut that produces comparable images in far fewer steps.

Głębokie nurkowanie

Model dyfuzji trenuje się poprzez stopniowe dodawanie szumu Gaussa do obrazów, a następnie uczenie się przewidywania tego szumu. Próbkowanie odwraca tę sytuację. DDPM (Denoising Diffusion Probabilistic Models, Ho i in. 2020) przechodzi przez każdy poziom szumu, dodając nową odrobinę losowego szumu na każdym kroku, więc zazwyczaj wymaga setek do tysiąca kroków. DDIM (Denoising Diffusion Implicit Models, Song et al. 2021) ponownie wykorzystuje dokładnie tę samą wytrenowaną sieć, ale podąża niemarkowowską, deterministyczną trajektorią. Porzucając wstrzykniętą losowość, DDIM może pominąć wiele kroków czasowych i nadal uzyskać obraz wysokiej jakości w 10–50 krokach. Ponieważ DDIM jest deterministyczny, ten sam szum początkowy zawsze daje ten sam obraz, umożliwiając płynną interpolację i odtwarzalność.

Wgląd techniczny

Obydwa próbniki wykorzystują sieć, która przewiduje epsilon szumu dodanego do obrazu w kroku czasowym t. Aktualizacja DDPM odejmuje skalowaną wersję tej prognozy, a następnie dodaje szum wariancji pobrany z tyłu. DDIM przepisuje aktualizację, aby najpierw oszacować czysty obraz x0, a następnie ponownie wyświetlić go do następnego (mniejszego) kroku czasowego bez składnika stochastycznego. Parametr eta łączy oba: eta=1 odzyskuje DDPM, eta=0 daje w pełni deterministyczny DDIM.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość samplerów DDPM i DDIM

Badania nad próbnikami zmierzają w kierunku generowania jedno- lub kilkuetapowego. Solvery ODE wyższego rzędu, takie jak DPM-Solver i DPM-Solver++, już obcięły próbkowanie jakościowe do poniżej 20 kroków, podczas gdy metody destylacji (destylacja progresywna, modele konsystencji, konsystencja utajona) kompresują modele do generatorów o 1-4 krokach. Można się spodziewać, że DDPM/DDIM pozostanie koncepcyjnym punktem odniesienia, podczas gdy systemy produkcyjne będą opierać się na solwerach destylowanych i adaptacyjnych do syntezy obrazu i wideo w czasie rzeczywistym na sprzęcie konsumenckim.

Implementacja w świecie rzeczywistym

Generowanie obrazu ze stabilną dyfuzją, gdzie DDIM jest oferowany jako szybki domyślny próbnik dla podpowiedzi zamiany tekstu na obraz w narzędziach takich jak Automatic1111 i ComfyUI.

Powtarzalne potoki grafiki, które naprawiają losowe ziarno za pomocą deterministycznego DDIM, dzięki czemu ten sam monit i ziarno zawsze generują identyczny obraz.

Płynna interpolacja przestrzeni ukrytej między dwoma obrazami w celu animacji morfingu, możliwa dzięki deterministycznemu mapowaniu szumu na wyjściu DDIM.

Szybka iteracja twórcza, podczas której projektanci korzystają z 20-etapowych podglądów DDIM w celu zbadania koncepcji przed wykonaniem wolniejszego, pełnoetapowego renderowania o wyższej jakości.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DDPM and DDIM Samplers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Odległość początkowa Frécheta

Często zadawane pytania

What is DDPM and DDIM Samplers?

DDPM i DDIM to dwa sposoby przeprowadzenia odwrotnego procesu modelu dyfuzyjnego, polegającego na stopniowym przekształcaniu losowego szumu w obraz. DDPM to oryginalna receptura stochastyczna; DDIM to szybszy, deterministyczny skrót, który tworzy porównywalne obrazy w znacznie mniejszej liczbie kroków.

Jaka jest główna praktyczna przewaga DDIM nad DDPM?

DDIM podąża deterministyczną, niemarkowowską trajektorią, która pozwala pominąć wiele kroków czasowych, generując obrazy wysokiej jakości w około 10–50 krokach zamiast setek.

Czego właściwie sieć neuronowa modelu dyfuzyjnego uczy się przewidywać podczas uczenia?

Sieć jest szkolona w zakresie przewidywania szumu Gaussa (epsilon) dodawanego w każdym kroku czasowym, którego następnie używają zarówno DDPM, jak i DDIM do odwrócenia procesu.

Dlaczego DDIM może za każdym razem generować dokładnie ten sam obraz z tego samego szumu początkowego?

DDIM pomija w swojej aktualizacji termin szumu stochastycznego, czyniąc ścieżkę od szumu do obrazu w pełni deterministyczną, a zatem odtwarzalną.

Jaka wartość parametru eta w DDIM przywraca oryginalne stochastyczne zachowanie DDPM?

Parametr eta interpoluje pomiędzy dwoma próbnikami: eta=1 daje pełną stochastyczność DDPM, podczas gdy eta=0 daje w pełni deterministyczny DDIM.

Mniej więcej, ile kroków zwykle wymagał oryginalny DDPM, aby uzyskać próbki wysokiej jakości?

DDPM przechodzi przez każdy poziom szumu, dodając losowość, więc zwykle wymaga to setek do tysiąca kroków odwrotnych.