PODSTAWOWY PRZEWODNIK

Modele dyfuzyjne

Modele dyfuzyjne generują obrazy, ucząc się odwracać proces szumu, zamieniając krok po kroku przypadkowe zakłócenia w szczegółowe obrazy.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Głębokie nurkowanie

Model dyfuzji jest szkolony w dwóch kierunkach. W procesie przekazywania czysty obraz jest stopniowo zniekształcany przez dodanie niewielkich ilości losowego szumu, aż stanie się całkowicie statyczny. Następnie model uczy się odwrotnej sytuacji: zaczynając od szumu, przewiduje i usuwa niewielką ilość szumu na każdym kroku, powtarzając dziesiątki lub setki razy, aż pojawi się ostry obraz. Aby było to możliwe do kontrolowania, każdy etap usuwania szumu prowadzony jest za pomocą podpowiedzi tekstowych, tak więc „astronauta jadący na koniu” kieruje zakłócenia w stronę tego obrazu. Nowoczesne systemy, takie jak Stable Diffusion, przeprowadzają ten proces w skompresowanej ukrytej przestrzeni, a nie na surowych pikselach, dzięki czemu jest on znacznie szybszy. W porównaniu z sieciami GAN modele dyfuzyjne uczą się stabilniej i zapewniają większą różnorodność, dlatego około 2022 r. wyprzedziły sieci GAN jako dominujące podejście do generowania obrazów wysokiej jakości.

Wgląd techniczny

Kluczową sztuczką jest to, że sieć nigdy nie musi generować obrazu za jednym razem; uczy się jedynie przewidywać szum dodany na danym etapie. Podczas uczenia do rzeczywistego obrazu dodawana jest znana ilość szumu, a model proszony jest o oszacowanie tego szumu; różnica polega na błędzie szkoleniowym. W czasie generowania model wielokrotnie odejmuje przewidywany szum, stopniowo odsłaniając strukturę. Kondycjonowanie tekstu jest wprowadzane poprzez wzajemne skupienie uwagi, a wskazówki wolne od klasyfikatorów wzmacniają siłę podpowiedzi, która steruje wynikami.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość modeli dyfuzyjnych

Rozproszenie to aktualny stan wiedzy w zakresie generowania obrazu, a w coraz większym stopniu także wideo i audio, z narzędziami takimi jak Sora rozszerzającymi go na ruch. Najważniejszym czynnikiem jest szybkość: techniki takie jak modele destylacji i konsystencji mają na celu ograniczenie setek etapów odszumiania do kilku lub nawet jednego, umożliwiając generowanie w czasie rzeczywistym. Można się spodziewać, że upowszechnienie rozszerzy się na zasoby 3D, projekty naukowe, takie jak cząsteczki i białka, oraz ściśle kontrolowaną edycję, a jednocześnie stanie się wystarczająco tanie, aby można je było uruchomić na telefonach.

Implementacja w świecie rzeczywistym

Tworzenie oryginalnych grafik i obrazów na podstawie podpowiedzi tekstowych w formatach Stable Diffusion, DALL-E i Midjourney

Płynne malowanie i przemalowywanie, wypełnianie lub przedłużanie części zdjęcia

Generowanie wideo z tekstu w narzędziach takich jak OpenAI firmy Sora

Projektowanie nowych cząsteczek i struktur białkowych na potrzeby badań nad odkrywaniem nowych leków

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokumentuj, gdzie modele dyfuzyjne są pomocne i gdzie prostsze metody są lepsze.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Diffusion Models?

Modele dyfuzyjne generują obrazy, ucząc się odwracać proces szumu, zamieniając krok po kroku przypadkowe zakłócenia w szczegółowe obrazy. Obsługują wiodące obecnie narzędzia do konwersji tekstu na obraz, takie jak Stable Diffusion, DALL-E i Midjourney.

Jaka jest główna idea generowania obrazu przez model dyfuzyjny?

Model dyfuzyjny uczy się odwracać proces szumu, zaczynając od czystego szumu i stopniowo odszumiając, aż do pojawienia się wyraźnego obrazu.

Czego właściwie model uczy się przewidywać podczas szkolenia na każdym etapie?

Model otrzymuje zaszumiony obraz i uczy się szacować dodany szum, dzięki czemu może później odjąć szum podczas generowania.

Jak podpowiedź tekstowa wpływa na wygenerowany obraz?

Kondycjonowanie tekstu (poprzez wzajemną uwagę i wskazówki) steruje każdym krokiem usuwania szumu, tak aby powstający obraz pasował do podpowiedzi.

Dlaczego Stable Diffusion uruchamia proces w „ukrytej przestrzeni”?

Praca w skompresowanej przestrzeni ukrytej zamiast w pikselach o pełnej rozdzielczości radykalnie ogranicza obliczenia, zachowując jednocześnie jakość.

Jaka jest kluczowa przewaga modeli dyfuzyjnych nad sieciami GAN?

Modele dyfuzyjne pozwalają uniknąć niestabilnej gry kontradyktoryjnej i załamania się trybów sieci GAN, zapewniając bardziej niezawodne szkolenie i większą różnorodność wyników.