Modele dyfuzyjne
Modele dyfuzyjne generują obrazy, ucząc się odwracać proces szumu, zamieniając krok po kroku przypadkowe zakłócenia w szczegółowe obrazy.
Przegląd
They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.
Głębokie nurkowanie
Model dyfuzji jest szkolony w dwóch kierunkach. W procesie przekazywania czysty obraz jest stopniowo zniekształcany przez dodanie niewielkich ilości losowego szumu, aż stanie się całkowicie statyczny. Następnie model uczy się odwrotnej sytuacji: zaczynając od szumu, przewiduje i usuwa niewielką ilość szumu na każdym kroku, powtarzając dziesiątki lub setki razy, aż pojawi się ostry obraz. Aby było to możliwe do kontrolowania, każdy etap usuwania szumu prowadzony jest za pomocą podpowiedzi tekstowych, tak więc „astronauta jadący na koniu” kieruje zakłócenia w stronę tego obrazu. Nowoczesne systemy, takie jak Stable Diffusion, przeprowadzają ten proces w skompresowanej ukrytej przestrzeni, a nie na surowych pikselach, dzięki czemu jest on znacznie szybszy. W porównaniu z sieciami GAN modele dyfuzyjne uczą się stabilniej i zapewniają większą różnorodność, dlatego około 2022 r. wyprzedziły sieci GAN jako dominujące podejście do generowania obrazów wysokiej jakości.
Wgląd techniczny
Kluczową sztuczką jest to, że sieć nigdy nie musi generować obrazu za jednym razem; uczy się jedynie przewidywać szum dodany na danym etapie. Podczas uczenia do rzeczywistego obrazu dodawana jest znana ilość szumu, a model proszony jest o oszacowanie tego szumu; różnica polega na błędzie szkoleniowym. W czasie generowania model wielokrotnie odejmuje przewidywany szum, stopniowo odsłaniając strukturę. Kondycjonowanie tekstu jest wprowadzane poprzez wzajemne skupienie uwagi, a wskazówki wolne od klasyfikatorów wzmacniają siłę podpowiedzi, która steruje wynikami.
Wpływ strategiczny
Jaśniejsze decyzje
Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.
Koszt i budżet
Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.
Zespół i przepływ pracy
Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.
Przyszłość modeli dyfuzyjnych
Rozproszenie to aktualny stan wiedzy w zakresie generowania obrazu, a w coraz większym stopniu także wideo i audio, z narzędziami takimi jak Sora rozszerzającymi go na ruch. Najważniejszym czynnikiem jest szybkość: techniki takie jak modele destylacji i konsystencji mają na celu ograniczenie setek etapów odszumiania do kilku lub nawet jednego, umożliwiając generowanie w czasie rzeczywistym. Można się spodziewać, że upowszechnienie rozszerzy się na zasoby 3D, projekty naukowe, takie jak cząsteczki i białka, oraz ściśle kontrolowaną edycję, a jednocześnie stanie się wystarczająco tanie, aby można je było uruchomić na telefonach.
Implementacja w świecie rzeczywistym
Tworzenie oryginalnych grafik i obrazów na podstawie podpowiedzi tekstowych w formatach Stable Diffusion, DALL-E i Midjourney
Płynne malowanie i przemalowywanie, wypełnianie lub przedłużanie części zdjęcia
Generowanie wideo z tekstu w narzędziach takich jak OpenAI firmy Sora
Projektowanie nowych cząsteczek i struktur białkowych na potrzeby badań nad odkrywaniem nowych leków
Zagrożenia i poręcze
Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.
Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.
Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.
Plan wdrożenia
Zacznij od jasnej definicji potrzebnego wyniku.
Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.
Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.
Dokumentuj, gdzie modele dyfuzyjne są pomocne i gdzie prostsze metody są lepsze.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Model dyfuzyjny GLIDE
Często zadawane pytania
What is Diffusion Models?
Modele dyfuzyjne generują obrazy, ucząc się odwracać proces szumu, zamieniając krok po kroku przypadkowe zakłócenia w szczegółowe obrazy. Obsługują wiodące obecnie narzędzia do konwersji tekstu na obraz, takie jak Stable Diffusion, DALL-E i Midjourney.
Jaka jest główna idea generowania obrazu przez model dyfuzyjny?
Model dyfuzyjny uczy się odwracać proces szumu, zaczynając od czystego szumu i stopniowo odszumiając, aż do pojawienia się wyraźnego obrazu.
Czego właściwie model uczy się przewidywać podczas szkolenia na każdym etapie?
Model otrzymuje zaszumiony obraz i uczy się szacować dodany szum, dzięki czemu może później odjąć szum podczas generowania.
Jak podpowiedź tekstowa wpływa na wygenerowany obraz?
Kondycjonowanie tekstu (poprzez wzajemną uwagę i wskazówki) steruje każdym krokiem usuwania szumu, tak aby powstający obraz pasował do podpowiedzi.
Dlaczego Stable Diffusion uruchamia proces w „ukrytej przestrzeni”?
Praca w skompresowanej przestrzeni ukrytej zamiast w pikselach o pełnej rozdzielczości radykalnie ogranicza obliczenia, zachowując jednocześnie jakość.
Jaka jest kluczowa przewaga modeli dyfuzyjnych nad sieciami GAN?
Modele dyfuzyjne pozwalają uniknąć niestabilnej gry kontradyktoryjnej i załamania się trybów sieci GAN, zapewniając bardziej niezawodne szkolenie i większą różnorodność wyników.