Stable Diffusion
Stable Diffusion to model zamiany tekstu na obraz typu open source, wydany przez Stability AI w 2022 r., który generuje obrazy poprzez stopniowe usuwanie szumu z losowego punktu początkowego.
Przegląd
Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.
Głębokie nurkowanie
Modele dyfuzyjne uczą się odwracać proces powstawania szumów. Podczas uczenia do rzeczywistych obrazów stopniowo dodawany jest losowy szum, aż staną się statyczne; model uczy się przewidywać i odejmować ten szum. Aby wygenerować, rozpoczyna się od czystego szumu i wielokrotnie usuwa szum, aż pojawi się spójny obraz, zgodnie z podpowiedziami tekstowymi. Kluczową sztuczką zwiększającą wydajność Stable Diffusion jest część „ukryta”: zamiast pracować na pikselach w pełnej rozdzielczości, kompresuje obrazy do mniejszej przestrzeni ukrytej za pomocą wariacyjnego autoenkodera, tam przeprowadza powolne odszumianie, a następnie dekoduje z powrotem do pikseli. Dlatego może działać na typowym procesorze graficznym do gier, a nie na centrum danych. Koder tekstu (CLIP we wczesnych wersjach) przekształca komunikat w wskazówki, a U-Net dokonuje odszumiania. Jego otwarte wagi umożliwiły ControlNet, precyzyjne dostrajanie LoRA i niezliczone narzędzia kreatywne.
Wgląd techniczny
Stabilna dyfuzja to model dyfuzji utajonej. Autoenkoder zmniejsza obraz o wymiarach 512 x 512 do kompaktowej ukrytej siatki, radykalnie ograniczając obliczenia. Sieć U jest przeszkolona do przewidywania szumu dodawanego w każdym kroku czasowym, uwarunkowanego osadzaniem tekstu w drodze wzajemnej uwagi. Naprowadzanie bez klasyfikatorów umożliwia określenie stopnia, w jakim obraz podąża za podpowiedziami, poprzez mieszanie przewidywań warunkowych i bezwarunkowych. Podsumowując, próbnik (taki jak DDIM lub Euler) wykonuje wybraną liczbę etapów odszumiania; więcej kroków zazwyczaj oznacza czystsze wyniki kosztem szybkości.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość stabilnej dyfuzji
Otwarty ekosystem stale przyspiesza: nowsze architektury (w tym dyfuzja oparta na transformatorach i szybsze próbniki kilkuetapowe lub destylowane) ograniczają generowanie z kilkudziesięciu kroków do jednego lub dwóch, umożliwiając tworzenie w czasie niemal rzeczywistym. Oczekuj lepszego renderowania tekstu, lepszej przyczepności i płynnej edycji obrazów, a także rozszerzeń wideo i 3D. Otwarte wagi będą w dalszym ciągu napędzać specjalistyczne dostrajanie, ale także intensyfikują debaty na temat zgody na dane szkoleniowe, deepfakes i znaków wodnych, więc narzędzia do wykrywania i pochodzenia będą się rozwijać wraz z modelami.
Implementacja w świecie rzeczywistym
Artyści i hobbyści tworzą grafiki koncepcyjne i ilustracje lokalnie na swoich własnych procesorach graficznych z niestandardowymi ustawieniami LoRA
Korzystanie z ControlNet w celu ograniczenia generacji za pomocą szkieletu ułożenia, mapy głębi lub szkicu krawędzi w celu uzyskania precyzyjnej kompozycji
Malowanie i przemalowanie w celu edycji zdjęć, usuwania obiektów lub rozszerzania sceny poza jej oryginalne granice
Niezależne studia gier i projektanci szybko i tanio tworzą tekstury, moodboardy i odmiany zasobów
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stable Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Stabilna dyfuzja wideo
Często zadawane pytania
What is Stable Diffusion?
Stable Diffusion to model zamiany tekstu na obraz typu open source, wydany przez Stability AI w 2022 r., który generuje obrazy poprzez stopniowe usuwanie szumu z losowego punktu początkowego. Będąc otwartym i możliwym do uruchomienia na konsumenckich procesorach graficznych, zapoczątkował ogromną społeczność narzędzi, ulepszeń i aplikacji.
Mówiąc ogólnie, w jaki sposób model dyfuzji generuje obraz?
Modele dyfuzyjne uczą się odwracać proces szumu: zaczynając od szumu, iteracyjnie usuwają szum, aż do pojawienia się spójnego obrazu.
Co sprawia, że Stable Diffusion jest wystarczająco wydajne, aby działać na konsumenckim procesorze graficznym?
Stable Diffusion to model dyfuzji utajonej: autoenkoder kompresuje obrazy, dzięki czemu intensywne odszumianie odbywa się na mniejszej przestrzeni utajonej.
Jak podpowiedź tekstowa wpływa na wygenerowany obraz?
Koder tekstu przekształca zachętę w elementy osadzone, które warunkują sieć U-Net poprzez wzajemne skupienie uwagi i sterują wynikiem.
W jaki sposób wytyczne wolne od klasyfikatorów pozwalają Ci kontrolować?
Naprowadzanie wolne od klasyfikatorów łączy przewidywania warunkowe i bezwarunkowe, umożliwiając zwiększenie lub zmniejszenie szybkiego przestrzegania zaleceń.
Dlaczego Stable Diffusion stworzyło tak duży ekosystem narzędzi, jak ControlNet i LoRA?
Otwarte ciężary pozwalają społeczności dostroić i rozszerzyć model, tworząc dodatki takie jak ControlNet i lekkie adaptery LoRA.