PRZEWODNIK Wizualnej AI

Stable Diffusion

Stable Diffusion to model zamiany tekstu na obraz typu open source, wydany przez Stability AI w 2022 r., który generuje obrazy poprzez stopniowe usuwanie szumu z losowego punktu początkowego.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.

Głębokie nurkowanie

Modele dyfuzyjne uczą się odwracać proces powstawania szumów. Podczas uczenia do rzeczywistych obrazów stopniowo dodawany jest losowy szum, aż staną się statyczne; model uczy się przewidywać i odejmować ten szum. Aby wygenerować, rozpoczyna się od czystego szumu i wielokrotnie usuwa szum, aż pojawi się spójny obraz, zgodnie z podpowiedziami tekstowymi. Kluczową sztuczką zwiększającą wydajność Stable Diffusion jest część „ukryta”: zamiast pracować na pikselach w pełnej rozdzielczości, kompresuje obrazy do mniejszej przestrzeni ukrytej za pomocą wariacyjnego autoenkodera, tam przeprowadza powolne odszumianie, a następnie dekoduje z powrotem do pikseli. Dlatego może działać na typowym procesorze graficznym do gier, a nie na centrum danych. Koder tekstu (CLIP we wczesnych wersjach) przekształca komunikat w wskazówki, a U-Net dokonuje odszumiania. Jego otwarte wagi umożliwiły ControlNet, precyzyjne dostrajanie LoRA i niezliczone narzędzia kreatywne.

Wgląd techniczny

Stabilna dyfuzja to model dyfuzji utajonej. Autoenkoder zmniejsza obraz o wymiarach 512 x 512 do kompaktowej ukrytej siatki, radykalnie ograniczając obliczenia. Sieć U jest przeszkolona do przewidywania szumu dodawanego w każdym kroku czasowym, uwarunkowanego osadzaniem tekstu w drodze wzajemnej uwagi. Naprowadzanie bez klasyfikatorów umożliwia określenie stopnia, w jakim obraz podąża za podpowiedziami, poprzez mieszanie przewidywań warunkowych i bezwarunkowych. Podsumowując, próbnik (taki jak DDIM lub Euler) wykonuje wybraną liczbę etapów odszumiania; więcej kroków zazwyczaj oznacza czystsze wyniki kosztem szybkości.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość stabilnej dyfuzji

Otwarty ekosystem stale przyspiesza: nowsze architektury (w tym dyfuzja oparta na transformatorach i szybsze próbniki kilkuetapowe lub destylowane) ograniczają generowanie z kilkudziesięciu kroków do jednego lub dwóch, umożliwiając tworzenie w czasie niemal rzeczywistym. Oczekuj lepszego renderowania tekstu, lepszej przyczepności i płynnej edycji obrazów, a także rozszerzeń wideo i 3D. Otwarte wagi będą w dalszym ciągu napędzać specjalistyczne dostrajanie, ale także intensyfikują debaty na temat zgody na dane szkoleniowe, deepfakes i znaków wodnych, więc narzędzia do wykrywania i pochodzenia będą się rozwijać wraz z modelami.

Implementacja w świecie rzeczywistym

Artyści i hobbyści tworzą grafiki koncepcyjne i ilustracje lokalnie na swoich własnych procesorach graficznych z niestandardowymi ustawieniami LoRA

Korzystanie z ControlNet w celu ograniczenia generacji za pomocą szkieletu ułożenia, mapy głębi lub szkicu krawędzi w celu uzyskania precyzyjnej kompozycji

Malowanie i przemalowanie w celu edycji zdjęć, usuwania obiektów lub rozszerzania sceny poza jej oryginalne granice

Niezależne studia gier i projektanci szybko i tanio tworzą tekstury, moodboardy i odmiany zasobów

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Stabilna dyfuzja wideo

Często zadawane pytania

What is Stable Diffusion?

Stable Diffusion to model zamiany tekstu na obraz typu open source, wydany przez Stability AI w 2022 r., który generuje obrazy poprzez stopniowe usuwanie szumu z losowego punktu początkowego. Będąc otwartym i możliwym do uruchomienia na konsumenckich procesorach graficznych, zapoczątkował ogromną społeczność narzędzi, ulepszeń i aplikacji.

Mówiąc ogólnie, w jaki sposób model dyfuzji generuje obraz?

Modele dyfuzyjne uczą się odwracać proces szumu: zaczynając od szumu, iteracyjnie usuwają szum, aż do pojawienia się spójnego obrazu.

Co sprawia, że Stable Diffusion jest wystarczająco wydajne, aby działać na konsumenckim procesorze graficznym?

Stable Diffusion to model dyfuzji utajonej: autoenkoder kompresuje obrazy, dzięki czemu intensywne odszumianie odbywa się na mniejszej przestrzeni utajonej.

Jak podpowiedź tekstowa wpływa na wygenerowany obraz?

Koder tekstu przekształca zachętę w elementy osadzone, które warunkują sieć U-Net poprzez wzajemne skupienie uwagi i sterują wynikiem.

W jaki sposób wytyczne wolne od klasyfikatorów pozwalają Ci kontrolować?

Naprowadzanie wolne od klasyfikatorów łączy przewidywania warunkowe i bezwarunkowe, umożliwiając zwiększenie lub zmniejszenie szybkiego przestrzegania zaleceń.

Dlaczego Stable Diffusion stworzyło tak duży ekosystem narzędzi, jak ControlNet i LoRA?

Otwarte ciężary pozwalają społeczności dostroić i rozszerzyć model, tworząc dodatki takie jak ControlNet i lekkie adaptery LoRA.