Stable Diffusion
Stable Diffusion е модел с отворен код текст към изображение, пуснат от Stability AI през 2022 г., който генерира картини чрез постепенно премахване на шума от произволна начална точка.
Преглед
Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.
Дълбоко гмуркане
Дифузионните модели се научават да обръщат процес на шум. По време на обучението към реалните изображения се добавя произволен шум стъпка по стъпка, докато станат статични; моделът се научава да предвижда и изважда този шум. За да генерира, той започва от чист шум и премахва шума многократно, докато се появи кохерентно изображение, ръководено от вашата текстова подкана. Ключовият трик за ефективност на Stable Diffusion е „латентната“ част: вместо да работи върху пиксели с пълна разделителна способност, той компресира изображения в по-малко латентно пространство с помощта на вариационен автоенкодер, изпълнява бавното премахване на шума там, след което декодира обратно до пиксели. Ето защо може да работи на типичен графичен процесор за игри, а не на център за данни. Текстов енкодер (CLIP в ранните версии) преобразува вашата подкана в насоки, а U-Net извършва обезшумяването. Неговите отворени тегла позволяват фини настройки на ControlNet, LoRA и безброй творчески инструменти.
Техническа информация
Стабилната дифузия е модел на латентна дифузия. Автоматичен енкодер свива изображение с размери 512x512 в компактна латентна решетка, намалявайки драстично изчисленията. U-Net е обучен да предсказва шума, добавен на всяка времева стъпка, в зависимост от вграждането на текст чрез кръстосано внимание. Насоките без класификатор ви позволяват да избирате колко силно изображението следва подканата чрез смесване на условни и безусловни прогнози. При заключение семплер (като DDIM или Euler) предприема избран брой стъпки за премахване на шума; повече стъпки обикновено означават по-чисти резултати на цената на скоростта.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на стабилната дифузия
Отворената екосистема продължава да се ускорява: по-новите архитектури (включително базирана на трансформатор дифузия и по-бързи няколко стъпки или дестилирани семплери) намаляват генерирането от десетки стъпки на една или две, което позволява създаване в почти реално време. Очаквайте по-силно изобразяване на текст, по-добро бързо прилепване и безпроблемно редактиране на изображения, плюс видео и 3D разширения. Отворените тегла ще продължат да подхранват специализирани фини настройки, но също така засилват дебатите относно съгласието за данни за обучение, дълбоки фалшиви изображения и водни знаци, така че инструментите за откриване и произход ще растат заедно с моделите.
Внедряване в реалния свят
Художници и любители, генериращи концептуално изкуство и илюстрации локално на техния собствен GPU с персонализирани фини настройки на LoRA
Използване на ControlNet за ограничаване на поколение със скелет на поза, карта на дълбочината или скица на ръба за прецизна композиция
Рисуване и прерисуване за редактиране на снимки, премахване на обекти или разширяване на сцена отвъд оригиналните й граници
Независими студия за игри и дизайнери, произвеждащи текстури, дъски за настроение и вариации на активи бързо и евтино
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stable Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Стабилна видео дифузия
Frequently asked questions
What is Stable Diffusion?
Stable Diffusion е модел с отворен код текст към изображение, пуснат от Stability AI през 2022 г., който генерира картини чрез постепенно премахване на шума от произволна начална точка. Тъй като е отворен и може да се изпълнява на потребителски графични процесори, той предизвика огромна общност от инструменти, фини настройки и приложения.
На високо ниво, как моделът на дифузия генерира изображение?
Дифузионните модели се научават да обръщат процеса на шум: започвайки от шума, те итеративно премахват шума, докато се появи кохерентно изображение.
Какво прави Stable Diffusion достатъчно ефективен, за да работи на потребителски GPU?
Stable Diffusion е модел на латентна дифузия: автокодиращо устройство компресира изображения, така че тежкото премахване на шума да работи в по-малко латентно пространство.
Как вашата текстова подкана влияе върху генерираното изображение?
Текстов енкодер преобразува подканата във вграждания, които обуславят U-Net чрез кръстосано внимание, управлявайки резултата.
Какво ви позволява да контролирате насоките без класификатор?
Насоките без класификатор смесват условни и безусловни прогнози, което ви позволява да увеличите или намалите бързото придържане.
Защо Stable Diffusion предизвика такава голяма екосистема от инструменти като ControlNet и LoRA?
Отворените тегла позволяват на общността да прецизира и разшири модела, създавайки добавки като ControlNet и леки LoRA адаптери.