РЪКОВОДСТВО за визуален AI

Модели на латентна дифузия

Моделите на латентна дифузия генерират изображения, като изпълняват процеса на дифузия в компресирано латентно пространство вместо необработени пиксели, намалявайки изчислителните разходи.

2 min readПоследна актуализация

Преглед

They are the engine behind Stable Diffusion and most modern open-source image generators.

Дълбоко гмуркане

Стандартен модел на дифузия се научава да обръща процес на шум: той започва от чист шум и постепенно обезшумява в изображение. Правенето на това директно върху пиксели е скъпо, защото изображение 512x512 има стотици хиляди стойности. Латентната дифузия, въведена от Ромбах и колеги през 2022 г., първо използва предварително обучен вариационен автоенкодер (VAE), за да компресира изображение в малка латентна мрежа (често 64x64x4, приблизително 48x по-малка). След това дифузионната U-Net се научава да обезшумява вътре в това компактно латентно пространство, ръководено от текст чрез кръстосано внимание. Накрая VAE декодерът реконструира пиксели с пълна разделителна способност. Тази перцептивна компресия запазва семантично значимата информация, като същевременно отхвърля незабележимите детайли, което прави висококачественото генериране възможно на потребителските GPU.

Техническа информация

Ключовият трик е разделянето на перцептивната компресия от генеративното моделиране. VAE обработва детайлите на високочестотните пиксели веднъж, а U-Net моделира само латентното разпределение с по-ниско измерение. Кондиционирането на текста се инжектира чрез слоеве за кръстосано внимание, където пространствените характеристики на U-Net се грижат за вграждането на токени от текстов енкодер като CLIP. Тъй като латентите са приблизително 48 пъти по-малки от пикселите, всяка стъпка на обезшумяване е драстично по-евтина както за памет, така и за FLOP.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на моделите на латентна дифузия

Латентната дифузия се разширява отвъд изображенията във видео (Stable Video Diffusion), 3D активи и аудио спектрограми, като всички използват една и съща рецепта за компресиране и след това обезшумяване. Изследванията се стремят към по-малко стъпки за вземане на проби чрез модели на дестилация и консистенция, по-добри VAE, които запазват финия текст и лица, и формули с коригиран поток като тези в Stable Diffusion 3, които изправят траекторията на генериране за по-бързи и по-ясни резултати.

Внедряване в реалния свят

Stable Diffusion генерира произведения на изкуството и концептуални дизайни от текстови подкани на един потребителски GPU

Adobe и Canva, захранващи функции за текст към изображение и генериращо запълване, изградени на основата на латентна дифузия

Студиа за игри, произвеждащи текстурни карти, спрайтове и концептуално изкуство на околната среда за ускоряване на предварителната продукция

Екипи за стокови изображения и маркетинг, създаващи макети на продукти на марката и рекламни визуализации без фотосесия

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Модели на видео дифузия

Frequently asked questions

What is Latent Diffusion Models?

Моделите на латентна дифузия генерират изображения, като изпълняват процеса на дифузия в компресирано латентно пространство вместо необработени пиксели, намалявайки изчислителните разходи. Те са двигателят зад Stable Diffusion и повечето модерни генератори на изображения с отворен код.

Каква е основната иновация на моделите на латентна дифузия в сравнение с дифузията в пространството на пикселите?

Латентната дифузия компресира изображенията в по-малко латентно пространство с помощта на VAE, така че скъпото премахване на шума се случва при много по-малко стойности от пълните пиксели.

Кой компонент компресира изображение в латентното пространство и след това го реконструира?

Предварително обучен VAE кодира изображението в компактна латентна мрежа и неговият декодер реконструира пиксели с пълна разделителна способност в края.

Как текстът обикновено се инжектира в обезшумяващата U-Net при латентна дифузия?

Вгражданията на токени от текстов енкодер се подават в слоеве за кръстосано внимание, позволявайки на пространствените характеристики да се грижат за подканата.

Защо работата в латентно пространство намалява изчислителните разходи?

Изчакайте - правилната причина е, че латентната мрежа е много по-малка (често ~48x) от пикселното изображение, така че всяка стъпка на премахване на шума се нуждае от много по-малко FLOPs и памет.

Кой широко използван модел с отворен код популяризира латентната дифузия?

Stable Diffusion, издаден през 2022 г., донесе латентно разпространение на потребителския хардуер и масово приемане.