Модели на латентна дифузия
Моделите на латентна дифузия генерират изображения, като изпълняват процеса на дифузия в компресирано латентно пространство вместо необработени пиксели, намалявайки изчислителните разходи.
Преглед
They are the engine behind Stable Diffusion and most modern open-source image generators.
Дълбоко гмуркане
Стандартен модел на дифузия се научава да обръща процес на шум: той започва от чист шум и постепенно обезшумява в изображение. Правенето на това директно върху пиксели е скъпо, защото изображение 512x512 има стотици хиляди стойности. Латентната дифузия, въведена от Ромбах и колеги през 2022 г., първо използва предварително обучен вариационен автоенкодер (VAE), за да компресира изображение в малка латентна мрежа (често 64x64x4, приблизително 48x по-малка). След това дифузионната U-Net се научава да обезшумява вътре в това компактно латентно пространство, ръководено от текст чрез кръстосано внимание. Накрая VAE декодерът реконструира пиксели с пълна разделителна способност. Тази перцептивна компресия запазва семантично значимата информация, като същевременно отхвърля незабележимите детайли, което прави висококачественото генериране възможно на потребителските GPU.
Техническа информация
Ключовият трик е разделянето на перцептивната компресия от генеративното моделиране. VAE обработва детайлите на високочестотните пиксели веднъж, а U-Net моделира само латентното разпределение с по-ниско измерение. Кондиционирането на текста се инжектира чрез слоеве за кръстосано внимание, където пространствените характеристики на U-Net се грижат за вграждането на токени от текстов енкодер като CLIP. Тъй като латентите са приблизително 48 пъти по-малки от пикселите, всяка стъпка на обезшумяване е драстично по-евтина както за памет, така и за FLOP.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на моделите на латентна дифузия
Латентната дифузия се разширява отвъд изображенията във видео (Stable Video Diffusion), 3D активи и аудио спектрограми, като всички използват една и съща рецепта за компресиране и след това обезшумяване. Изследванията се стремят към по-малко стъпки за вземане на проби чрез модели на дестилация и консистенция, по-добри VAE, които запазват финия текст и лица, и формули с коригиран поток като тези в Stable Diffusion 3, които изправят траекторията на генериране за по-бързи и по-ясни резултати.
Внедряване в реалния свят
Stable Diffusion генерира произведения на изкуството и концептуални дизайни от текстови подкани на един потребителски GPU
Adobe и Canva, захранващи функции за текст към изображение и генериращо запълване, изградени на основата на латентна дифузия
Студиа за игри, произвеждащи текстурни карти, спрайтове и концептуално изкуство на околната среда за ускоряване на предварителната продукция
Екипи за стокови изображения и маркетинг, създаващи макети на продукти на марката и рекламни визуализации без фотосесия
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Модели на видео дифузия
Frequently asked questions
What is Latent Diffusion Models?
Моделите на латентна дифузия генерират изображения, като изпълняват процеса на дифузия в компресирано латентно пространство вместо необработени пиксели, намалявайки изчислителните разходи. Те са двигателят зад Stable Diffusion и повечето модерни генератори на изображения с отворен код.
Каква е основната иновация на моделите на латентна дифузия в сравнение с дифузията в пространството на пикселите?
Латентната дифузия компресира изображенията в по-малко латентно пространство с помощта на VAE, така че скъпото премахване на шума се случва при много по-малко стойности от пълните пиксели.
Кой компонент компресира изображение в латентното пространство и след това го реконструира?
Предварително обучен VAE кодира изображението в компактна латентна мрежа и неговият декодер реконструира пиксели с пълна разделителна способност в края.
Как текстът обикновено се инжектира в обезшумяващата U-Net при латентна дифузия?
Вгражданията на токени от текстов енкодер се подават в слоеве за кръстосано внимание, позволявайки на пространствените характеристики да се грижат за подканата.
Защо работата в латентно пространство намалява изчислителните разходи?
Изчакайте - правилната причина е, че латентната мрежа е много по-малка (често ~48x) от пикселното изображение, така че всяка стъпка на премахване на шума се нуждае от много по-малко FLOPs и памет.
Кой широко използван модел с отворен код популяризира латентната дифузия?
Stable Diffusion, издаден през 2022 г., донесе латентно разпространение на потребителския хардуер и масово приемане.