Моделі латентної дифузії
Моделі латентної дифузії генерують зображення, запускаючи процес дифузії в стиснутому латентному просторі замість необроблених пікселів, що скорочує витрати на обчислення.
Огляд
They are the engine behind Stable Diffusion and most modern open-source image generators.
Глибоке занурення
Стандартна модель дифузії вчиться змінювати шумовий процес: вона починає з чистого шуму та поступово усуває шуми в зображення. Робити це безпосередньо на пікселях дорого, оскільки зображення 512x512 має сотні тисяч значень. Прихована дифузія, запроваджена Ромбахом та його колегами у 2022 році, вперше використовує попередньо навчений варіаційний автокодер (VAE) для стиснення зображення в невелику латентну сітку (часто 64x64x4, приблизно в 48x меншу). Потім дифузійна U-Net вчиться приглушувати шуми всередині цього компактного прихованого простору, керуючись текстом через перехресне увагу. Нарешті, декодер VAE реконструює пікселі повної роздільної здатності. Це сприйнятливе стиснення зберігає семантично значущу інформацію, відкидаючи непомітні деталі, що робить генерацію високої якості на споживчих графічних процесорах.
Технічне розуміння
Ключовий прийом полягає в тому, щоб відокремити перцептивне стиснення від генеративного моделювання. VAE обробляє високочастотні піксельні деталі один раз, а U-Net моделює лише низьковимірний латентний розподіл. Кондиціонування тексту впроваджується через перехресні рівні уваги, де просторові функції U-Net звертаються до вбудовування токенів із текстового кодувальника, такого як CLIP. Оскільки затримки приблизно в 48 разів менші за пікселі, кожен крок усунення шуму є значно дешевшим як для пам’яті, так і для FLOP.
Стратегічний вплив
Швидкість і масштаб
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Створіть вибір
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Команда та робочий процес
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Майбутнє моделей латентної дифузії
Латентне розповсюдження виходить за межі зображень у відео (Stable Video Diffusion), 3D-ресурси та аудіоспектрограми, використовуючи той самий рецепт «стиснення, а потім зменшення шуму». Дослідження просувають меншу кількість етапів відбору через моделі дистиляції та консистенції, кращі VAE, які зберігають тонкий текст і грані, а також формули випрямленого потоку, такі як у Stable Diffusion 3, які вирівнюють траєкторію генерації для швидших і чіткіших результатів.
Реалізація в реальному світі
Stable Diffusion створює ілюстрації та концептуальні проекти з текстових підказок на одному споживчому GPU
Adobe і Canva підтримують функції перетворення тексту в зображення та генеративного заповнення, побудовані на магістралях прихованої дифузії
Ігрові студії створюють текстурні карти, спрайти та концепт-арт середовища для прискорення попереднього виробництва
Команди зі стокових зображень і маркетингу створюють макети брендових продуктів і візуальні елементи реклами без фотосесії
Ризики та огорожі
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Дорожня карта впровадження
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Моделі розповсюдження відео
Часті запитання
What is Latent Diffusion Models?
Моделі латентної дифузії генерують зображення, запускаючи процес дифузії в стиснутому латентному просторі замість необроблених пікселів, що скорочує витрати на обчислення. Вони є двигуном стабільної дифузії та більшості сучасних генераторів зображень із відкритим кодом.
У чому головна інновація моделей прихованої дифузії порівняно з дифузією в просторі пікселів?
Прихована дифузія стискає зображення в менший прихований простір за допомогою VAE, тому дороге зменшення шуму відбувається на набагато менших значеннях, ніж на повних пікселях.
Який компонент стискає зображення в латентний простір і реконструює його потім?
Попередньо підготовлений VAE кодує зображення в компактну приховану сітку, а його декодер реконструює пікселі з повною роздільною здатністю в кінці.
Як текст зазвичай вставляється в U-Net, що знімає шум, у прихованій дифузії?
Вбудовані маркери з текстового кодувальника подаються на рівні перехресної уваги, дозволяючи просторовим функціям звертати увагу на підказку.
Чому робота в прихованому просторі зменшує обчислювальні витрати?
Зачекайте — правильною причиною є те, що латентна сітка набагато менша (часто ~48x), ніж піксельне зображення, тому кожен крок усунення шуму потребує набагато менше FLOP-ів і пам’яті.
Яка широко використовувана модель відкритого коду популяризувала латентну дифузію?
Stable Diffusion, випущений у 2022 році, приніс приховане поширення споживчого обладнання та масове впровадження.