Модели скрытой диффузии
Модели скрытой диффузии генерируют изображения, запуская процесс диффузии в сжатом скрытом пространстве вместо необработанных пикселей, что снижает затраты на вычисления.
Обзор
They are the engine behind Stable Diffusion and most modern open-source image generators.
Глубокое погружение
Стандартная модель диффузии учится обращать процесс шумообразования: она начинается с чистого шума и постепенно преобразует шум в изображение. Делать это непосредственно на пикселях дорого, поскольку изображение размером 512x512 имеет сотни тысяч значений. Скрытая диффузия, представленная Ромбахом и его коллегами в 2022 году, сначала использует предварительно обученный вариационный автокодировщик (VAE) для сжатия изображения в небольшую скрытую сетку (часто 64x64x4, что примерно в 48 раз меньше). Затем диффузионная сеть U-Net учится шумоподавлять внутри этого компактного скрытого пространства, руководствуясь текстом посредством перекрестного внимания. Наконец, декодер VAE восстанавливает пиксели с полным разрешением. Такое перцепционное сжатие сохраняет семантически значимую информацию, отбрасывая при этом незаметные детали, что делает возможным высококачественную генерацию на потребительских графических процессорах.
Техническая информация
Ключевой трюк — отделить перцепционное сжатие от генеративного моделирования. VAE обрабатывает детализацию высокочастотных пикселей один раз, а U-Net моделирует только скрытое распределение нижних измерений. Кондиционирование текста вводится через уровни перекрестного внимания, где пространственные функции U-Net обрабатывают встраивание токенов из текстового кодировщика, такого как CLIP. Поскольку скрытые значения примерно в 48 раз меньше пикселей, каждый шаг шумоподавления значительно дешевле как в памяти, так и в FLOP.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее моделей скрытой диффузии
Скрытое распространение выходит за рамки изображений и переходит в видео (стабильное распространение видео), 3D-ресурсы и аудиоспектрограммы, причем все они используют один и тот же рецепт сжатия, а затем шумоподавления. Исследования направлены на сокращение количества этапов отбора проб с помощью моделей дистилляции и консистенции, более совершенных VAE, сохраняющих мелкий текст и лица, а также формулировок с выпрямленным потоком, таких как Stable Diffusion 3, которые выпрямляют траекторию генерации для более быстрых и точных результатов.
Реальная реализация
Stable Diffusion генерирует графические изображения и концептуальные проекты из текстовых подсказок на одном потребительском графическом процессоре.
Adobe и Canva используют функции преобразования текста в изображение и генеративной заливки, основанные на скрытых диффузионных основах.
Игровые студии, создающие текстурные карты, спрайты и концепт-арты окружающей среды для ускорения подготовки к производству.
Команды по стоковым изображениям и маркетингу создают фирменные макеты продуктов и рекламные ролики без фотосессии.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Модели видеодиффузии
Часто задаваемые вопросы
What is Latent Diffusion Models?
Модели скрытой диффузии генерируют изображения, запуская процесс диффузии в сжатом скрытом пространстве вместо необработанных пикселей, что снижает затраты на вычисления. Они являются основой Stable Diffusion и большинства современных генераторов изображений с открытым исходным кодом.
Какова основная инновация моделей скрытой диффузии по сравнению с диффузией в пиксельном пространстве?
Скрытая диффузия сжимает изображения в меньшее скрытое пространство с помощью VAE, поэтому дорогостоящее шумоподавление происходит при гораздо меньшем количестве значений, чем при полных пикселях.
Какой компонент сжимает изображение в скрытое пространство и впоследствии восстанавливает его?
Предварительно обученный VAE кодирует изображение в компактную скрытую сетку, а его декодер в конце восстанавливает пиксели с полным разрешением.
Как текст обычно вводится в U-Net с шумоподавлением при скрытой диффузии?
Внедрения токенов из текстового кодировщика передаются в слои перекрестного внимания, позволяя пространственным объектам обрабатывать подсказки.
Почему работа в скрытом пространстве снижает вычислительные затраты?
Подождите — правильная причина в том, что скрытая сетка намного меньше (часто ~ 48x), чем пиксельное изображение, поэтому каждый шаг шумоподавления требует гораздо меньше FLOP и памяти.
Какая широко используемая модель открытого исходного кода способствовала популяризации скрытого распространения?
Stable Diffusion, выпущенный в 2022 году, привел к скрытому распространению потребительского оборудования и массовому внедрению.