РУКОВОДСТВО ПО ОСНОВАМ

Диффузионные модели

Модели диффузии генерируют изображения, обучаясь обращать вспять процесс зашумления, шаг за шагом превращая случайную статику в подробные изображения.

2 минуты чтенияПоследнее обновление

Обзор

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Глубокое погружение

Диффузионная модель обучается в двух направлениях. В прямом процессе чистое изображение постепенно искажается за счет добавления небольшого количества случайного шума, пока оно не становится чисто статичным. Затем модель учится обратному: начиная с шума, она прогнозирует и удаляет небольшой шум на каждом этапе, повторяя десятки или сотни раз, пока не появится четкое изображение. Чтобы сделать это управляемым, каждый шаг шумоподавления сопровождается текстовой подсказкой, поэтому «космонавт верхом на лошади» направляет статику в сторону этого изображения. Современные системы, такие как Stable Diffusion, запускают этот процесс в сжатом скрытом пространстве, а не на необработанных пикселях, что делает его намного быстрее. По сравнению с GAN, диффузионные модели обучаются более стабильно и обеспечивают большее разнообразие, поэтому примерно в 2022 году они обогнали GAN как доминирующий подход к созданию высококачественных изображений.

Техническая информация

Ключевой трюк заключается в том, что сети никогда не приходится генерировать изображение за один раз; он только учится предсказывать шум, добавляемый на данном этапе. Во время обучения к реальному изображению добавляется известное количество шума, и модели предлагается оценить этот шум; разница заключается в ошибке обучения. Во время генерации модель неоднократно вычитает прогнозируемый шум, постепенно раскрывая структуру. Кондиционирование текста осуществляется посредством перекрестного внимания, а руководство без классификаторов усиливает то, насколько сильно подсказка управляет выводом.

Стратегическое воздействие

Более четкие решения

Это поможет вам отделить четкие технические заявления от маркетингового языка.

Стоимость и бюджет

Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.

Команда и рабочий процесс

Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.

Будущее диффузионных моделей

Распространение — это современное состояние генерации изображений, а все чаще видео и аудио, с такими инструментами, как Sora, расширяющими его до движения. Большим преимуществом является скорость: такие методы, как дистилляция и модели согласованности, направлены на сокращение сотен этапов шумоподавления до нескольких или даже одного, обеспечивая генерацию в реальном времени. Ожидается, что распространение распространится на 3D-ресурсы, научные разработки, такие как молекулы и белки, и жестко контролируемое редактирование, при этом они станут достаточно дешевыми, чтобы работать на телефонах.

Реальная реализация

Создание оригинальных иллюстраций и изображений из текстовых подсказок в Stable Diffusion, DALL-E и Midjourney.

Закрашивание и перекрашивание, плавное заполнение или расширение частей фотографии.

Создание видео из текста с помощью таких инструментов, как Sora от OpenAI.

Разработка новых молекул и белковых структур для исследований по открытию лекарств.

Риски и ограничения

Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.

Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.

Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.

Дорожная карта реализации

1

Начните с простого определения желаемого результата.

2

Перед тестированием выберите один показатель успеха и одно условие отказа.

3

Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.

4

Документируйте, где модели диффузии помогают и где более простые методы лучше.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Модель диффузии GLIDE

Часто задаваемые вопросы

What is Diffusion Models?

Модели диффузии генерируют изображения, обучаясь обращать вспять процесс зашумления, шаг за шагом превращая случайную статику в подробные изображения. Они используются в ведущих сегодня инструментах преобразования текста в изображение, таких как Stable Diffusion, DALL-E и Midjourney.

Какова основная идея того, как диффузионная модель генерирует изображение?

Диффузионная модель учится обращать вспять процесс шумообразования, начиная с чистого шума и поэтапно удаляя шум, пока не появится четкое изображение.

Что модель на самом деле учится прогнозировать на каждом этапе во время обучения?

Модель получает зашумленное изображение и учится оценивать добавленный шум, чтобы позже вычесть шум во время генерации.

Как текстовая подсказка влияет на создаваемое изображение?

Кондиционирование текста (посредством перекрестного внимания и указаний) подталкивает каждый шаг шумоподавления так, чтобы появляющееся изображение соответствовало подсказке.

Почему стабильная диффузия запускает процесс в «скрытом пространстве»?

Работа в сжатом скрытом пространстве вместо пикселей с полным разрешением значительно сокращает объем вычислений при сохранении качества.

Каково одно из ключевых преимуществ диффузионных моделей перед GAN?

Модели диффузии позволяют избежать нестабильной состязательной игры и коллапса режимов GAN, обеспечивая более надежное обучение и большее разнообразие результатов.