Stable Diffusion
Stable Diffusion — это модель преобразования текста в изображение с открытым исходным кодом, выпущенная Stability AI в 2022 году. Она генерирует изображения путем постепенного удаления шума из случайной начальной точки.
Обзор
Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.
Глубокое погружение
Модели диффузии учатся обращать вспять процесс зашумления. Во время обучения к реальным изображениям шаг за шагом добавляется случайный шум, пока они не станут статичными; модель учится предсказывать и вычитать этот шум. Генерация начинается с чистого шума и неоднократно подвергается шумоподавлению, пока не появится связное изображение, руководствуясь текстовой подсказкой. Ключевой трюк эффективности Stable Diffusion — это «скрытая» часть: вместо работы с пикселями с полным разрешением он сжимает изображения в меньшее скрытое пространство с помощью вариационного автокодировщика, выполняет там медленное шумоподавление, а затем декодирует обратно в пиксели. Вот почему он может работать на типичном игровом графическом процессоре, а не в центре обработки данных. Кодировщик текста (CLIP в ранних версиях) преобразует вашу подсказку в руководство, а U-Net выполняет шумоподавление. Его открытые веса позволяли осуществлять тонкую настройку ControlNet, LoRA и использовать бесчисленные творческие инструменты.
Техническая информация
Стабильная диффузия – это модель скрытой диффузии. Автоэнкодер сжимает изображение размером 512x512 пикселей в компактную скрытую сетку, значительно сокращая объем вычислений. U-Net обучена предсказывать шум, добавляемый на каждом временном шаге, в зависимости от встраивания текста посредством перекрестного внимания. Руководство без классификатора позволяет указать, насколько сильно изображение следует подсказке, смешивая условные и безусловные прогнозы. При выводе сэмплер (такой как DDIM или Эйлер) выполняет выбранное количество шагов шумоподавления; большее количество шагов обычно означает более чистые результаты за счет скорости.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее стабильной диффузии
Открытая экосистема продолжает ускоряться: новые архитектуры (включая диффузию на основе трансформаторов и более быстрые многошаговые или дистиллированные сэмплеры) сокращают генерацию с десятков шагов до одного или двух, что позволяет создавать практически в реальном времени. Ожидайте более качественного рендеринга текста, лучшего соблюдения сроков и плавного редактирования изображений, а также видео и 3D-расширений. Открытые веса будут и дальше стимулировать специализированные тонкие настройки, но они также обострят дебаты по поводу согласия на данные обучения, дипфейков и водяных знаков, поэтому инструменты обнаружения и происхождения будут расти вместе с моделями.
Реальная реализация
Художники и любители создают концепт-арт и иллюстрации локально на своем собственном графическом процессоре с настраиваемыми настройками LoRA.
Использование ControlNet для ограничения генерации с помощью скелета позы, карты глубины или эскиза края для точной композиции.
Закрашивание и перерисовка для редактирования фотографий, удаления объектов или расширения сцены за пределы исходных границ.
Инди-игровые студии и дизайнеры, быстро и дешево создающие текстуры, мудборды и варианты ассетов.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stable Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Стабильная диффузия видео
Часто задаваемые вопросы
What is Stable Diffusion?
Stable Diffusion — это модель преобразования текста в изображение с открытым исходным кодом, выпущенная Stability AI в 2022 году. Она генерирует изображения путем постепенного удаления шума из случайной начальной точки. Будучи открытым и работающим на потребительских графических процессорах, он породил огромное сообщество инструментов, тонких настроек и приложений.
На высоком уровне, как диффузионная модель генерирует изображение?
Модели диффузии учатся обращать процесс шумообразования: начиная с шума, они итеративно удаляют шум, пока не появится связное изображение.
Что делает Stable Diffusion достаточно эффективным для работы на потребительском графическом процессоре?
Стабильная диффузия — это модель скрытой диффузии: автоэнкодер сжимает изображения, поэтому интенсивное шумоподавление выполняется в меньшем скрытом пространстве.
Как ваша текстовая подсказка влияет на создаваемое изображение?
Кодировщик текста преобразует подсказку во встраивания, которые обусловливают U-Net посредством перекрестного внимания, управляя результатом.
Что позволяет вам контролировать руководство без классификаторов?
Руководство без классификаторов сочетает в себе условные и безусловные прогнозы, позволяя вам увеличивать или уменьшать оперативное соблюдение.
Почему Stable Diffusion породила такую большую экосистему инструментов, как ControlNet и LoRA?
Открытые веса позволяют сообществу точно настраивать и расширять модель, создавая надстройки, такие как ControlNet и легкие адаптеры LoRA.