Руководство без классификаторов
Руководство без классификаторов — это метод, который заставляет диффузионные модели фактически следовать вашим подсказкам, обменивая некоторое разнообразие на гораздо более сильное соответствие.
Обзор
It is the single dial behind the 'guidance scale' slider in nearly every image generator.
Глубокое погружение
Ранняя управляемая диффузия требовала отдельного классификатора, чтобы подтолкнуть образцы к желаемому классу, который был хрупким и требовал дополнительного обучения. Руководство без классификаторов, предложенное Джонатаном Хо и Тимом Салимансом в 2022 году, устраняет эту зависимость. Во время обучения модель случайным образом отбрасывает условие (текстовое приглашение) в некотором проценте случаев, поэтому она учится создавать как условные, так и безусловные прогнозы с помощью одной сети. Во время выборки вы запускаете модель дважды за шаг, один раз с подсказкой и один раз без нее, а затем экстраполируете от безусловного прогноза к условному. Величина экстраполяции представляет собой ориентировочную шкалу: более высокие значения требуют более строгого соблюдения сроков и большей насыщенности, тогда как более низкие значения дают больше разнообразия, но более слабое соответствие.
Техническая информация
Математически управляемый прогноз шума представляет собой безусловный прогноз плюс шкалу руководства, умноженную на разницу между условным и безусловным прогнозами. Шкала 1 означает отсутствие указаний; типичные значения от 5 до 9. Очень высокое увеличение шкалы усиливает подсказки, но приводит к перенасыщенным цветам, резкому контрасту и артефактам, поскольку модель экстраполирует далеко за пределы своего изученного распределения. Это стоит примерно два прохода вперед на шаг шумоподавления.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее руководств без классификаторов
Исследователи совершенствуют рекомендации, чтобы обеспечить быстрое соблюдение режима без перенасыщения, с помощью динамического установления порогов, графиков рекомендаций, которые меняют интенсивность на разных этапах, и приемов изменения масштаба. Дистиллированные модели теперь объединяют наведение в один проход, что позволяет вдвое сократить вычислительные затраты, а новые формулы исследуют возмущенное внимание и автонаведение, которым вообще не требуется безусловная ветвь, стремясь к получению четких и точных изображений с меньшими затратами.
Реальная реализация
Настройка ползунка «Масштаб CFG» в Stable Diffusion или Midjourney, чтобы сбалансировать быструю точность и креативность.
Повышение руководства, чтобы заставить генератор включить конкретный, трудно визуализируемый объект, описанный в подсказке.
Снижение рекомендаций для получения более разнообразных и менее перенасыщенных результатов при изучении множества вариантов дизайна.
Настройка графиков руководства в производственных конвейерах для уменьшения артефактов выгорания цвета при высокодетализированной визуализации.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Classifier-Free Guidance quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Наивные байесовские классификаторы
Часто задаваемые вопросы
What is Classifier-Free Guidance?
Руководство без классификаторов — это метод, который заставляет диффузионные модели фактически следовать вашим подсказкам, обменивая некоторое разнообразие на гораздо более сильное соответствие. Это единственный диск за ползунком «шкала навигации» почти в каждом генераторе изображений.
Какова основная цель руководства без классификаторов?
Руководство без классификаторов способствует быстрому соблюдению требований за счет экстраполяции от безусловного прогноза к условному.
Как модель учится делать безусловные прогнозы для руководства без классификаторов?
Во время обучения подсказка иногда случайно отбрасывается, поэтому одна сеть изучает как условное, так и безусловное поведение.
Что обычно дает увеличение шкалы ориентировок?
Более высокое руководство требует более строгого соблюдения и более сильных функций, но слишком сильное его использование приводит к перенасыщенным, резким изображениям, склонным к появлению артефактов.
Сколько примерно проходов вперед на шаг шумоподавления требует стандартное руководство без классификатора?
Модель запускается один раз с подсказкой и один раз без нее, затем прогнозы объединяются, что обходится примерно в два прохода на шаг.
Какое преимущество имеет руководство без классификатора перед руководством с использованием классификатора?
Используя одну сеть для обоих прогнозов, мы избегаем хрупкого дополнительного классификатора, который требовался от старой управляемой диффузии.