Керівництво без класифікатора
Вказівки без класифікаторів — це техніка, яка змушує дифузійні моделі фактично слідувати вашим підказкам, обмінюючи деяку різноманітність на набагато більшу прихильність.
Огляд
It is the single dial behind the 'guidance scale' slider in nearly every image generator.
Глибоке занурення
Рання керована дифузія потребувала окремого класифікатора для підштовхування зразків до бажаного класу, який був крихким і вимагав додаткового навчання. Рекомендації без класифікаторів, запропоновані Джонатаном Хо та Тімом Салімансом у 2022 році, усувають цю залежність. Під час навчання модель випадковим чином скидає обумовлення (текстове підказка) деякий відсоток часу, тому вона вчиться створювати як умовні, так і безумовні прогнози за допомогою однієї мережі. Під час вибірки ви запускаєте модель двічі за крок, один раз із підказкою та один раз без, а потім екстраполюєте від безумовного прогнозу до умовного. Рівень екстраполяції є орієнтовною шкалою: вищі значення забезпечують більш чітке прилягання та сильнішу насиченість, тоді як нижчі значення дають більше різноманітності, але слабшу відповідність.
Технічне розуміння
Математично кероване передбачення шуму — це безумовне передбачення плюс шкала наведення, помножена на різницю між умовним і безумовним прогнозами. Шкала 1 означає відсутність вказівок; типові значення – від 5 до 9. Дуже високе збільшення шкали посилює миттєві функції, але спричиняє перенасичені кольори, різкий контраст і артефакти, оскільки модель екстраполює далеко за межі вивченого розподілу. Це коштує приблизно два проходи вперед на крок усунення шумів.
Стратегічний вплив
Швидкість і масштаб
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Створіть вибір
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Команда та робочий процес
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Майбутнє керування без класифікаторів
Дослідники вдосконалюють інструкції, щоб забезпечити швидке дотримання без перенасичення, за допомогою динамічного порогового значення, графіків інструкцій, які змінюють силу між кроками, і прийомів зміни масштабу. Удосконалені моделі тепер об’єднують навігацію за один прохід, щоб вдвічі скоротити обчислення, а новіші формули досліджують збурену увагу та автоматичне наведення, які взагалі не потребують безумовного розгалуження, прагнучи до чітких, правдивих зображень за меншою ціною.
Реалізація в реальному світі
Налаштування повзунка «Шкала CFG» у Stable Diffusion або Midjourney, щоб збалансувати оперативну точність і креативність
Підвищення вказівок, щоб змусити генератор включити певний об’єкт, який важко відобразити, описаний у підказці
Зменшення вказівок, щоб отримати більш різноманітні, менш перенасичені результати під час вивчення багатьох варіантів дизайну
Налаштування розкладів інструкцій у виробничих конвеєрах, щоб зменшити артефакти вигорання кольору на рендерах із високою деталізацією
Ризики та огорожі
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Дорожня карта впровадження
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Classifier-Free Guidance quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Наївні байєсівські класифікатори
Часті запитання
What is Classifier-Free Guidance?
Вказівки без класифікаторів — це техніка, яка змушує дифузійні моделі фактично слідувати вашим підказкам, обмінюючи деяку різноманітність на набагато більшу прихильність. Це єдиний циферблат за повзунком «керівницької шкали» майже в кожному генераторі зображень.
Яка основна мета настанов без класифікаторів?
Рекомендації без класифікаторів підвищують оперативне дотримання шляхом екстраполяції від безумовного до умовного прогнозу.
Як модель навчиться робити безумовні прогнози для вказівок без класифікаторів?
Під час навчання деякий час підказка скидається випадковим чином, тому одна мережа вивчає як умовну, так і безумовну поведінку.
Що зазвичай дає збільшення орієнтовної шкали?
Вищі навігації зумовлюють міцніше прилягання та сильніші характеристики, але надмірне наведення спричиняє перенасичені, жорсткі зображення, схильні до артефактів.
Приблизно скільки проходів вперед на крок усунення шуму вимагає стандартне керування без класифікатора?
Модель запускається один раз із підказкою і один раз без, потім прогнози об’єднуються, що коштує приблизно два проходи на крок.
Яку перевагу має настанова без класифікатора перед настановою за допомогою класифікатора?
Використовуючи єдину мережу для обох прогнозів, він уникає крихкого, додаткового класифікатора, якого вимагала старіша керована дифузія.