Спеціальне налаштування мультиконцепції дифузії
Custom Diffusion — це легкий метод тонкого налаштування, який навчає моделі тексту в зображенні новим особистим концепціям, як-от ваша собака чи певний стілець, лише за кількома фотографіями.
Огляд
Its standout feature is composing several newly learned concepts together in one generated scene.
Глибоке занурення
Custom Diffusion, випущений дослідниками Adobe і CMU у 2022 році, персоналізує такі моделі, як Stable Diffusion, без перенавчання всієї мережі. Замість того, щоб оновлювати кожну вагу, було виявлено, що оновлення лише невеликого фрагмента, матриць проекції ключів і значень у шарах перехресної уваги, достатньо, щоб поглинути нову концепцію приблизно з 4 до 20 зображень. Це забезпечує швидке налаштування (хвилини) і мале місце для зберігання (мегабайти, а не гігабайти). Важливо те, що він може вивчати декілька концепцій одночасно шляхом спільного навчання або шляхом об’єднання окремо навчених концепцій за допомогою обмеженої оптимізації. Це дозволяє вам підказувати, скажімо, свого конкретного кота, який сидить на вашому конкретному дизайнерському стільці, щось, що важко поєднати методам однієї концепції.
Технічне розуміння
Перехресна увага – це те, де текстова підказка впливає на зображення; текстові токени формують запити, які звертаються до візуальних функцій дифузійної моделі за допомогою матриць ключів і значень. Custom Diffusion зупиняє більшу частину U-Net і налаштовує лише проекції K і V, частини, які найбільше відповідають за прив’язку слів до зовнішнього вигляду. Він також використовує регуляризаційний набір реальних зображень, що мають спільну категорію концепту, щоб запобігти переобладнанню моделі та забуттю ширшого значення слова.
Стратегічний вплив
Швидкість і масштаб
Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.
Створіть вибір
Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.
Команда та робочий процес
Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.
Майбутнє налаштування мультиконцепції Custom Diffusion
Персоналізація кількох концепцій зближується з екосистемами адаптерів, такими як LoRA, де багато невеликих модулів концепції можна змішувати під час висновку. Майбутні системи мають на меті створити десятки користувальницьких концепцій чисто без витоку атрибутів (забарвлення кота, що витікає на стілець), а також виконати налаштування за секунди або навіть лише за допомогою кодера, без оптимізації. Очікуйте, що це стане основою для створення ресурсів, узгоджених із брендом, персональних аватарів і налаштування на пристрої.
Реалізація в реальному світі
Навчання моделі вашого домашнього улюбленця на основі декількох фотографій, а потім створення його в нових позах, костюмах і налаштуваннях
Вивчення продукту бренду (кросівок або пляшки) і талісмана бренду, а потім поєднання обох в одному маркетинговому образі
Знімок особистого об’єкта мистецтва та зображення члена сім’ї та розміщення їх разом у вигаданих сценах
Поєднання меблів на замовлення з нестандартним стилем кімнати для імітації концепцій дизайну інтер’єру
Ризики та огорожі
Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.
Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.
Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.
Дорожня карта впровадження
Визначте критерії прийнятності для точності, відкликання та вартості помилок.
Тестуйте з даними, які відповідають реальним умовам виробництва.
Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.
Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Custom Diffusion Multi-Concept Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Політика розповсюдження для керування роботами
Часті запитання
What is Custom Diffusion Multi-Concept Tuning?
Custom Diffusion — це легкий метод тонкого налаштування, який навчає моделі тексту в зображенні новим особистим концепціям, як-от ваша собака чи певний стілець, лише за кількома фотографіями. Його відмінна функція полягає в тому, що кілька нещодавно вивчених концепцій об’єднуються в одну згенеровану сцену.
Яку частину моделі розповсюдження в основному тонко налаштовує Custom Diffusion?
Він оновлює лише матриці перехресної уваги K і V, які прив’язують слова до зовнішнього вигляду, зберігаючи швидке налаштування та невеликий збережений файл.
Чим Custom Diffusion найбільш помітний порівняно з методами однієї концепції?
Його відмінною можливістю є створення кількох концепцій, поєднання кількох персоналізованих об’єктів.
Приблизно скільки прикладів зображень потрібно Custom Diffusion, щоб вивчити концепцію?
Він навчається на невеликій кількості зображень, що робить персоналізацію практичною для звичайних користувачів.
Чому Custom Diffusion використовує набір регуляризаційних зображень із ширшої категорії концепції?
Зображення регуляризації зберігають загальне значення слова категорії недоторканим, тому модель не згортається лише до нової концепції.
Як дві окремо навчені концепції Custom Diffusion використовувати разом?
Незалежно вивчені концепції можна об’єднати за допомогою обмеженої оптимізації закритої форми, уможливлюючи спільні підказки.