Custom Diffusion Multi-Concept Tuning
Custom Diffusion е лек метод за фина настройка, който учи модел от текст към изображение на нови лични концепции, като вашето куче или конкретен стол, само от няколко снимки.
Преглед
Its standout feature is composing several newly learned concepts together in one generated scene.
Дълбоко гмуркане
Пуснат от изследователи на Adobe и CMU през 2022 г., Custom Diffusion персонализира модели като Stable Diffusion, без да обучава повторно цялата мрежа. Вместо да актуализира всяко тегло, то откри, че актуализирането само на малък отрязък, матриците за проекция на ключ и стойност в слоевете за кръстосано внимание, е достатъчно, за да се усвои нова концепция от приблизително 4 до 20 изображения. Това поддържа настройката бърза (минути) и малко място за съхранение (мегабайти вместо гигабайти). Най-важното е, че може да научи множество концепции наведнъж чрез съвместно обучение или чрез сливане на отделно обучени концепции, използвайки ограничена оптимизация. Това ви позволява да подсказвате, да речем, вашата конкретна котка, седнала на вашия конкретен дизайнерски стол, нещо, което методите с една концепция трудно се комбинират.
Техническа информация
Кръстосаното внимание е мястото, където текстовата подкана влияе върху изображението; текстовите токени образуват заявки, които обръщат внимание на визуалните характеристики на дифузионния модел чрез ключови и стойностни матрици. Custom Diffusion замразява по-голямата част от U-Net и настройва само тези K и V проекции, частите, които са най-отговорни за обвързването на думите с външния вид. Той също така използва набор за регулиране от реални изображения, споделящи категорията на концепцията, за да предотврати пренастройването на модела и забравянето на по-широкото значение на думата.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на Custom Diffusion Multi-Concept Tuning
Мултиконцептуалната персонализация се сближава с адаптерни екосистеми като LoRA, където много малки концептуални модули могат да се смесват по време на извод. Бъдещите системи имат за цел да композират десетки персонализирани концепции чисто без изтичане на атрибути (цветът на котката изтича върху стола) и да извършват настройка за секунди или дори само с енкодер, без оптимизация. Очаквайте това да подкрепи съобразено с марката генериране на активи, лични аватари и персонализиране на устройството.
Внедряване в реалния свят
Обучаване на модела на вашия конкретен домашен любимец от шепа снимки, след което го генерирате в нови пози, костюми и настройки
Изучаване на продукт на марка (маратонка или бутилка) и талисман на марката, след което композиране и на двете в едно маркетингово изображение
Улавяне на личен предмет на изкуството плюс подобие на член на семейството и поставянето им заедно в измислени сцени
Комбиниране на мебел по поръчка с персонализиран стил на стая, за да имитирате концепции за интериорен дизайн
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Custom Diffusion Multi-Concept Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Политика за разпространение за управление на роботи
Frequently asked questions
What is Custom Diffusion Multi-Concept Tuning?
Custom Diffusion е лек метод за фина настройка, който учи модел от текст към изображение на нови лични концепции, като вашето куче или конкретен стол, само от няколко снимки. Неговата изключителна функция е композирането на няколко новонаучени концепции заедно в една генерирана сцена.
Коя част от модела на дифузия Custom Diffusion основно прецизира?
Той актуализира само K и V матриците за кръстосано внимание, които свързват думите с външния вид, поддържайки настройката бърза и запаметения файл малък.
С какво е най-забележително Custom Diffusion в сравнение с методите с една концепция?
Характерната му способност е генериране на множество концепции, комбиниране на няколко персонализирани обекта заедно.
Приблизително колко примерни изображения са необходими на Custom Diffusion, за да научи концепция?
Той се учи от малка шепа изображения, което прави персонализирането практично за ежедневните потребители.
Защо Custom Diffusion използва набор от изображения за регулиране от по-широката категория на концепцията?
Изображенията за регулиране запазват общото значение на думата на категорията непокътнато, така че моделът да не се свива само до новата концепция.
Как две отделно обучени концепции за персонализирана дифузия могат да се използват заедно?
Независимо научените концепции могат да бъдат обединени чрез ограничена оптимизация в затворена форма, което позволява съвместни подкани.