DreamBooth
DreamBooth настройва фино цял модел на изображение върху шепа снимки, така че да „запомня“ дълбоко конкретен обект – вашето лице, домашен любимец или продукт – и да може да го постави във всяка сцена.
Преглед
It trades larger file sizes for higher fidelity than lighter personalization methods.
Дълбоко гмуркане
DreamBooth, публикуван от изследователи на Google през 2022 г., персонализира моделите текст-към-изображение, като действително фино настройва тежестите на мрежата на 3-5 изображения на даден обект. Той обвързва субекта с рядък токен, съчетан с дума от класа – например „снимка на куче sks“ – така че моделът научава, че „sks“ означава *това конкретно* куче. Основно предизвикателство е „езичното отклонение“ и пренастройването: тренирайте твърде много и моделът забравя как да рисува други кучета или само възпроизвежда позите за обучение. Ключовата корекция на DreamBooth е загуба преди запазване: той също така се обучава върху собствено генерирани от модела изображения на общи кучета, закотвяйки по-широката концепция за „куче“, докато редкият токен поглъща конкретния обект. Резултатът е поразителен реализъм и гъвкавост, позволявайки на обекта да се появи в ново осветление, пози и стилове.
Техническа информация
DreamBooth актуализира теглата на дифузионния модел, а не само вграждане, поради което прецизността е висока. Той сдвоява уникален идентификатор (рядък токен като „sks“) със съществително име от клас, така че моделът прикрепя нови подробности за външния вид към токена, като същевременно използва съществуващите познания за класа. Загубата на предварително запазване едновременно се вписва в автоматично генерирани изображения на класове, противодействайки на пренастройването и „отклоняването на езика“, така че моделът продължава да генерира различни членове на този клас.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на DreamBooth
DreamBooth постави летвата за персонализиране с висока прецизност и все повече се слива с LoRA, за да намали тежкото си съхранение и изчисления – „DreamBooth-LoRA“ вече е по подразбиране в много инструменти. Очаквайте по-бързо обучение, многопредметни сесии, които учат няколко души наведнъж и по-стриктно запазване на самоличността за видео и 3D аватари. Тъй като потребителските приложения го възприемат, внимавайте за парапети около съгласието и подобието, тъй като същата вярност, която позволява персонализирани аватари, също поражда опасения за дълбоки фалшификации и имитация.
Внедряване в реалния свят
Генериране на професионални снимки на глава на човек в много тоалети и настройки само от няколко селфита.
Поставяне на конкретни маратонки или чанта в безкрайни рекламни сцени, като същевременно запазвате точния им дизайн.
Създаване на последователен илюстриран талисман за марка в плакати, социални публикации и опаковки.
Създаване на персонализирани пакети с аватари, където лицето на потребителя се появява като супергерой, художник или астронавт.
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamBooth quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Разпознаване на действие
Frequently asked questions
What is DreamBooth?
DreamBooth настройва фино цял модел на изображение върху шепа снимки, така че да „запомня“ дълбоко конкретен обект – вашето лице, домашен любимец или продукт – и да може да го постави във всяка сцена. Той търгува с по-големи размери на файлове за по-висока прецизност в сравнение с по-леките методи за персонализиране.
Какво променя DreamBooth, което Textual Inversion не прави?
DreamBooth прецизира тежестите на мрежата, докато Textual Inversion научава само вграждане.
Каква е целта на загубата преди запазване на DreamBooth?
Обучението върху автоматично генерирани изображения на клас закотвя общата концепция, така че моделът да не забравя как да рисува други членове на класа.
Как обикновено се споменава тема в подканите за обучение на DreamBooth?
Уникален рядък идентификатор е съчетан със съществително име от клас, така че моделът прикрепя нови подробности към токена.
Приблизително от колко предметни изображения се нуждае DreamBooth?
Подобно на други методи за персонализиране с няколко снимки, DreamBooth работи само с няколко изображения.
Какъв е често срещаният компромис при използването на DreamBooth?
Тъй като прецизно настройва тежестите, файловете на DreamBooth са по-големи и обучението е по-взискателно от Textual Inversion.