РЪКОВОДСТВО за визуален AI

ControlNet

ControlNet е добавка, която дава на моделите за генериране на изображения прецизен структурен контрол, като ви позволява да управлявате изхода с ръбове, пози, карти на дълбочина или драсканици.

2 min readПоследна актуализация

Преглед

It turns text-to-image from a slot machine into a controllable design tool.

Дълбоко гмуркане

Въведен от Lvmin Zhang и колеги през 2023 г., ControlNet се прикрепя към предварително обучен дифузионен модел като Stable Diffusion, без да преквалифицира цялото нещо. Той клонира енкодерните блокове на дифузионната U-Net в копие, което може да се обучава, след което свързва това копие обратно към замразения оригинал чрез нулеви инициализирани слоеве на навиване (нулеви конв.). Тези нулеви конверсии започват без ефект, така че обучението започва от поведението на оригиналния модел и постепенно се научава да инжектира кондициониране. Кондиционирането е пространствена карта: изображение на Canny edge, скелет на OpenPose, карта на дълбочината, маска за сегментиране или груба скица. Резултатът е, че генерираното изображение следва структурата на контролната карта, докато текстовата подкана задава стил и съдържание, давайки на артистите надеждни, повтарящи се оформления.

Техническа информация

Определящият трик е нулевата конволюция. Тъй като свързващите слоеве са инициализирани до нулеви тегла, клонът ControlNet първоначално не добавя нищо, така че моделът е идентичен с оригинала в началото на обучението. Това предотвратява вредния шум, който новите слоеве иначе биха инжектирали, и прави фината настройка стабилна дори при малки набори от данни. Градиентите се вливат в нулевите конверсии и постепенно отварят пътя на кондициониране, научавайки безопасно структурния контрол.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на ControlNet

Кондиционирането в стил ControlNet се превръща в стандартна инфраструктура в творческите инструменти, с многоусловно подреждане (комбиниране на поза плюс дълбочина плюс ръбове) и по-леки адаптери като T2I-адаптер и IP-адаптер. Очаквайте по-тясна интеграция във видео дифузията за последователен контрол на движението, интерактивно редактиране в реално време и унифицирани модели, които приемат много типове контрол наведнъж, размивайки границата между скициране и окончателно рендиране.

Внедряване в реалния свят

Заключване на точната поза на герой с OpenPose скелет при смяна на дрехите и фона чрез подканата

Използване на карти на Canny edge за преоформяне на снимка на сграда, като същевременно се запазят нейните прецизни архитектурни линии

Превръщане на груби ръчно нарисувани драсканици в полирани илюстрации за концептуално изкуство и сторибордове

Прилагане на карти на дълбочината, така че генерираните сцени да зачитат 3D оформлението за рендиране на продукти и макети на интериорен дизайн

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ControlNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Визуален SLAM

Frequently asked questions

What is ControlNet?

ControlNet е добавка, която дава на моделите за генериране на изображения прецизен структурен контрол, като ви позволява да управлявате изхода с ръбове, пози, карти на дълбочина или драсканици. Той превръща текст към изображение от слот машина в контролируем инструмент за проектиране.

Какъв проблем основно решава ControlNet за генериране на изображения?

ControlNet позволява на потребителите да насочват изхода с пространствени условия като ръбове, пози или дълбочина, което прави генерирането контролируемо, а не произволно.

Каква е ролята на слоевете с нулева конволюция в ControlNet?

Навивките с нулева инициализация не допринасят с нищо в началото, така че моделът съответства на оригинала и постепенно и стабилно научава кондиционирането.

Кое от тях е валиден вход за кондициониране на ControlNet?

ControlNet използва пространствени карти като скелети на пози, карти на дълбочината, ръбове на Canny и маски за сегментиране като структурни насоки.

Как се свързва ControlNet с базовия дифузионен модел като стабилна дифузия?

ControlNet клонира и обучава копие на енкодера, като същевременно запазва оригиналния U-Net замразен, запазвайки своите научени знания.

В работен поток на ControlNet какво обикновено задава стила и съдържанието, докато контролната карта задава структурата?

Текстовата подкана контролира стила и темата, докато контролната карта налага пространственото оформление.