РЪКОВОДСТВО за визуален AI

Насоки без класификатор

Насоките без класификатор са техниката, която кара дифузионните модели действително да следват вашата подкана, разменяйки известно разнообразие за много по-силно придържане.

2 min readПоследна актуализация

Преглед

It is the single dial behind the 'guidance scale' slider in nearly every image generator.

Дълбоко гмуркане

Ранната ръководена дифузия се нуждаеше от отделен класификатор, за да избута пробите към желания клас, който беше крехък и изискваше допълнително обучение. Насоките без класификатори, предложени от Джонатан Хо и Тим Салиманс през 2022 г., премахват тази зависимост. По време на обучението моделът на случаен принцип изпуска кондиционирането (текстовата подкана) известен процент от времето, така че се научава да произвежда както условни, така и безусловни прогнози с една мрежа. По време на вземане на проби стартирате модела два пъти на стъпка, веднъж с подканата и веднъж без, след което екстраполирате от безусловната прогноза към условната. Размерът на екстраполацията е ориентировъчната скала: по-високите стойности налагат по-плътно бързо прилепване и по-силно насищане, докато по-ниските стойности дават повече разнообразие, но по-слабо съвпадение.

Техническа информация

Математически прогнозирането на управлявания шум е безусловното прогнозиране плюс скалата на насочване, умножена по разликата между условните и безусловните прогнози. Скала от 1 означава липса на насоки; типичните стойности са от 5 до 9. Натискането на скалата много високо усилва бързите характеристики, но причинява пренаситени цветове, рязък контраст и артефакти, тъй като моделът екстраполира далеч извън своето научено разпределение. Това струва приблизително две минавания напред на стъпка за обезшумяване.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на ръководството без класификатор

Изследователите усъвършенстват насоките, за да поддържат бързо придържане без пренасищане, чрез динамични прагове, графици за насоки, които променят силата на стъпките, и трикове за пренасочване. Дестилираните модели вече пекат насоки в едно преминаване, за да намалят наполовина изчисленията, а по-новите формулировки изследват смутено внимание и автоматично насочване, които изобщо не се нуждаят от безусловно разклоняване, като целят резки, верни изображения на по-ниска цена.

Внедряване в реалния свят

Регулиране на плъзгача „CFG scale“ в Stable Diffusion или Midjourney за балансиране на бързата точност срещу креативността

Повишаване на насоки, за да принудите генератор да включи специфичен, труден за изобразяване обект, описан в подканата

Намаляване на насоките, за да получите по-разнообразни, по-малко пренаситени резултати, когато изследвате много опции за дизайн

Настройване на графиците за насоки в производствените линии за намаляване на артефактите от изгаряне на цветовете при визуализации с висока детайлност

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Classifier-Free Guidance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Наивни байесови класификатори

Frequently asked questions

What is Classifier-Free Guidance?

Насоките без класификатор са техниката, която кара дифузионните модели действително да следват вашата подкана, разменяйки известно разнообразие за много по-силно придържане. Това е единственият циферблат зад плъзгача на „скалата за насочване“ в почти всеки генератор на изображения.

Каква е основната цел на насоките без класификатор?

Насоките без класификатори повишават бързото придържане чрез екстраполиране от безусловното към условното предвиждане.

Как един модел се научава да прави безусловни прогнози за насоки без класификатор?

По време на обучението подканата се изпуска на случаен принцип през част от времето, така че една мрежа научава както условно, така и безусловно поведение.

Какво обикновено прави увеличаването на скалата за ориентиране?

По-високото насочване налага по-плътно прилепване и по-силни характеристики, но натискането му твърде далеч води до пренаситени, груби изображения, склонни към артефакти.

Приблизително колко минавания напред на стъпка за обезшумяване изисква стандартното насочване без класификатор?

Моделът се изпълнява веднъж с подканата и веднъж без, след което прогнозите се комбинират, струвайки около две преминавания на стъпка.

Какво предимство има ръководството без класификатор пред ръководството чрез класификатор?

Чрез използването на една мрежа и за двете прогнози, той избягва крехкия, допълнителен класификатор, който се изисква от по-старите ръководени дифузии.