РЪКОВОДСТВО за визуален AI

Редактиране на кръстосано внимание от подкана към подкана

Prompt-to-Prompt редактира генерирано изображение, като променя текстовата му подкана, докато използва повторно вътрешните карти на вниманието на модела, така че промяната на една дума разменя този елемент, като същевременно запазва останалата част от сцената непокътната.

2 min readПоследна актуализация

Преглед

It is editing through words, not pixels.

Дълбоко гмуркане

Prompt-to-Prompt (Hertz et al., 2022) е техника без обучение за управлявано от текст редактиране в дифузионни модели. Ключовото прозрение е, че картите на кръстосаното внимание, които казват на модела кои региони на изображението трябва да повлияе всяка дума, кодират пространственото оформление на сцената. Когато регенерирате изображение с леко модифицирана подкана, методът инжектира картите на вниманието на оригиналната подкана в новото изпълнение. Замяната на дума, да речем „велосипед“ с „мотоциклет“, разменя този обект, като запазва композицията и фона. Добавянето на дума инжектира вниманието само за непроменените токени, така че се появява нов атрибут, без да се пренарежда всичко. Можете също така да претеглите вниманието на токена, за да засилите или отслабите неговия ефект. Тъй като не изисква фина настройка или маски, той се превърна в основен градивен елемент за много по-късни методи за редактиране, включително генерирането на данни от InstructPix2Pix.

Техническа информация

По време на премахването на шума кръстосаното внимание изчислява за всеки токен пространствена карта на това къде се намира в изображението. Prompt-to-Prompt копира тези карти от оригиналното поколение в редактираното за споделени токени. За размяна на думи картографира вниманието между съответните токени; за добавени думи запазва стари карти и позволява само на нови токени да формират ново внимание; повторното претегляне просто мащабира стойностите на вниманието на токена, като засилва или заглушава визуалното му влияние.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на редактирането с кръстосано внимание от подкана към подкана

Кръстосаното манипулиране на вниманието сега е в основата на цяло семейство от контролируеми инструменти за генериране и идеите се разширяват до контрол на вниманието в по-нови архитектури и видео разпространение за времеви последователни редакции. Очаквайте по-тясна интеграция с редактиране на реални изображения чрез инверсия, по-стабилно управление на големи структурни промени и комбинация с модели на инструкции, така че триковете за внимание да се изпълняват невидимо под прост интерфейс на естествен език.

Внедряване в реалния свят

Дизайнер променя „червена кола на улица“ на „синя кола на улица“ и запазва абсолютно същото оформление на сцената.

Илюстратор претегля думата „снежен“, за да направи пейзажа постепенно по-зимен в различни варианти.

Разказвачът сменя „лъв“ с „тигър“ в подкана, за да запази идентична поза и фон за лист с герои.

Изследовател го използва, за да генерира сдвоени изображения преди/след като данни за обучение за редактор, следващ инструкциите.

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt-to-Prompt Cross-Attention Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Кръстосано внимание

Frequently asked questions

What is Prompt-to-Prompt Cross-Attention Editing?

Prompt-to-Prompt редактира генерирано изображение, като променя текстовата му подкана, докато използва повторно вътрешните карти на вниманието на модела, така че промяната на една дума разменя този елемент, като същевременно запазва останалата част от сцената непокътната. Това е редактиране чрез думи, а не чрез пиксели.

Каква вътрешна информация използва повторно Prompt-to-Prompt, за да запази сцена?

Картите за кръстосано внимание кодират къде всяка дума влияе върху изображението, така че повторното им използване поддържа оформлението последователно по време на редакциите.

Изисква ли Prompt-to-Prompt фина настройка на модела?

Той манипулира вниманието по време на извод и не се нуждае от допълнително обучение.

Какво постига повторното претегляне на вниманието на токена?

Мащабирането на стойностите на вниманието на токена засилва или заглушава колко силно се появява тази концепция.

Защо Prompt-to-Prompt се счита за основна техника?

Неговото манипулиране на вниманието без обучение се превърна в градивен елемент, използван повторно в последвалите изследвания за редактиране.