Vizuální průvodce AI

Výzva k výzvě Cross-Attention editace

Prompt-to-Prompt upravuje vygenerovaný obrázek vyladěním jeho textové výzvy při opětovném použití interních map pozornosti modelu, takže změnou jednoho slova se tento prvek zamění, zatímco zbytek scény zůstane nedotčený.

2 minuty čteníNaposledy aktualizováno

Přehled

It is editing through words, not pixels.

Hluboký ponor

Prompt-to-Prompt (Hertz et al., 2022) je technika bez školení pro textově řízenou editaci v difúzních modelech. Klíčovým poznatkem je, že mapy křížové pozornosti, které modelu říkají, které oblasti obrazu by každé slovo mělo ovlivnit, kódují prostorové uspořádání scény. Když znovu vytvoříte obrázek s mírně upravenou výzvou, metoda vloží mapy pozornosti původní výzvy do nového běhu. Nahrazení slova, řekněme „kolo“ slovem „motocykl“, zamění tento objekt a zachová kompozici a pozadí. Přidání slova vyvolá pozornost pouze u nezměněných tokenů, takže se objeví nový atribut, aniž by se vše přehodilo. Můžete také převážit pozornost tokenu a posílit nebo zeslabit jeho účinek. Protože nevyžaduje žádné jemné ladění ani masky, stal se základním stavebním kamenem pro mnoho pozdějších metod úprav, včetně generování dat InstructPix2Pix.

Technický přehled

Během odšumování vypočítá křížová pozornost pro každý token prostorovou mapu místa, kde se na snímku vyskytuje. Prompt-to-Prompt zkopíruje tyto mapy z původní generace do upravené mapy pro sdílené tokeny. Pro záměny slov mapuje pozornost mezi odpovídajícími tokeny; pro přidaná slova zachovává staré mapy a nechává pouze nové tokeny, aby vytvořily novou pozornost; převážení jednoduše upraví hodnoty pozornosti tokenu, zesílí nebo ztlumí jeho vizuální vliv.

Strategický dopad

Rychlost a měřítko

Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.

Volby sestavy

Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.

Tým a pracovní postup

Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.

Budoucnost prompt-to-prompt cross-Attention editace

Manipulace s křížovou pozorností nyní podporuje celou rodinu ovladatelných generovacích nástrojů a myšlenky se rozšiřují na ovládání pozornosti v novějších architekturách a šíření videa pro časově konzistentní úpravy. Očekávejte těsnější integraci s editací reálného obrazu prostřednictvím inverze, robustnější zpracování velkých strukturálních změn a kombinaci s instrukčními modely, takže triky s pozorností běží neviditelně pod jednoduchým rozhraním v přirozeném jazyce.

Real-World Implementace

Designér změní „červené auto na ulici“ na „modré auto na ulici“ a zachová přesně stejné rozložení scény.

Ilustrátor převáží slovo 'zasněžený', aby krajina v různých variantách byla postupně více zimní.

Vypravěč vymění 'lva' za 'tygra' ve výzvě, aby zachoval identickou pózu a pozadí pro list postavy.

Výzkumník jej používá ke generování spárovaných obrázků před/po jako tréninkových dat pro editor podle pokynů.

Rizika a zábradlí

Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.

Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.

Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.

Plán implementace

1

Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.

2

Testujte s daty, která odpovídají reálným výrobním podmínkám.

3

Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.

4

Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt-to-Prompt Cross-Attention Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

What is Prompt-to-Prompt Cross-Attention Editing?

Prompt-to-Prompt upravuje vygenerovaný obrázek vyladěním jeho textové výzvy při opětovném použití interních map pozornosti modelu, takže změnou jednoho slova se tento prvek zamění, zatímco zbytek scény zůstane nedotčený. Jedná se o úpravy pomocí slov, nikoli pixelů.

Jaké interní informace znovu používá Prompt-to-Prompt k zachování scény?

Mapy křížové pozornosti zakódují, kde každé slovo ovlivňuje obrázek, takže jejich opakované použití udržuje rozložení během úprav konzistentní.

Vyžaduje Prompt-to-Prompt jemné doladění modelu?

Manipuluje s pozorností v době odvození a nepotřebuje žádné další školení.

Čeho dosáhne převážení pozornosti tokenu?

Škálování hodnot pozornosti tokenu zesílí nebo ztlumí, jak silně se tento koncept jeví.

Proč je Prompt-to-Prompt považován za základní techniku?

Jeho manipulace s pozorností bez tréninku se stala stavebním kamenem, který byl znovu použit ve výzkumu úprav, který následoval.