Figyelemfelhívások közötti szerkesztés
A Prompt-to-Prompt úgy szerkeszti a generált képet, hogy módosítja a szöveges promptját, miközben újrafelhasználja a modell belső figyelemtérképeit, így egy szó megváltoztatása felcseréli ezt az elemet, miközben a jelenet többi része érintetlen marad.
Áttekintés
It is editing through words, not pixels.
Mély merülés
A Prompt-to-Prompt (Hertz et al., 2022) egy képzés nélküli technika a szövegvezérelt szerkesztéshez diffúziós modellekben. A legfontosabb felismerés az, hogy a keresztfigyelem térképek, amelyek megmondják a modellnek, hogy az egyes szavak mely képterületeket befolyásolják, kódolják a jelenet térbeli elrendezését. Ha egy képet enyhén módosított prompttal generál újra, a metódus beilleszti az eredeti prompt figyelemtérképeit az új futtatásba. Ha egy szót, mondjuk a „bicikli” szót „motorkerékpár”-ra cseréli, felcseréli az objektumot, miközben megőrzi a kompozíciót és a hátteret. Egy szó hozzáadása csak a változatlan tokenekre irányítja a figyelmet, így egy új attribútum jelenik meg anélkül, hogy mindent átrendezne. You can also reweight a token's attention to strengthen or weaken its effect. Mivel nem igényel finomhangolást vagy maszkokat, sok későbbi szerkesztési módszer alapja lett, beleértve az InstructPix2Pix adatgenerálását is.
Technikai betekintés
A zajtalanítás során a keresztfigyelem minden tokenhez kiszámol egy térbeli térképet arról, hogy hol található a képen. A Prompt-to-Prompt ezeket a térképeket az eredeti generációból átmásolja a megosztott tokenek szerkesztett térképébe. Szócsere esetén leképezi a figyelmet a megfelelő tokenek között; a hozzáadott szavak esetében megőrzi a régi térképeket, és csak az új jelzőket engedi új figyelem felkeltésére; Az újrasúlyozás egyszerűen skálázza a token figyelmi értékeit, fokozza vagy elnémítja a vizuális hatását.
Stratégiai hatás
Sebesség és méretarány
A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.
Építési lehetőségek
A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.
Csapat és munkafolyamat
A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.
A prompt-to-prompt kereszt-figyelem szerkesztés jövője
A keresztfigyelem-manipuláció immár a vezérelhető generálási eszközök egész családjának alapját képezi, és az ötletek kiterjednek az újabb architektúrák figyelemszabályozására és a video diffúzióra is, az időbeli konzisztens szerkesztések érdekében. Várható szorosabb integráció a valós képszerkesztéssel az inverzióval, a nagy szerkezeti változások robusztusabb kezelése, valamint az utasításmodellekkel való kombináció, hogy a figyelem trükkjei láthatatlanul futjanak egy egyszerű természetes nyelvű felület alatt.
Valós megvalósítás
A tervező a „piros autót az utcán” „kék autót az utcán”-ra cseréli, és megtartja ugyanazt a jelenet-elrendezést.
Egy illusztrátor átsúlyozza a „havas” szót, hogy a tájat fokozatosan téliesebbé tegye a változatok között.
A mesemondó az „oroszlánt” „tigrisre” cseréli egy felszólításban, hogy azonos pózt és hátteret tartson a karakterlapnak.
Egy kutató páros előtte/utána képeket generál edzési adatokként egy utasítást követő szerkesztő számára.
Kockázatok és védőkorlátok
A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.
A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.
A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.
Végrehajtási ütemterv
Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.
Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.
Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.
A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Prompt-to-Prompt Cross-Attention Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Keresztfigyelem
Gyakran ismételt kérdések
What is Prompt-to-Prompt Cross-Attention Editing?
A Prompt-to-Prompt úgy szerkeszti a generált képet, hogy módosítja a szöveges promptját, miközben újrafelhasználja a modell belső figyelemtérképeit, így egy szó megváltoztatása felcseréli ezt az elemet, miközben a jelenet többi része érintetlen marad. A szerkesztés szavakkal történik, nem pixelekkel.
Milyen belső információkat használ fel újra a Prompt-to-Prompt a jelenet megőrzéséhez?
A keresztfigyelem térképek azt kódolják, hogy az egyes szavak hol befolyásolják a képet, így újrafelhasználva az elrendezés egységes marad a szerkesztések során.
A Prompt-to-Prompt funkció megköveteli a modell finomhangolását?
A következtetés idején manipulálja a figyelmet, és nincs szüksége további képzésre.
Mit ér el egy token figyelmének újrasúlyozása?
A token figyelmi értékeinek skálázása felerősíti vagy elnémítja a fogalom megjelenésének erősségét.
Miért tekintik a Prompt-to-Prompt alapvető technikának?
A képzés nélküli figyelemmanipuláció a következő szerkesztési kutatás során újra felhasznált építőelem lett.