GLIGEN Grounded Generation
A GLIGEN (Grounded-Language-to-Image Generation) lehetővé teszi, hogy pontosan szabályozza, hogy az objektumok hol jelenjenek meg a generált képen azáltal, hogy a modell határoló dobozait és címkéit a szöveges prompt mellé adagolja.
Áttekintés
A homályos szöveget képpé alakítja precíz, elrendezéssel vezérelhető szintézissé.
Mély merülés
A szabványos szöveg-képmodellek küzdenek a térbeli szabályozással: „macska a kutyától balra” kérve gyakran rosszul helyezi el. A 2023-ban bemutatott GLIGEN ezt földelési bemenetek hozzáadásával oldja meg, például határolókereteket szöveges vagy képi entitásokkal, kulcspontokkal vagy referenciaképekkel párosítva. Lényeges, hogy lefagyasztja az eredeti előképzett diffúziós modell súlyait, és új, betanítható, zárt önfigyelő rétegeket fecskendez be, amelyek elnyelik a földelési tokeneket. Ez azt jelenti, hogy olyan modellre épít, mint a Stable Diffusion, anélkül, hogy megsemmisítené a tanult tudását, és a kapuzás a nulla közelében kezdődik, így az alapmodell viselkedése a képzés korai szakaszában megmarad. Az eredmény egy nyílt világú földelt generálás: tetszőleges leírt objektumokat helyezhet el meghatározott helyekre, és általánosít olyan koncepciókra és elrendezésekre, amelyeket a földelési képzés során nem látott.
Technikai betekintés
A GLIGEN minden egyes földelő entitást tokenként ábrázol, amely egyesíti a szöveg vagy kép beágyazását a térinformációival, például a Fourier-jellemzőkkel kódolt határolódoboz négy koordinátájával. Ezek a földelő tokenek a megfagyott diffúziós U-Netbe az újonnan behelyezett, kapuzott önfigyelő rétegeken keresztül jutnak be a meglévő önfigyelő és keresztfigyelő blokkok közé. A nullára inicializált, tanulható kapu szabályozza, hogy a földelés mennyire befolyásolja a generálást, így a vezérlés hozzáadása kecsesen lecsökken, és az edzés stabil marad.
Stratégiai hatás
Sebesség és méretarány
A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.
Építési lehetőségek
A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.
Csapat és munkafolyamat
A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.
A GLIGEN Grounded Generation jövője
A földelt és elrendezéssel vezérelhető generálás a gyártóeszközök szabványossá válik. A GLIGEN-stílusú térkondicionálástól elvárható, hogy egyesüljön más vezérlési módszerekkel, például a ControlNettel és a regionális felszólítással, és kiterjedjen a videóra és a 3D-re, ahol az objektumok időben és térben való elhelyezése még fontosabb. Amint a modellek utasításkövető interfészt alkalmaznak, a fogd és vidd elrendezés vezérlése és a nyelv által meghatározott jelenetgrafikonok precíz kompozíciót tesznek elérhetővé azonnali tervezési trükkök nélkül.
Valós megvalósítás
Embléma vagy termék elhelyezése a generált hirdetés pontos régiójában határolókeret segítségével
Összetett jelenetek komponálása az egyes karakterek vagy objektumok helyének meghatározásával a renderelés előtt
Tanítási adatok generálása objektumészleléshez ismert alap-igazság doboz helyekkel
Leírt objektum befestése egy meglévő fénykép felhasználó által rajzolt területére
Kockázatok és védőkorlátok
A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.
A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.
A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.
Végrehajtási ütemterv
Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.
Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.
Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.
A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GLIGEN Grounded Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Szöveg-3D generálás
Gyakran ismételt kérdések
Mi az a GLIGEN Grounded Generation?
A GLIGEN (Grounded-Language-to-Image Generation) lehetővé teszi, hogy pontosan szabályozza, hogy az objektumok hol jelenjenek meg a generált képen azáltal, hogy a modell határoló dobozait és címkéit a szöveges prompt mellé adagolja. A homályos szöveget képpé alakítja precíz, elrendezéssel vezérelhető szintézissé.
Milyen problémát old meg elsősorban a GLIGEN?
A GLIGEN földelési bemeneteket, például határolódobozokat ad hozzá, így Ön pontosan szabályozhatja, hogy az objektumok hol helyezkedjenek el, és az egyszerű szöveges felszólításokat rosszul kezelik.
Hogyan őrzi meg a GLIGEN az előképzett diffúziós modell ismereteit?
A GLIGEN lefagyasztja az alapmodellt, és új, zárt önfigyelő rétegeket fecskendez be, így az eredeti tanult tudás érintetlen marad.
Milyen tipikus földelési bemenetet fogad el a GLIGEN?
A GLIGEN támogatja a földelést szöveg/kép entitásokkal, kulcspontokkal és referenciaképekkel határoló dobozokon keresztül.
Miért van a GLIGEN új figyelemrétegeiben a kapu nullára inicializálva?
A nulla inicializált kapu azt jelenti, hogy a földelésnek kezdetben nincs hatása, megőrzi az eredeti modellt, és stabilan tartja az edzést, ahogy a vezérlés felfelé halad.
Mit jelent a GLIGEN-ben a „nyílt világ” földelt generáció?
A GLIGEN a földelési oktatókészletén túl általánosít, és az újszerű objektumokat meghatározott helyekre helyezi el.