Vizuális MI ÚTMUTATÓ

StyleGAN architektúra

A StyleGAN egy generatív ellenséges hálózat az NVIDIA-tól, amely feltűnően valósághű arcokat és tárgyakat állít elő úgy, hogy stílusinformációkat szúr be minden rétegbe.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because its design gives unprecedented, disentangled control over coarse and fine image attributes.

Mély merülés

Karras és munkatársai által bevezetett StyleGAN. 2018-ban újratervezte a GAN generátort a „stílus” gondolata köré. Ahelyett, hogy egy véletlen vektort közvetlenül a hálózatba táplálna, először leképezi a z látens kódot egy 8 rétegű MLP-n keresztül egy W közbenső térbe, amely szétválasztja a variációs tényezőket. A betanult konstans tenzort ezután fokozatosan felmintavételezi, és minden felbontásnál a stílusvektor modulálja a jellemzőtérképeket az Adaptive Instance Normalization (AdaIN) segítségével, vezérelve az attribútumokat a póztól (durva rétegek) a bőrtextúráig (finom rétegek). A rétegenkénti zajbemenetek sztochasztikus részleteket, például szeplőket és kósza szőrszálakat adnak hozzá. A StyleGAN2 (2020) az AdaIN-t súlydemodulációra cserélte, hogy eltávolítsa a „blob” műtermékeket, a StyleGAN3 (2021) pedig rögzített textúraragasztó álnevet, hogy a funkciók természetes módon mozogjanak az animáció során.

Technikai betekintés

A kulcsmechanizmus a stílusalapú moduláció. A leképezési hálózat z-t w-vé alakítja, a tanult affin transzformációk pedig csatornánkénti léptékűvé alakítják a w-t, és minden felbontásnál a normalizált jellemzőtérképekre alkalmazott torzítást. Mivel a stílusok rétegről rétegre hatnak, az egyik kép w-jét durva rétegeknél keverheti egy másik képpel finom rétegeknél ("stíluskeverés"), hogy a textúra megtartása mellett felcserélje a pózt. A StyleGAN2 demodulációja ezeket a statisztikákat konvolúciós súlyokká hajtja össze, kiküszöbölve a normalizálási műtermékeket.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A StyleGAN építészet jövője

Bár a diffúziós modellek ma már általános szöveg-képgenerálást vezetnek, a StyleGAN rendkívül strukturált, szerkeszthető látens tere (W és W+) központi szerepet játszik az arcok szerkesztésében, az attribútumkezelésben és a valós idejű szintézisben, ahol a GAN-ok gyorsabbak maradnak. Folyamatos munka várható a GAN-inverzión (valódi fényképek W-be vetítése), a 3D-tudatos változatokon, például az EG3D-n, amelyek konzisztens nézeteket jelenítenek meg, és a hibrideken, amelyek a StyleGAN szabályozható látenseit diffúziós vagy transzformátor-priorokkal párosítják mindkét világ legjobbja érdekében.

Valós megvalósítás

Végtelen fotorealisztikus, nem létező emberi arcok generálása, amint azt a thispersondoesnotexist.com bemutatja.

Szemantikus arcszerkesztés: zökkenőmentesen változtatja az életkort, az arckifejezést vagy a pózt a W térben lévő irányok mentén.

Szintetikus edzési adatok és avatarok létrehozása, amikor kevés a valódi, a magánélet védelmét biztosító kép.

Művészi eszközök, amelyek interpolálják vagy „stíluskeverik” a képeket, hogy a durva szerkezetet és a finom részleteket vegyítsék.

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the StyleGAN Architecture quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is StyleGAN Architecture?

A StyleGAN egy generatív ellenséges hálózat az NVIDIA-tól, amely feltűnően valósághű arcokat és tárgyakat állít elő úgy, hogy stílusinformációkat szúr be minden rétegbe. Ez azért fontos, mert kialakítása soha nem látott, szétválasztott irányítást biztosít a durva és finom képattribútumok felett.

Mi a StyleGAN térképezési hálózatának célja?

A 8 rétegű MLP leképezi a z-t W-re, egy közbenső látens teret, ahol a variációs tényezők jobban elkülönülnek, lehetővé téve a tisztább vezérlést.

Az eredeti StyleGAN-ban hogyan kerül a stílus a jellemzőtérképekbe?

Az AdaIN normalizálja a jellemzőtérképeket, majd méretre és eltolásra helyezi azokat stílusból származó statisztikák segítségével minden felbontásnál.

Miből indul ki a szintézis hálózat a látens vektor helyett?

A StyleGAN egy tanult állandó bemenetből indul ki, és stílust és zajt injektál be a mintavételezés során, ahelyett, hogy közvetlenül betáplálná a z-t.

Mit szabályoz elsősorban a durva (kis felbontású) rétegek stílusának beállítása?

A durva rétegek szabályozzák a nagyméretű szerkezeteket, például a pózt és az általános formát, míg a finom rétegek a textúrát és a mikrorészleteket.

Milyen hibát javított ki a StyleGAN2 az eredetihez képest?

A StyleGAN2 felváltotta az AdaIN-t súlydemodulációval, eltávolítva a cseppek/blob műtermékeket és javítva a képminőséget.