Vizuális MI ÚTMUTATÓ

ESRGAN és GAN Super-Resolution

Az ESRGAN generátor versus diszkriminátor versenyt használ, hogy valósághű részleteket találjon ki a képek felskálázása során, túlmutatva az elmosódott interpoláción.

2 perc olvasásUtoljára frissítve

Áttekintés

Azért számít, mert megalapozta a fotorealisztikus szuperfelbontást, amely ma is befolyásolja az eszközöket.

Mély merülés

A 2018-ban bevezetett ESRGAN (Enhanced Super-Resolution Generative Adversarial Network) továbbfejlesztette a korábbi SRGAN-t. Residual-in-Residual Dense Blocks (RRDB)-ből épített generátort használ, amely sok sűrű kapcsolatot rak össze kötegelt normalizálás nélkül, ami a szerzők szerint műtermékeket okozott. Egy különálló megkülönböztető hálózat igyekszik megkülönböztetni a valódi, nagy felbontású fényképeket a generálttól, és arra készteti a generátort, hogy olyan meggyőző textúrákat hallucináljon, mint a haj, tégla és lombozat. Az ESRGAN három veszteséget ötvöz: pixelenkénti tartalomvesztést, a VGG funkciótérképeken az aktiválás előtt mért észlelési veszteséget és a kontradiktórius veszteséget. Bevezetett egy „relativisztikus” megkülönböztetőt is, amely megítéli, hogy a valódi képek valósághűbbnek tűnnek-e, mint a hamisak, élesítve a képzést. Az ESRGAN nyerte a 2018-as PIRM észlelési szuperfelbontású kihívást.

Technikai betekintés

A kulcsötlet a pixelpontossággal való kereskedés az észlelési realizmussal. A pixelveszteség, például az MSE, átlagosan a valószínű textúrákon áthaladva sima, elmosódott kimenetet eredményez. Az ellenséges veszteség ehelyett a valósnak tűnő képek sokaságára kényszeríti a kimenetet, így a generátor egyetlen éles, elfogadható textúra mellett kötelezi el magát. Az ESRGAN relativisztikus átlagos diszkriminátora megbecsüli, hogy egy valódi javítás mennyivel valósághűbb, mint egy hamis, amely több gradiens információt továbbít, és élesebb éleket produkál, mint egy szabványos megkülönböztető.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

Az ESRGAN és a GAN Super-Resolution jövője

A tiszta GAN szuperfelbontást egyre gyakrabban keverik vagy váltják fel transzformátorgerincekkel és diffúzió alapú felskálázókkal, amelyek stabilabb képzést és finomabb vezérlést kínálnak. Ennek ellenére az ESRGAN RRDB generátora és a perceptual-plus-adversarius receptje továbbra is erős, könnyű alapvonal, számtalan játéktextúra modba és fotóeszközbe ágyazva. Olyan hibrid modellekre számíthat, amelyek megőrzik a GAN élességét, miközben kölcsönzik a diffúzió diverzitását és a transzformátorok nagy hatótávolságú környezetét, valamint a szigorúbb eszközön történő telepítést a valós idejű felskálázás érdekében.

Valós megvalósítás

Alacsony felbontású textúrák felskálázása videojáték-modellekben (népszerű az „AI Upscale” modding közösségben a régebbi PC-k esetében)

A régi családi fényképek vagy beszkennelt képek feljavítása nagyobb méretben történő nyomtatás előtt

Az alacsony felbontású archív vagy megfigyelési felvételekből kinyert állóképek javítása

Nagy felbontású textúratérképek létrehozása kis referenciaképekből dolgozó 3D-s művészek számára

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ESRGAN and GAN Super-Resolution quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

Mi az ESRGAN és a GAN szuperfelbontás?

Az ESRGAN generátor versus diszkriminátor versenyt használ, hogy valósághű részleteket találjon ki a képek felskálázása során, túlmutatva az elmosódott interpoláción. Ez azért fontos, mert ez adta a sablont a fotórealisztikus szuperfelbontáshoz, amely ma is befolyásolja az eszközöket.

Mire utal a „GAN” az ESRGAN-ban?

A GAN a Generative Adversarial Network rövidítése, egy olyan beállítás, ahol a generátor és a diszkriminátor versenyez az edzés során.

Melyik építőelemet használja elsősorban az ESRGAN generátor?

Az ESRGAN generátora a Residual-in-Residual Dense Blocks (RRDB) sűrűn összekapcsolt maradék egységeket tartalmazza magstruktúrájaként.

Miért távolították el az ESRGAN szerzői a kötegelt normalizálást a generátorból?

A szerzők azt találták, hogy a kötegelt normalizálás kellemetlen műtermékeket produkált a szuperfelbontású kimenetben, ezért eltávolították az RRDB blokkokból.

Mi az ESRGAN fő kompromisszuma a csak pixelvesztéses módszerekhez képest?

Az ellenséges veszteség a kimenetet a valósághű textúrák felé tolja, még akkor is, ha az egyes pixelértékek eltérnek az alapigazságtól.

Hol mérik az ESRGAN észlelési (VGG) veszteségét?

Az ESRGAN kiszámítja az észlelési veszteséget a VGG jellemzőtérképeken az aktiválási funkció előtt, amely a szerzők szerint élesebb eredményeket adott.