Vizuális MI ÚTMUTATÓ

Látens diffúziós modellek

A látens diffúziós modellek úgy állítanak elő képeket, hogy a diffúziós folyamatot tömörített látens térben futtatják nyers pixelek helyett, csökkentve ezzel a számítási költségeket.

2 perc olvasásUtoljára frissítve

Áttekintés

Ők a Stable Diffusion és a legtöbb modern nyílt forráskódú képgenerátor motorja.

Mély merülés

A szabványos diffúziós modell megtanulja megfordítani a zajos folyamatot: a tiszta zajból indul ki, és fokozatosan zajtalanul képpé. Ezt közvetlenül a képpontokon megtenni drága, mert egy 512x512-es képnek több százezer értéke van. A Rombach és munkatársai által 2022-ben bevezetett látens diffúzió először egy előképzett variációs autoencodert (VAE) használ, hogy egy képet egy kis látens rácsba tömörítsen (gyakran 64x64x4, nagyjából 48x kisebb). A diffúziós U-Net ezután megtanulja zajtalanítani a kompakt rejtett térben, a keresztfigyelem által irányított szöveg. Végül a VAE dekóder rekonstruálja a teljes felbontású pixeleket. Ez az észlelési tömörítés megőrzi a szemantikailag értelmes információkat, miközben elveti az észrevehetetlen részleteket, így a fogyasztói GPU-kon kiváló minőségű generálást tesz lehetővé.

Technikai betekintés

A legfontosabb trükk az, hogy elválasztjuk az észlelési tömörítést a generatív modellezéstől. A VAE egyszer kezeli a nagyfrekvenciás pixelrészleteket, az U-Net pedig csak az alacsonyabb dimenziós látens eloszlást modellezi. A szövegkondicionálás a keresztfigyelem rétegeken keresztül történik, ahol az U-Net térbeli jellemzői egy szövegkódolóból, például a CLIP-ből származó token beágyazásokhoz kapcsolódnak. Mivel a látensek nagyjából 48-szor kisebbek, mint a pixelek, minden zajtalanítási lépés drámaian olcsóbb mind a memóriában, mind a FLOP-okban.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A látens diffúziós modellek jövője

A látens diffúzió a képeken túl a videókon (Stable Video Diffusion), a 3D-s eszközökre és a hangspektrogramokra terjeszkedik, mindez ugyanazt a tömörítés, majd a zajtalanítás receptjét használja. A kutatások a desztillációs és konzisztenciamodellek, a finom szöveget és az arcokat megőrző jobb VAE-k, valamint a Stable Diffusion 3-hoz hasonló, rektifikált áramlású formulák, amelyek kiegyenlítik a generálási pályát a gyorsabb, élesebb eredmények érdekében, egyre kevesebb mintavételi lépés felé törekszenek.

Valós megvalósítás

Stabil diffúzió, amely szöveges promptokból grafikákat és koncepcióterveket generál egyetlen fogyasztói GPU-n

Az Adobe és a Canva látens diffúziós gerincre épülő szöveget képpé és generatív kitöltési funkciókat biztosít

Textúratérképeket, sprite-okat és környezetkoncepciót készítő játékstúdiók az előgyártás felgyorsítása érdekében

Stock-image- és marketingcsapatok, amelyek fotózás nélkül készítenek márkatermék-maketteket és hirdetési látványelemeket

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Videó diffúziós modellek

Gyakran ismételt kérdések

Mi az a Latens Diffúziós Modellek?

A látens diffúziós modellek úgy állítanak elő képeket, hogy a diffúziós folyamatot tömörített látens térben futtatják nyers pixelek helyett, csökkentve ezzel a számítási költségeket. Ők a motor a Stable Diffusion és a legtöbb modern nyílt forráskódú képgenerátor mögött.

Mi a látens diffúziós modellek fő innovációja a pixel-tér diffúzióhoz képest?

A látens diffúzió egy VAE segítségével egy kisebb látens térbe tömöríti a képeket, így a drága zajtalanítás sokkal kevesebb értéken történik, mint a teljes pixeleknél.

Melyik komponens tömöríti a képet a látens térbe, és utána rekonstruálja?

Egy előképzett VAE egy kompakt látens rácsba kódolja a képet, dekódere pedig a végén rekonstruálja a teljes felbontású pixeleket.

Hogyan kerül tipikusan szöveg a zajtalanító U-Netbe látens diffúzióban?

A szövegkódolóból származó token-beágyazások keresztfigyelési rétegekbe kerülnek, lehetővé téve, hogy a térbeli jellemzők kezeljék a felszólítást.

Miért csökkenti a számítási költségeket a látens térben való működés?

Várjon – a helyes ok az, hogy a látens rács sokkal kisebb (gyakran ~48x) a pixel képénél, így minden zajtalanítási lépéshez sokkal kevesebb FLOP-ra és memóriára van szüksége.

Melyik széles körben használt nyílt forráskódú modell népszerűsítette a látens diffúziót?

A 2022-ben megjelent Stable Diffusion látens elterjedést hozott a fogyasztói hardverek és a tömeges elterjedés terén.