Alapok ÚTMUTATÓ

Diffúziós modellek

A diffúziós modellek úgy állítanak elő képeket, hogy megtanulják megfordítani a zajos folyamatot, és lépésről lépésre a véletlenszerű statikus elemeket részletes képekké alakítják.

2 perc olvasásUtoljára frissítve

Áttekintés

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Mély merülés

A diffúziós modellt két irányban tanítják. A továbbítási folyamat során a tiszta kép fokozatosan megsérül kis mennyiségű véletlenszerű zaj hozzáadásával, amíg tiszta statikussá nem válik. A modell ezután megtanulja a fordítottját: a zajból kiindulva minden lépésnél megjósolja és eltávolítja a kis zajt, több tucat vagy százszor ismételve, amíg éles kép nem jön létre. Annak érdekében, hogy ez ellenőrizhető legyen, egy szöveges felszólítás irányít minden zajtalanítási lépést, így a „lovon ülő űrhajós” az adott kép felé tereli a statikát. A modern rendszerek, mint például a Stable Diffusion, ezt a folyamatot tömörített látens térben futtatják, nem pedig nyers képpontokon, így sokkal gyorsabban. A GAN-okhoz képest a diffúziós modellek stabilabban edzenek és nagyobb diverzitást produkálnak, ezért 2022 körül megelőzték a GAN-t, mint a domináns megközelítést a jó minőségű képalkotás terén.

Technikai betekintés

A legfontosabb trükk az, hogy a hálózatnak soha nem kell képet generálnia egy felvétel alatt; csak az adott lépésben hozzáadott zajt tanulja meg előre megjósolni. A képzés során ismert mennyiségű zajt adnak a valós képhez, és a modellt felkérik, hogy becsülje meg ezt a zajt; a különbség a képzési hiba. A generálás idején a modell ismételten levonja az előre jelzett zajt, fokozatosan felfedve a struktúrát. A szövegkondicionálás a keresztfigyelem révén történik, és az osztályozó nélküli útmutatás felerősíti, hogy a felszólítás milyen erősen irányítja a kimenetet.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

A diffúziós modellek jövője

A diffúzió a kép- és egyre inkább a video- és hanggenerálás technikájának jelenlegi csúcsa, olyan eszközökkel, mint a Sora, amely kiterjeszti a mozgásra is. A nagy lökést a sebesség jelenti: az olyan technikák, mint a desztilláció és a konzisztencia-modellek, több száz zajcsökkentő lépést kívánnak lecsökkenteni egy maroknyira vagy akár egyre, lehetővé téve a valós idejű generálást. Várható, hogy a diffúzió kiterjed a 3D-s eszközökre, a tudományos tervezésre, például a molekulákra és a fehérjékre, valamint a szigorúan szabályozható szerkesztésre, miközben elég olcsóvá válik a telefonokon való futtatáshoz.

Valós megvalósítás

Eredeti grafikák és képek létrehozása szöveges promptokból a Stable Diffusion, DALL-E és Midjourney

Fénykép részeinek zökkenőmentes be- és kifestése, kitöltése vagy kiterjesztése

Videó létrehozása szövegből olyan eszközökben, mint a OpenAI Sora

Új molekulák és fehérjeszerkezetek tervezése gyógyszerkutatási kutatásokhoz

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, ahol a diffúziós modellek segítenek, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Diffusion Models?

A diffúziós modellek úgy állítanak elő képeket, hogy megtanulják megfordítani a zajos folyamatot, és lépésről lépésre a véletlenszerű statikus elemeket részletes képekké alakítják. Ezek táplálják napjaink vezető szöveg-képké alakító eszközeit, mint például a Stable Diffusion, a DALL-E és a Midjourney.

Mi a lényege annak, hogy a diffúziós modell hogyan hoz létre képet?

A diffúziós modell megtanulja megfordítani a zajos folyamatot, kezdve a tiszta zajtól és a zajtalanítástól lépésről lépésre, amíg tiszta kép nem jelenik meg.

A képzés során valójában mit tanul meg a modell minden lépésnél megjósolni?

A modell zajos képet kap, és megtanulja megbecsülni a hozzáadott zajt, így később a generálás során ki tudja vonni a zajt.

Hogyan befolyásolja a szöveges prompt a generált képet?

A szövegkondicionálás (keresztfigyelem és útmutatás révén) minden zajtalanító lépést eltol, hogy a megjelenő kép illeszkedjen a felszólításhoz.

Miért futtatja a Stable Diffusion a folyamatot „látens térben”?

A teljes felbontású pixelek helyett tömörített látens térben való működés drámaian csökkenti a számítási időt, miközben megőrzi a minőséget.

Mi a diffúziós modellek egyik legfontosabb előnye a GAN-okkal szemben?

A diffúziós modellek elkerülik a GAN-ok instabil, ellenséges játékának és módozatának összeomlását, megbízhatóbb képzést és nagyobb kimeneti változatosságot eredményezve.