Vizuális MI ÚTMUTATÓ

Stable Diffusion

A Stable Diffusion egy nyílt forráskódú szöveg-képmodell, amelyet a Stability AI 2022-ben adott ki, és a véletlenszerű kiindulási pontból származó zaj fokozatos eltávolításával képeket készít.

2 perc olvasásUtoljára frissítve

Áttekintés

Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.

Mély merülés

A diffúziós modellek megtanulják megfordítani a zajos folyamatokat. A képzés során a valós képekhez lépésről lépésre véletlenszerű zaj kerül hozzáadásra, amíg statikussá nem válnak; a modell megtanulja megjósolni és kivonni azt a zajt. A generáláshoz tiszta zajból indul ki, és ismételten zajtalanítja, amíg egy koherens kép meg nem jelenik a szöveges prompt alapján. A Stable Diffusion kulcsfontosságú hatékonysági trükkje a „látens” rész: ahelyett, hogy teljes felbontású pixeleken dolgozna, egy variációs autoencoder segítségével egy kisebb látens térbe tömöríti a képeket, ott lefuttatja a lassú zajtalanítást, majd visszakódolja képpontokká. Ez az oka annak, hogy egy tipikus játék GPU-n futhat adatközpont helyett. A szövegkódoló (a korai verziókban a CLIP) útmutatássá alakítja a promptot, az U-Net pedig a zajtalanítást végzi. Nyitott súlyai ​​lehetővé tették a ControlNet, a LoRA finomhangolást és számtalan kreatív eszközt.

Technikai betekintés

A Stabil diffúzió egy látens diffúziós modell. Az automatikus kódoló az 512x512-es képet kompakt látens rácsmá zsugorítja, drámaian csökkentve a számítási feladatokat. Az U-Net arra van kiképezve, hogy előre jelezze az egyes időlépésekben hozzáadott zajt, amely a keresztfigyelés révén beágyazott szövegtől függ. Az osztályozó nélküli útmutatás lehetővé teszi, hogy a feltételes és feltétel nélküli előrejelzések keverésével beállítsa, hogy a kép milyen erősen követi a felszólítást. Következtetéskor egy mintavevő (például DDIM vagy Euler) kiválasztott számú zajcsökkentési lépést hajt végre; több lépés általában tisztább eredményt jelent a sebesség árán.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A stabil diffúzió jövője

A nyitott ökoszisztéma folyamatosan felgyorsul: az újabb architektúrák (beleértve a transzformátor alapú diffúziót és a gyorsabb néhány lépéses vagy desztillált mintavevőket) több tucat lépésből egy-két lépésre csökkentik a generációt, lehetővé téve a közel valós idejű létrehozást. Erősebb szövegmegjelenítésre, jobb azonnali tapadásra és zökkenőmentes képszerkesztésre, valamint videó- ​​és 3D-bővítményekre számíthat. A nyitott súlyok tovább táplálják a speciális finomhangolásokat, de felerősítik a vitákat a betanítási adatok beleegyezésével, a mélyhamisítással és a vízjelekkel kapcsolatban, így az észlelési és származási eszközök a modellek mellett növekedni fognak.

Valós megvalósítás

Művészek és hobbibarátok, akik saját GPU-jukon, egyedi LoRA finomhangolásokkal készítenek koncepcióművészetet és illusztrációkat helyben

A ControlNet használata egy generáció korlátozására pózvázzal, mélységtérképpel vagy élvázlattal a pontos kompozíció érdekében

Befestés és kifestés fényképek szerkesztéséhez, tárgyak eltávolításához vagy a jelenet eredeti határain túlra való kiterjesztéséhez

Független játékstúdiók és tervezők, akik gyorsan és olcsón készítenek textúrákat, hangulattáblákat és eszközvariációkat

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Stable Diffusion?

A Stable Diffusion egy nyílt forráskódú szöveg-képmodell, amelyet a Stability AI 2022-ben adott ki, és a véletlenszerű kiindulási pontból származó zaj fokozatos eltávolításával képeket készít. Nyitott és fogyasztói GPU-kon futtatható, így eszközök, finomhangolások és alkalmazások hatalmas közösségét váltotta ki.

Magas szinten hogyan hoz létre képet egy diffúziós modell?

A diffúziós modellek megtanulják megfordítani a zajos folyamatot: a zajból kiindulva iteratív módon zajtalanítanak, amíg koherens kép nem keletkezik.

Mitől elég hatékony a Stable Diffusion ahhoz, hogy fogyasztói GPU-n is működjön?

A Stable Diffusion egy látens diffúziós modell: egy autoencoder tömöríti a képeket, így a nagy zajtalanítás kisebb látens térben fut.

Hogyan befolyásolja a szöveges prompt a generált képet?

A szövegkódoló a promptot olyan beágyazásokká alakítja, amelyek keresztfigyelem révén kondicionálják az U-Netet, irányítva az eredményt.

Mit szabályozhat az osztályozó nélküli útmutatás?

Az osztályozó nélküli útmutatás keveri a feltételes és a feltétel nélküli előrejelzéseket, lehetővé téve, hogy felfelé vagy lefelé fordítsa a gyors ragaszkodást.

Miért váltott ki a Stable Diffusion olyan nagy ökoszisztémát az eszközökből, mint a ControlNet és a LoRA?

A nyitott súlyok lehetővé teszik a közösség számára a modell finomhangolását és kiterjesztését, és olyan kiegészítőket állítanak elő, mint a ControlNet és a könnyű LoRA adapterek.