Mwongozo wa AI unaoonekana

Miundo ya Usambazaji Fiche

Miundo iliyofichika ya uenezaji hutoa picha kwa kuendesha mchakato wa uenezaji katika nafasi fiche iliyobanwa badala ya saizi mbichi, kufyeka gharama za kukokotoa.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

They are the engine behind Stable Diffusion and most modern open-source image generators.

Dive ya kina

Muundo wa kawaida wa uenezaji hujifunza kubadilisha mchakato wa kelele: huanza kutoka kwa kelele safi na polepole hubadilika kuwa picha. Kufanya hivi moja kwa moja kwenye saizi ni ghali kwa sababu picha ya 512x512 ina mamia ya maelfu ya maadili. Usambazaji fiche, ulioanzishwa na Rombach na wenzake mwaka wa 2022, kwanza hutumia kiencoder tofauti kilichofunzwa awali (VAE) kubana picha katika gridi ndogo iliyofichika (mara nyingi 64x64x4, takriban 48x ndogo). Usambazaji wa U-Net kisha hujifunza kutoa sauti ndani ya nafasi hiyo iliyofichika, inayoongozwa na maandishi kupitia usikivu mtambuka. Hatimaye avkodare ya VAE huunda upya pikseli zenye msongo kamili. Mfinyazo huu wa kimawazo huweka maelezo yenye maana kisemantiki huku ukitupilia mbali maelezo yasiyoonekana, na kufanya uzalishaji wa ubora wa juu ufanyike kwenye GPU za watumiaji.

Ufahamu wa Kiufundi

Ujanja muhimu ni kutenganisha mgandamizo wa kiakili kutoka kwa uundaji generative. VAE hushughulikia maelezo ya pikseli ya masafa ya juu mara moja, na U-Net huonyesha tu usambaaji fiche wa hali ya chini. Urekebishaji wa maandishi hudungwa kupitia safu za uzingatiaji mtambuka, ambapo vipengele vya anga vya U-Net vinahusika na upachikaji wa tokeni kutoka kwa kisimbaji maandishi kama vile CLIP. Kwa sababu landa ni takriban mara 48 ndogo kuliko pikseli, kila hatua ya kutoa sauti ni nafuu sana katika kumbukumbu na FLOPs.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Miundo ya Usambazaji Fiche

Uenezaji uliofichika unapanuka zaidi ya picha hadi kwenye video (Uenezaji wa Video Imara), vipengee vya 3D, na vionjo vya sauti, vyote vikitumia kichocheo sawa cha compress-basi-denoise. Utafiti unasukuma kuelekea hatua chache za sampuli kupitia miundo ya kunereka na uthabiti, VAE bora zaidi ambazo huhifadhi maandishi na nyuso nzuri, na uundaji wa mtiririko uliorekebishwa kama ule ulio katika Usambazaji Imara wa 3 ambao hunyoosha mwelekeo wa kizazi kwa matokeo ya haraka na makali zaidi.

Utekelezaji wa Ulimwengu Halisi

Usambazaji Imara unaozalisha mchoro na miundo ya dhana kutoka kwa vidokezo vya maandishi kwenye GPU ya mtumiaji mmoja

Adobe na Canva kuwezesha maandishi-kwa-picha na vipengee vya kujaza-zalishi vilivyoundwa kwenye migongo iliyofichika ya usambaaji.

Studio za michezo zinazozalisha ramani za maandishi, sprites, na sanaa ya dhana ya mazingira ili kuharakisha utayarishaji wa awali

Timu za picha za hisa na masoko zinaunda nakala za bidhaa kwenye chapa na taswira za matangazo bila kupiga picha.

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Miundo ya Usambazaji wa Video

Maswali yanayoulizwa mara kwa mara

What is Latent Diffusion Models?

Miundo iliyofichika ya uenezaji hutoa picha kwa kuendesha mchakato wa uenezaji katika nafasi fiche iliyobanwa badala ya saizi mbichi, kufyeka gharama za kukokotoa. Wao ndio injini nyuma ya Usambazaji Imara na jenereta za kisasa zaidi za picha za chanzo-wazi.

Je, ni uvumbuzi gani mkuu wa mifano fiche ya usambaaji ikilinganishwa na uenezaji wa nafasi ya pixel?

Usambazaji uliofichika hubana picha kwenye nafasi ndogo iliyofichika kwa kutumia VAE, kwa hivyo uwekaji sauti ghali hutokea kwa thamani chache sana kuliko pikseli kamili.

Ni sehemu gani inayobana picha kwenye nafasi fiche na kuijenga upya baadaye?

VAE iliyofunzwa mapema husimba picha kwenye gridi ya fiche iliyoshikamana na avkodare yake huunda upya pikseli zenye msongo kamili mwishoni.

Maandishi kawaida huingizwaje kwenye U-Net ya denoising katika uenezaji wa siri?

Upachikaji wa ishara kutoka kwa kisimbaji cha maandishi huingizwa katika tabaka za uzingatiaji mtambuka, na hivyo kuruhusu vipengele vya anga kuhudhuria dodoso.

Kwa nini kufanya kazi katika nafasi iliyofichwa kunapunguza gharama ya hesabu?

Subiri - sababu sahihi ni kwamba gridi iliyofichwa ni ndogo sana (mara nyingi ~48x) kuliko picha ya pikseli, kwa hivyo kila hatua ya kutoa sauti inahitaji FLOP na kumbukumbu chache zaidi.

Ni modeli gani ya chanzo-wazi inayotumika sana inayoeneza uenezaji fiche?

Usambazaji Imara, uliotolewa mwaka wa 2022, ulileta mtawanyiko wa siri kwa vifaa vya watumiaji na kupitishwa kwa wingi.