Miundo ya Usambazaji Fiche
Miundo iliyofichika ya uenezaji hutoa picha kwa kuendesha mchakato wa uenezaji katika nafasi fiche iliyobanwa badala ya saizi mbichi, kufyeka gharama za kukokotoa.
Muhtasari
They are the engine behind Stable Diffusion and most modern open-source image generators.
Dive ya kina
Muundo wa kawaida wa uenezaji hujifunza kubadilisha mchakato wa kelele: huanza kutoka kwa kelele safi na polepole hubadilika kuwa picha. Kufanya hivi moja kwa moja kwenye saizi ni ghali kwa sababu picha ya 512x512 ina mamia ya maelfu ya maadili. Usambazaji fiche, ulioanzishwa na Rombach na wenzake mwaka wa 2022, kwanza hutumia kiencoder tofauti kilichofunzwa awali (VAE) kubana picha katika gridi ndogo iliyofichika (mara nyingi 64x64x4, takriban 48x ndogo). Usambazaji wa U-Net kisha hujifunza kutoa sauti ndani ya nafasi hiyo iliyofichika, inayoongozwa na maandishi kupitia usikivu mtambuka. Hatimaye avkodare ya VAE huunda upya pikseli zenye msongo kamili. Mfinyazo huu wa kimawazo huweka maelezo yenye maana kisemantiki huku ukitupilia mbali maelezo yasiyoonekana, na kufanya uzalishaji wa ubora wa juu ufanyike kwenye GPU za watumiaji.
Ufahamu wa Kiufundi
Ujanja muhimu ni kutenganisha mgandamizo wa kiakili kutoka kwa uundaji generative. VAE hushughulikia maelezo ya pikseli ya masafa ya juu mara moja, na U-Net huonyesha tu usambaaji fiche wa hali ya chini. Urekebishaji wa maandishi hudungwa kupitia safu za uzingatiaji mtambuka, ambapo vipengele vya anga vya U-Net vinahusika na upachikaji wa tokeni kutoka kwa kisimbaji maandishi kama vile CLIP. Kwa sababu landa ni takriban mara 48 ndogo kuliko pikseli, kila hatua ya kutoa sauti ni nafuu sana katika kumbukumbu na FLOPs.
Athari za kimkakati
Kasi na kiwango
Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.
Tengeneza chaguzi
Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.
Timu na mtiririko wa kazi
Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.
Mustakabali wa Miundo ya Usambazaji Fiche
Uenezaji uliofichika unapanuka zaidi ya picha hadi kwenye video (Uenezaji wa Video Imara), vipengee vya 3D, na vionjo vya sauti, vyote vikitumia kichocheo sawa cha compress-basi-denoise. Utafiti unasukuma kuelekea hatua chache za sampuli kupitia miundo ya kunereka na uthabiti, VAE bora zaidi ambazo huhifadhi maandishi na nyuso nzuri, na uundaji wa mtiririko uliorekebishwa kama ule ulio katika Usambazaji Imara wa 3 ambao hunyoosha mwelekeo wa kizazi kwa matokeo ya haraka na makali zaidi.
Utekelezaji wa Ulimwengu Halisi
Usambazaji Imara unaozalisha mchoro na miundo ya dhana kutoka kwa vidokezo vya maandishi kwenye GPU ya mtumiaji mmoja
Adobe na Canva kuwezesha maandishi-kwa-picha na vipengee vya kujaza-zalishi vilivyoundwa kwenye migongo iliyofichika ya usambaaji.
Studio za michezo zinazozalisha ramani za maandishi, sprites, na sanaa ya dhana ya mazingira ili kuharakisha utayarishaji wa awali
Timu za picha za hisa na masoko zinaunda nakala za bidhaa kwenye chapa na taswira za matangazo bila kupiga picha.
Hatari & Walinzi
Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.
Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.
Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.
Ramani ya Utekelezaji
Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.
Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.
Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.
Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Miundo ya Usambazaji wa Video
Maswali yanayoulizwa mara kwa mara
What is Latent Diffusion Models?
Miundo iliyofichika ya uenezaji hutoa picha kwa kuendesha mchakato wa uenezaji katika nafasi fiche iliyobanwa badala ya saizi mbichi, kufyeka gharama za kukokotoa. Wao ndio injini nyuma ya Usambazaji Imara na jenereta za kisasa zaidi za picha za chanzo-wazi.
Je, ni uvumbuzi gani mkuu wa mifano fiche ya usambaaji ikilinganishwa na uenezaji wa nafasi ya pixel?
Usambazaji uliofichika hubana picha kwenye nafasi ndogo iliyofichika kwa kutumia VAE, kwa hivyo uwekaji sauti ghali hutokea kwa thamani chache sana kuliko pikseli kamili.
Ni sehemu gani inayobana picha kwenye nafasi fiche na kuijenga upya baadaye?
VAE iliyofunzwa mapema husimba picha kwenye gridi ya fiche iliyoshikamana na avkodare yake huunda upya pikseli zenye msongo kamili mwishoni.
Maandishi kawaida huingizwaje kwenye U-Net ya denoising katika uenezaji wa siri?
Upachikaji wa ishara kutoka kwa kisimbaji cha maandishi huingizwa katika tabaka za uzingatiaji mtambuka, na hivyo kuruhusu vipengele vya anga kuhudhuria dodoso.
Kwa nini kufanya kazi katika nafasi iliyofichwa kunapunguza gharama ya hesabu?
Subiri - sababu sahihi ni kwamba gridi iliyofichwa ni ndogo sana (mara nyingi ~48x) kuliko picha ya pikseli, kwa hivyo kila hatua ya kutoa sauti inahitaji FLOP na kumbukumbu chache zaidi.
Ni modeli gani ya chanzo-wazi inayotumika sana inayoeneza uenezaji fiche?
Usambazaji Imara, uliotolewa mwaka wa 2022, ulileta mtawanyiko wa siri kwa vifaa vya watumiaji na kupitishwa kwa wingi.