VQ-VAE na Latent za kipekee
VQ-VAE hubana picha, sauti au video kwenye gridi ndogo ya misimbo tofauti inayotolewa kutoka kwa kitabu cha msimbo kilichojifunza, badala ya nambari zinazoendelea.
Muhtasari
This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.
Dive ya kina
VQ-VAE (Vector Quantized Variational Autoencoder), iliyoanzishwa na van den Oord na wafanyakazi wenzake katika DeepMind mnamo 2017, ni kisimbaji kiotomatiki ambacho nafasi yake fiche ni tofauti. Kisimbaji hugeuza picha kuwa gridi ya vekta zinazoendelea; kila vekta basi hunaswa hadi ingizo lake la karibu zaidi katika kitabu cha msimbo kilichojifunza cha upachikaji (idadi ya vekta). Kisimbuaji huunda upya picha kutoka kwa misimbo hiyo iliyokadiriwa. Kwa sababu lasiti sasa ni msamiati wenye kikomo wa fahirisi, muundo tofauti unaweza kujifunza usambazaji wao na kutoa maudhui mapya. Kichocheo hiki cha hatua mbili huwezesha DALL-E 1, Jukebox kwa muziki, na VQGAN, ambayo huongeza hasara ya kimawazo na pinzani kwa uundaji upya mkali. VQ-VAE-2 ilirundika maazimio mengi ili kutoa picha za uaminifu wa juu.
Ufahamu wa Kiufundi
Hatua ya kuhesabu (utafutaji wa argmin wa karibu zaidi) haiwezi kutofautishwa, kwa hivyo VQ-VAE hutumia kikadirio cha moja kwa moja: mikunjo inakiliwa moja kwa moja kutoka kwa uingizaji wa kisimbuzi kurudi kwenye pato la kisimbaji kana kwamba ujanibishaji ndio utambulisho. Mafunzo yanajumuisha upotezaji wa uundaji upya, upotezaji wa kitabu cha msimbo kinachochota upachikaji kuelekea matokeo ya programu ya kusimba, na hasara ya kujitolea ikiweka kisimbaji kujitolea kwa misimbo yake iliyochaguliwa. Hitilafu ya kawaida ni kuanguka kwa kitabu cha msimbo, ambapo misimbo michache pekee hutumika.
Athari za kimkakati
Kasi na kiwango
Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.
Tengeneza chaguzi
Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.
Timu na mtiririko wa kazi
Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.
Mustakabali wa VQ-VAE na Latent Tofauti
Laini za kipekee ni kitovu cha msukumo kuelekea miundo iliyounganishwa ya modi nyingi ambazo huweka alama picha, sauti na video katika msamiati sawa na maandishi. Maboresho kama vile ujanibishaji mabaki na wenye kikomo wa vipimo, vitabu vikubwa vya msimbo, na usawazishaji bora wa matumizi yanapunguza kuporomoka na kuongeza uaminifu. Miundo inapolenga kuelewa na kuzalisha kwa njia zote, viashiria thabiti vilivyojengwa kwenye mawazo ya VQ-VAE vitasalia kuwa kiungo cha msingi, kikizidi kushindana na kuchanganywa na mbinu za uenezaji fiche zinazoendelea.
Utekelezaji wa Ulimwengu Halisi
DALL-E 1 ilitumia tokenizer ya kipekee ya VQ-VAE ili Transfoma iweze kutoa picha kama mfuatano wa fahirisi za kitabu cha msimbo.
VQGAN ilichanganya VQ-VAE na hasara za kiadui na kimtazamo ili kutoa tokeni za picha za ubora wa juu kwa ajili ya utengenezaji wa sanaa.
Jukebox ya OpenAI imetumia VQ-VAE kwa sauti mbichi, ikikandamiza muziki kuwa misimbo tofauti kwa uundaji genera.
VQ-VAE-2 imerundikwa laini za hali ya juu ili kuunganisha picha mbalimbali za uaminifu wa hali ya juu zinazoshindana na GAN za enzi yake.
Hatari & Walinzi
Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.
Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.
Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.
Ramani ya Utekelezaji
Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.
Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.
Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.
Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQ-VAE and Discrete Latents quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Mchanganyiko Fiche na Ufafanuzi wa Picha
Maswali yanayoulizwa mara kwa mara
What is VQ-VAE and Discrete Latents?
VQ-VAE hubana picha, sauti au video kwenye gridi ndogo ya misimbo tofauti inayotolewa kutoka kwa kitabu cha msimbo kilichojifunza, badala ya nambari zinazoendelea. Uzuiaji huu wa kipekee huruhusu miundo ya mfuatano yenye nguvu kama vile Transfoma kutibu midia kama 'ishara', kama vile maneno.
Ni nini hufanya nafasi fiche ya VQ-VAE kuwa tofauti na ile ya kawaida ya VAE?
VQ-VAE hubadilisha laiti zinazoendelea na misimbo tofauti inayotolewa kutoka kwa kitabu cha msimbo kilichojifunza kupitia ujanibishaji wa vekta.
VQ-VAE hupitisha vipi viwango kupitia hatua ya hesabu isiyoweza kutofautishwa?
Kikadiriaji cha moja kwa moja hunakili kipenyo cha kuingiza sauti cha avkodare moja kwa moja kwenye pato la programu ya kusimba, ikichukulia ukadiriaji kama kitambulisho cha kipitishio cha nyuma.
'Collapse book' ni nini?
Kuanguka kwa kitabu cha msimbo hutokea wakati muundo unategemea misimbo michache tu, kupoteza kitabu kikubwa cha msimbo na kuumiza utofauti.
Kwa nini lahaja za kipekee ni muhimu kwa uundaji wa kijadi na Transfoma?
Fahirisi za kipekee huunda msamiati wenye kikomo, kwa hivyo miundo ya mfuatano kama vile Transfoma inaweza kujifunza na kuiga usambazaji wao kama maneno.
VQGAN iliongeza nini juu ya mapishi ya msingi ya VQ-VAE?
VQGAN huongeza VQ-VAE na kibaguzi na upotezaji wa utambuzi, kutoa crisper, tokeni za kina zaidi zilizoundwa upya.