VQGAN na Mchanganyiko wa Picha za Kitabu cha Msimbo
VQGAN hubana picha katika gridi ya ishara tofauti zinazotolewa kutoka kwa kitabu cha msimbo kilichojifunza, na kuruhusu kibadilishaji picha kutoa picha kwa njia sawa na miundo ya lugha kutoa maandishi.
Dive ya kina
VQGAN, iliyoletwa katika karatasi ya 2021 ya 'Taming Transformers for High-Resolution Image Synthesis,' inachanganya kisimbaji kiotomatiki cha vekta (VQVAE) na mafunzo ya kiadui na kiakili. Kisimbaji huweka picha kwenye gridi ndogo ya vekta za vipengele; kila vekta hunaswa hadi kwenye ingizo la karibu zaidi katika kitabu cha msimbo kilichojifunza cha, tuseme, misimbo 1024, na kugeuza picha kuwa mlolongo wa tokeni kamili. Kisimbuaji huunda upya picha kutoka kwa tokeni hizo, zilizofunzwa na kibaguzi cha GAN na upotevu wa utambuzi ili uundaji upya uonekane mkali badala ya ukungu. Kwa sababu picha sasa ni mfuatano wa tokeni tofauti, kibadilishaji kiotomatiki kinaweza kuziiga kama lugha, kutabiri tokeni moja baada ya nyingine. VQGAN ilitumia zana za sanaa za mapema za kubadilisha maandishi hadi picha zinapooanishwa na mwongozo wa CLIP.
Ufahamu wa Kiufundi
Uendeshaji msingi ni ujanibishaji wa vekta: matokeo ya programu ya kusimba yanayoendelea yanabadilishwa na vekta za kitabu cha msimbo zilizo karibu zaidi, na kikadirio cha 'kupitia moja kwa moja' ili kisimbaji bado kiweze kujifunza licha ya utafutaji usio tofauti. Kuongeza kibaguzi cha GAN chenye kiraka juu ya kisimbaji kiotomatiki ndiko kunakoruhusu VQGAN kutumia gridi ya tokeni ndogo zaidi (k.m. 16x16) kuliko VQVAE huku inaweka umbile nyororo, na kufanya uundaji wa kibadilishaji kuwa rahisi.
Athari za kimkakati
Kasi na kiwango
Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.
Tengeneza chaguzi
Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.
Timu na mtiririko wa kazi
Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.
Mustakabali wa VQGAN na Mchanganyiko wa Picha za Kitabu cha Msimbo
Kichocheo cha tokeni cha VQGAN kikawa msingi wa mifano ya picha na video inayotegemea tokeni, kutoka MaskGIT hadi mifumo mingi inayochanganya tokeni za picha na maandishi katika kibadilishaji kimoja. Utafiti sasa unasukuma kuelekea vitabu vya msimbo vikubwa, vilivyo na kikomo au visivyolipishwa ambavyo huepuka kuporomoka kwa kitabu cha msimbo na kuelekea miundo iliyounganishwa ambapo msamiati sawa huhusisha picha, sauti na lugha, na kuwezesha kizazi chochote hadi chochote.
Utekelezaji wa Ulimwengu Halisi
Kusimba picha kwenye gridi ya 16x16 ya tokeni za kitabu cha msimbo ili kibadilishaji kiweze kuigwa na kuifanya upya.
Kuoanisha VQGAN na mwongozo wa CLIP ili kuunda sanaa ya AI ya 'VQGAN+CLIP' ambayo ilisambaa sana mnamo 2021.
Kufinyiza picha ziwe misimbo ya kipekee kwa uhifadhi bora au mafunzo ya uzalishaji ya chini ya mkondo
Inatumika kama kiashiria cha picha ndani ya jenereta kubwa zenye msingi wa tokeni kama MaskGIT na vibadilishaji vya kubadilisha mifumo mbalimbali.
Hatari & Walinzi
Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.
Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.
Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.
Ramani ya Utekelezaji
Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.
Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.
Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.
Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Usanifu wa Picha ya SPADE Semantiki
Maswali yanayoulizwa mara kwa mara
What is VQGAN and Codebook Image Synthesis?
VQGAN hubana picha katika gridi ya ishara tofauti zinazotolewa kutoka kwa kitabu cha msimbo kilichojifunza, na kuruhusu kibadilishaji picha kutoa picha kwa njia sawa na miundo ya lugha kutoa maandishi.
VQGAN hutumia nini kuwakilisha picha kama ishara tofauti?
VQGAN hukadiria vipengele vya kusimba kwa maingizo yaliyo karibu zaidi katika kitabu cha msimbo kilichojifunza, na kugeuza picha kuwa mfuatano wa fahirisi za msimbo tofauti.
Kwa nini VQGAN inaongeza kibaguzi wa GAN juu ya VQVAE?
Hasara za kiadui na kimtazamo huruhusu VQGAN kuunda upya picha fupi kutoka kwa gridi ya tokeni fupi, ambayo VQVAE pekee inaelekea kutia ukungu.
Mara tu picha ni mlolongo wa ishara, ni mfano gani hutoa picha mpya?
Kwa sababu picha huwa mfuatano wa tokeni tofauti, kibadilishaji kibadilishaji kinaweza kuziiga kiotomatiki, kama vile kutengeneza maandishi.
Ni mbinu gani huruhusu mikunjo kupita katika hatua ya hesabu isiyoweza kutofautishwa?
Ukadiriaji wa vekta hauwezi kutofautishwa, kwa hivyo VQGAN hutumia makadirio ya moja kwa moja ya gradient ili kufunza programu ya kusimba.
VQGAN ilisaidia kuunda mtindo gani maarufu wa sanaa wa AI mnamo 2021?
Kuoanisha VQGAN na mwongozo wa CLIP kulizalisha sanaa iliyoshirikiwa sana ya 'VQGAN+CLIP' iliyoeneza uundaji wa picha zinazoendeshwa na maandishi.