Mwongozo wa AI unaoonekana

VQGAN na Mchanganyiko wa Picha za Kitabu cha Msimbo

VQGAN hubana picha katika gridi ya ishara tofauti zinazotolewa kutoka kwa kitabu cha msimbo kilichojifunza, na kuruhusu kibadilishaji picha kutoa picha kwa njia sawa na miundo ya lugha kutoa maandishi.

dk 2 kusomaIlisasishwa mwisho

Dive ya kina

VQGAN, iliyoletwa katika karatasi ya 2021 ya 'Taming Transformers for High-Resolution Image Synthesis,' inachanganya kisimbaji kiotomatiki cha vekta (VQVAE) na mafunzo ya kiadui na kiakili. Kisimbaji huweka picha kwenye gridi ndogo ya vekta za vipengele; kila vekta hunaswa hadi kwenye ingizo la karibu zaidi katika kitabu cha msimbo kilichojifunza cha, tuseme, misimbo 1024, na kugeuza picha kuwa mlolongo wa tokeni kamili. Kisimbuaji huunda upya picha kutoka kwa tokeni hizo, zilizofunzwa na kibaguzi cha GAN na upotevu wa utambuzi ili uundaji upya uonekane mkali badala ya ukungu. Kwa sababu picha sasa ni mfuatano wa tokeni tofauti, kibadilishaji kiotomatiki kinaweza kuziiga kama lugha, kutabiri tokeni moja baada ya nyingine. VQGAN ilitumia zana za sanaa za mapema za kubadilisha maandishi hadi picha zinapooanishwa na mwongozo wa CLIP.

Ufahamu wa Kiufundi

Uendeshaji msingi ni ujanibishaji wa vekta: matokeo ya programu ya kusimba yanayoendelea yanabadilishwa na vekta za kitabu cha msimbo zilizo karibu zaidi, na kikadirio cha 'kupitia moja kwa moja' ili kisimbaji bado kiweze kujifunza licha ya utafutaji usio tofauti. Kuongeza kibaguzi cha GAN chenye kiraka juu ya kisimbaji kiotomatiki ndiko kunakoruhusu VQGAN kutumia gridi ya tokeni ndogo zaidi (k.m. 16x16) kuliko VQVAE huku inaweka umbile nyororo, na kufanya uundaji wa kibadilishaji kuwa rahisi.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa VQGAN na Mchanganyiko wa Picha za Kitabu cha Msimbo

Kichocheo cha tokeni cha VQGAN kikawa msingi wa mifano ya picha na video inayotegemea tokeni, kutoka MaskGIT hadi mifumo mingi inayochanganya tokeni za picha na maandishi katika kibadilishaji kimoja. Utafiti sasa unasukuma kuelekea vitabu vya msimbo vikubwa, vilivyo na kikomo au visivyolipishwa ambavyo huepuka kuporomoka kwa kitabu cha msimbo na kuelekea miundo iliyounganishwa ambapo msamiati sawa huhusisha picha, sauti na lugha, na kuwezesha kizazi chochote hadi chochote.

Utekelezaji wa Ulimwengu Halisi

Kusimba picha kwenye gridi ya 16x16 ya tokeni za kitabu cha msimbo ili kibadilishaji kiweze kuigwa na kuifanya upya.

Kuoanisha VQGAN na mwongozo wa CLIP ili kuunda sanaa ya AI ya 'VQGAN+CLIP' ambayo ilisambaa sana mnamo 2021.

Kufinyiza picha ziwe misimbo ya kipekee kwa uhifadhi bora au mafunzo ya uzalishaji ya chini ya mkondo

Inatumika kama kiashiria cha picha ndani ya jenereta kubwa zenye msingi wa tokeni kama MaskGIT na vibadilishaji vya kubadilisha mifumo mbalimbali.

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Usanifu wa Picha ya SPADE Semantiki

Maswali yanayoulizwa mara kwa mara

What is VQGAN and Codebook Image Synthesis?

VQGAN hubana picha katika gridi ya ishara tofauti zinazotolewa kutoka kwa kitabu cha msimbo kilichojifunza, na kuruhusu kibadilishaji picha kutoa picha kwa njia sawa na miundo ya lugha kutoa maandishi.

VQGAN hutumia nini kuwakilisha picha kama ishara tofauti?

VQGAN hukadiria vipengele vya kusimba kwa maingizo yaliyo karibu zaidi katika kitabu cha msimbo kilichojifunza, na kugeuza picha kuwa mfuatano wa fahirisi za msimbo tofauti.

Kwa nini VQGAN inaongeza kibaguzi wa GAN juu ya VQVAE?

Hasara za kiadui na kimtazamo huruhusu VQGAN kuunda upya picha fupi kutoka kwa gridi ya tokeni fupi, ambayo VQVAE pekee inaelekea kutia ukungu.

Mara tu picha ni mlolongo wa ishara, ni mfano gani hutoa picha mpya?

Kwa sababu picha huwa mfuatano wa tokeni tofauti, kibadilishaji kibadilishaji kinaweza kuziiga kiotomatiki, kama vile kutengeneza maandishi.

Ni mbinu gani huruhusu mikunjo kupita katika hatua ya hesabu isiyoweza kutofautishwa?

Ukadiriaji wa vekta hauwezi kutofautishwa, kwa hivyo VQGAN hutumia makadirio ya moja kwa moja ya gradient ili kufunza programu ya kusimba.

VQGAN ilisaidia kuunda mtindo gani maarufu wa sanaa wa AI mnamo 2021?

Kuoanisha VQGAN na mwongozo wa CLIP kulizalisha sanaa iliyoshirikiwa sana ya 'VQGAN+CLIP' iliyoeneza uundaji wa picha zinazoendeshwa na maandishi.