Mwongozo wa AI unaoonekana

Uzalishaji wa Picha wa Kiotomatiki

Kizazi cha picha kiotomatiki huunda picha kipande kimoja kwa wakati, kutabiri kila ishara kutoka kwa kila kitu kilichotolewa kabla yake.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because the same next-token machinery powering language models can produce coherent, controllable images.

Dive ya kina

Kizazi cha picha kiotomatiki huchukulia picha kama mfuatano na huitabiri kipengele kwa kipengele, ambapo kila kipengele kipya kimewekwa kwenye vyote vilivyotangulia. Kazi ya mapema kama vile PixelRNN na PixelCNN ilitabiri picha pikseli mbichi moja kwa wakati mmoja, ikichanganua safu kwa safu, ambayo ilikuwa ya polepole lakini safi ya kinadharia. Mifumo ya kisasa badala yake kwanza inabana picha kwenye gridi ya tokeni tofauti kwa kutumia kisimbaji cha mtindo wa VQ-VAE, kisha Transformer hutabiri ishara hizo kushoto kwenda kulia. DALL-E 1 ya OpenAI na Parti ya Google walifuata kichocheo hiki, na kuzalisha tokeni za picha zilizowekwa kwenye kidokezo cha maandishi kabla ya kuzisimbua kuwa pikseli. Faida kubwa ni uwezekano kamili wa kuigwa na usanifu umoja ulioshirikiwa na lugha. Gharama ni ya kufuatana, sampuli polepole.

Ufahamu wa Kiufundi

Muundo huo huweka uwezekano wa pamoja wa tokeni zote kuwa bidhaa ya masharti: p(x) = bidhaa ya p(x_i iliyotolewa x_1...x_{i-1}). Transfoma yenye usikivu wa sababu (iliyofichwa) hutekeleza kwamba kila nafasi huona tu ishara za mapema. Wakati wa mafunzo hubashiri kila ishara sambamba kwa kutumia ulazimishaji wa mwalimu, lakini kwa makisio ni lazima ichukue tokeni moja kwa wakati mmoja, ikilisha kila mmoja ndani. Kitabu cha msimbo kilichojifunza huweka alama kwenye viraka vya picha, ambazo dekoda hutoa sampuli za pikseli za mwisho.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Kizazi Kinachojirudia cha Picha

Kasi ni uwanja wa vita kuu. Mbinu kama vile kusimbua kwa ishara zilizofichwa (MaskGIT, Muse) hutoa tokeni nyingi kwa wakati mmoja, na usimbaji wa kubahatisha uliokopwa kutoka kwa miundo ya lugha unarekebishwa kwa picha. Watafiti pia wanaunganisha ishara za maandishi na picha katika uti wa mgongo unaojirudia ili modeli moja iweze kusoma na kuchora, kama inavyoonekana katika mifumo mingi. Tarajia mawazo ya kiotomatiki na ya uenezaji ili kuendelea kuchanganyika, huku miundo mseto ikichukua udhibiti wa tokeni na ubora wa usambaaji.

Utekelezaji wa Ulimwengu Halisi

DALL-E 1 ilitengeneza picha kwa kutabiri kiotomatiki gridi ya tokeni za picha tofauti kutoka kwa maelezo mafupi.

Parti ya Google iliongeza Kibadilishaji maandishi-hadi-picha kiotomatiki hadi vigezo bilioni 20 kwa matukio ya kina na ya uaminifu.

PixelCNN na PixelRNN zilionyesha uzalishaji ghafi wa pixel-by-pixel na bado zinatumika kama misingi ya kufundishia kwa miundo inayotegemea uwezekano.

MaskGIT na Muse hutumia usimbaji wa ishara-fiche sambamba ili kuharakisha usanisi wa picha unaotegemea tokeni huku wakiendelea na mafunzo ya mtindo wa kiotomatiki.

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Autoregressive Image Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Kizazi cha Picha cha AI

Maswali yanayoulizwa mara kwa mara

What is Autoregressive Image Generation?

Kizazi cha picha kiotomatiki huunda picha kipande kimoja kwa wakati, kutabiri kila ishara kutoka kwa kila kitu kilichotolewa kabla yake. Ni muhimu kwa sababu miundo ya lugha inayotumia ishara zinazofuata inaweza kutoa picha zinazoweza kudhibitiwa.

Je, 'autoregressive' inamaanisha nini katika muktadha wa utengenezaji wa picha?

Miundo ya kujirekebisha hurekebisha picha kama mfuatano, ikitabiri kila tokeni au pikseli kulingana na vipengele vyote vilivyotengenezwa kabla yake.

Je! mifano ya kisasa ya picha za kiotomatiki kama DALL-E 1 kawaida huwakilisha picha kabla ya kuitabiri?

Mifumo ya kisasa inabana picha kuwa tokeni tofauti (mara nyingi kupitia kisimbaji cha mtindo wa VQ-VAE), kisha utabiri mlolongo huo wa tokeni na Transformer.

Ni miundo gani ya awali ilitoa picha pikseli moja mbichi kwa wakati mmoja?

PixelRNN na PixelCNN zilikuwa modeli za utangulizi ambazo zilichanganua na kutabiri picha za pikseli kwa pikseli.

Ni utaratibu gani unahakikisha Transfoma inahudumia tokeni za awali pekee wakati wa uzalishaji wa kiotomatiki?

Ufunikaji wa sababu huzuia kila nafasi kuhudhuria tokeni za siku zijazo, na kutekeleza uwekaji alama kutoka kushoto kwenda kulia.

Ni nini kikwazo kikuu cha vitendo cha sampuli za picha zinazoendelea?

Kwa sababu kila ishara inategemea zile zilizopita, uelekezaji lazima uendeshe ishara kwa ishara, na kufanya kizazi kuwa polepole.