Mwongozo wa AI unaoonekana

Vision Transfoma

Vision Transfoma (ViTs) hutumia usanifu wa kibadilishaji nguvu ambacho huwezesha ChatGPT kwa picha, ikichukulia picha kama mfuatano wa viraka badala ya gridi ya pikseli.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

Dive ya kina

Kwa miaka mingi, mitandao ya neva (CNNs) ilitawala uwezo wa kuona wa kompyuta kwa kuchanganua vichujio vidogo kwenye picha. Karatasi ya 2020 ya 'An Image Is Worth 16x16 Words' kutoka Google ilipinga hili kwa kukata picha katika viraka vilivyowekwa, kwa kawaida pikseli 16x16, kubapa kila moja kuwa vekta, na kulisha mfuatano unaotokana na kibadilishaji cha kawaida. Kila kiraka kinakuwa 'ishara,' kama neno katika sentensi. Kielelezo basi hutumia umakini wa kibinafsi ili kila kiraka kiweze kuhusiana moja kwa moja na kila kiraka kingine, ikinasa uhusiano wa masafa marefu ambao kichujio kidogo cha ubadilishaji hakiwezi kuona katika hatua moja. Iliyopatikana: ViTs zina njaa ya data kwa sababu hazina mawazo yaliyojengewa ndani ya CNN. Wakiwa wamefunzwa kwenye hifadhidata kubwa kama vile JFT-300M, walilingana au kushinda CNN bora zaidi, wakiunda upya utafiti wa kisasa wa maono.

Ufahamu wa Kiufundi

ViT hugawanya picha katika viraka visivyopishana, husanifisha kila moja kuwa upachikaji, na kuongeza usimbaji wa nafasi ili kielelezo kijue mahali ambapo kila kiraka kilikaa kwenye picha asili. 'Tokeni ya darasa' maalum inayoweza kusomeka imetayarishwa; uwakilishi wake wa mwisho huendesha uainishaji. Safu zilizopangwa za kuzingatia kibinafsi huruhusu kila kiraka kupima maelezo kutoka kwa vingine vyote, na kutoa uga wa kimataifa wa kupokea kutoka safu ya kwanza. Kwa sababu umakini huongezeka mara nne na idadi ya viraka, picha za ubora wa juu huwa ghali, ndiyo maana ukubwa wa kiraka na lahaja bora za umakini ni muhimu.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Vibadilishaji Maono

ViTs na mahuluti ya CNN-transformer sasa yanaendesha mifumo ya maono inayoongoza, na usanifu unashikilia miundo mingi inayounganisha picha na maandishi, kama vile CLIP na visaidizi vya kisasa vya lugha ya maono. Tarajia kazi endelevu ya kufanya usikivu uwe nafuu kwa ubora wa juu na video, pamoja na mafunzo ya awali ya kujisimamia (kama vile uundaji wa picha zilizofichwa) ambayo hupunguza hamu kubwa ya data iliyo na lebo. Kadiri hesabu inavyokua, mstari kati ya 'muundo wa lugha' na 'muundo wa maono' unaendelea kutia ukungu, huku vibadilishaji transfoma vinavyotumika kama uti wa mgongo ulioshirikiwa katika miundo yote badala ya miundo tofauti tofauti.

Utekelezaji wa Ulimwengu Halisi

Mifumo ya Google ya uainishaji wa picha na mifumo ya viwango vya utaftaji ambayo ilipitisha uti wa mgongo wa transfoma baada ya ViT kudhibitisha ushindani na CNNs.

CLIP na miundo mingine ya maandishi ya picha inayotumia ViT kusimba picha ili picha na maelezo mafupi yaweze kulinganishwa katika nafasi iliyoshirikiwa.

Utafiti wa taswira ya kimatibabu kwa kutumia ViTs ili kugundua ruwaza katika skanati nzima badala ya maandishi ya ndani pekee

Rafu za mtazamo wa kujiendesha na roboti zinazochanganya umakini wa mtindo wa ViT kwa uelewa wa eneo katika nyanja nzima ya mtazamo.

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

CLIP na Vision-Lugha Models

Maswali yanayoulizwa mara kwa mara

What is Vision Transformers?

Vision Transfoma (ViTs) hutumia usanifu wa kibadilishaji nguvu ambacho huwezesha ChatGPT kwa picha, ikichukulia picha kama mfuatano wa viraka badala ya gridi ya pikseli. Walithibitisha kuwa hauitaji miingiliano ili kufikia utambuzi wa picha wa hali ya juu.

Je, Kigeuzi cha Maono huchakataje picha ya kuingiza?

ViT hugawanya picha katika viraka vilivyowekwa (mara nyingi pikseli 16x16), hupachika kila kiraka kama ishara, na kulisha mfuatano huo kuwa kibadilishaji umeme.

Ni utaratibu gani muhimu unaoruhusu ViT kuhusisha sehemu za mbali za picha kwa kila mmoja?

Kujizingatia huruhusu kila kiraka kupima moja kwa moja habari kutoka kwa kila kiraka kingine, kutoa mwonekano wa kimataifa kutoka safu ya kwanza.

Kwa nini Transfoma za Maono wazi kwa kawaida huhitaji hifadhidata kubwa sana za mafunzo ili kufaulu?

Tofauti na CNN, ViTs hazichukulii utofauti wa eneo au tafsiri, kwa hivyo ni lazima zijifunze ruwaza hizi kutoka kwa kiasi kikubwa cha data.

Madhumuni ya usimbaji wa nafasi katika Kigeuzi cha Maono ni nini?

Kujishughulisha ni utaratibu-agnostic, kwa hivyo usimbaji wa nafasi hurejesha eneo la anga la kila kiraka.

Ni taarifa ipi inayoonyesha vyema athari za ViT kwenye maono ya kompyuta?

ViT ilionyesha kuwa kibadilishaji cha umeme safi, chenye data na kiwango cha kutosha, kinaweza kushindana au kupita mitandao bora zaidi ya ushawishi.