I-VISual AI GUIDE

Ama-Vision Transformers

Ama-Vision Transformers (ViTs) asebenzisa i-architecture ye-transformer enika amandla ChatGPT ezithombeni, ephatha isithombe njengokulandelana kwamapetshi esikhundleni segridi yamaphikseli.

2 amaminithi ukufundaIgcine ukubuyekezwa

Uhlolojikelele

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

I-Deep Dive

Iminyaka eminingi, i-convolutional neural networks (CNNs) ibibusa umbono wekhompyutha ngokuskena izihlungi ezincane esithombeni. Iphepha lango-2020 elithi 'Isithombe Sifanele Amagama angu-16x16' elivela ku-Google liphonsele inselelo lokhu ngokusika isithombe sibe amapheshana angaguquki, ngokuvamile amaphikseli angu-16x16, ukwenza isicaba ngasinye sibe ivektha, futhi sifake ukulandelana okuwumphumela ku-transformer evamile. Isiqeshana ngasinye siba 'uphawu,' njengegama emshweni. Imodeli ibe isisebenzisa ukuzinaka ukuze yonke ipheshi ihlobane ngokuqondile nazo zonke ezinye iziqephu, ithwebule ubudlelwano bebanga elide isihlungi esincane esingakwazi ukukubona esinyathelweni esisodwa. Okubanjiwe: Ama-ViT alambile idatha ngoba awanakho ukuqagela okwakhelwe ngaphakathi kwama-CNN. Baqeqeshwe kumadathasethi amakhulu afana ne-JFT-300M, bafana noma bahlula ama-CNN angcono kakhulu, balolonga kabusha ucwaningo lombono lwesimanje.

I-Technical Insight

I-ViT ihlukanisa isithombe sibe amapheshana angadluleli, iphrojektha ngokulandelana ngayinye ibe ukushumeka, futhi yengeza amakhodi amisiwe ukuze imodeli yazi lapho ipheshi ngalinye lalihleli khona esithombeni sokuqala. 'Ithokheni yekilasi' ekhethekile efundekayo ilungiselelwe kusengaphambili; ukumelwa kwayo kokugcina kushayela ukuhlukaniswa. Izendlalelo zokuzinaka ezistakiwe zivumela ipheshi ngalinye likale ulwazi oluvela kuzo zonke ezinye, lunikeze inkambu yomhlaba wonke eyamukelayo ukusuka kusendlalelo sokuqala. Ngenxa yokuthi ukunakwa kukala ngokuphindwe kane ngenani lamapeshi, izithombe ezinokulungiswa okuphezulu ziyabiza, yingakho usayizi wesichibi nokuhlukahluka kokunaka okusebenzayo kubalulekile.

I-Strategic Impact

Isivinini nesikali

I-Visual AI ingakwazi ukuhlola, ukutholwa, nokumaka imisebenzi esikalini.

Yakha ukukhetha

Amathimba aqanjiwe angakwazi ukulinganisa imiqondo ngokushesha ngezibuyekezo ezimbalwa ezenziwa mathupha.

Ithimba kanye nokusebenza komsebenzi

Imisebenzi ingasebenzisa amasiginali wesithombe nawevidiyo obekunzima ukuwenza ngaphambilini.

Ikusasa Lama-Vision Transformers

Ama-ViTs kanye nama-CNN-transformer hybrids manje anika amandla amasistimu okubona ahamba phambili, futhi i-architecture isekela amamodeli e-multimodal ahlanganisa izithombe nombhalo, njenge-CLIP kanye nabasizi besimanje bolimi lokubona. Lindela umsebenzi oqhubekayo wokwenza ukunaka kushibhe ngokulungiswa okuphezulu nevidiyo, kanye nokuziqeqesha kusengaphambili ozigadile (njengokumodela isithombe esifihlekile) okwehlisa isifiso esikhulu sokudla sedatha enelebula. Njengoba ikhompyutha ikhula, umugqa ophakathi 'kwemodeli yolimi' kanye 'nemodeli yombono' ulokhu ufiphala, ama-transformer asebenza njengomgogodla owabiwe kuzo zonke izindlela kunokuba ahlukanise imiklamo ekhethekile.

Ukuqaliswa Komhlaba Wangempela

Google Ukuhlukaniswa kwezithombe kanye nezinhlelo zokukala zokusesha ezamukele ama-transformer backbones ngemuva kokuthi i-ViT ikhombise ukuncintisana nama-CNN

I-CLIP namanye amamodeli wombhalo wesithombe asebenzisa i-ViT ukuze abhale ngekhodi izithombe ukuze izithombe namagama-ncazo amataniswe endaweni okwabelwana ngayo.

Ucwaningo lwezithombe zezokwelapha olusebenzisa ama-ViT ukuze lubone amaphethini kuso sonke iskena kunokwakheka kwendawo kuphela

Ukuzishayela wena ngokwakho kanye nezitaki zombono werobhothi ezihlanganisa ukunaka kwesitayela se-ViT ukuze kuqondwe isigcawu kuyo yonke inkambu yokubuka.

Izingozi & Guardrails

Amalungelo ezithombe kanye nemvume kungaba ubungozi bezomthetho uma ukuvela kungacacile.

Ukusebenza kwemodeli kungahluka kukho konke ukukhanya, izibalo zabantu, kanye nezindawo.

Okuhle okungelona iqiniso kungase kungabonakali ngaphandle uma izinga lokuzethemba liqashelwa.

Ukuqalisa Umhlahlandlela

1

Chaza indlela yokwamukela yokunemba, ukukhumbula, nezindleko zamaphutha.

2

Hlola ngedatha efana nezimo zangempela zokukhiqiza.

3

Engeza isibuyekezo somuntu ukuze uthole ukuzethemba okuphansi noma izibikezelo zomthelela omkhulu.

4

Landelela ukukhukhuleka kwemodeli bese uqinisekisa kabusha ngemva kwezinguquko zekhamera noma zesethi yedatha.

Qhubeka Uhlole

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Qala imibuzo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Umhlahlandlela olandelayo

I-CLIP kanye ne-Vision-Language Models

Imibuzo evame ukubuzwa

What is Vision Transformers?

Ama-Vision Transformers (ViTs) asebenzisa i-architecture ye-transformer enika amandla ChatGPT ezithombeni, ephatha isithombe njengokulandelana kwamapetshi esikhundleni segridi yamaphikseli. Bafakazele ukuthi awudingi ama-convolutions ukuze uzuze ukuqashelwa kwesithombe esisezingeni eliphezulu.

I-Vision Transformer isisebenza kanjani ekuqaleni isithombe esifakiwe?

I-ViT ihlukanisa isithombe sibe amapheshana angaguquki (ngokuvamile angamaphikseli angu-16x16), ishumeka isiqeshana ngasinye njengophawu, bese ifaka ukulandelana kwayo ibe yi-transformer.

Iyiphi indlela ebalulekile evumela i-ViT ukuthi ihlobanise izingxenye ezikude zesithombe komunye nomunye?

Ukuzinaka kuvumela yonke ipheshana ukuthi ikale ngokuqondile ulwazi olusuka kuzo zonke ezinye iziqephu, okunikeza ukubuka komhlaba wonke kusukela kusendlalelo sokuqala.

Kungani ama-plain Vision Transformers ngokuvamile edinga amasethi edatha okuqeqesha amakhulu kakhulu ukuze aphumelele?

Ngokungafani nama-CNN, ama-ViT awacabangi ukuguquguquka kwendawo noma ukuhumusha, ngakho-ke kufanele afunde lawa maphethini enanini elikhulu ledatha.

Iyini inhloso yombhalo wekhodi ku-Vision Transformer?

Ukuzinaka kuwuku-oda-agnostic, ngakho ukubhala ngekhodi kubuyisela indawo yendawo yesichibi ngasinye.

Isiphi isitatimende esiwubonisa kangcono umthelela we-ViT embonweni wekhompyutha?

I-ViT ibonise ukuthi i-transformer ehlanzekile, enedatha nesilinganiso esanele, ingaqhudelana noma idlule amanethiwekhi angcono kakhulu okuguqula.