Masu canza hangen nesa
Vision Transformers (ViTs) suna amfani da tsarin gine-ginen tasfoma wanda ke ba da ikon ChatGPT zuwa hotuna, suna ɗaukar hoto azaman jeri na faci maimakon grid na pixels.
Dubawa
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
Zurfafa nutsewa
Tsawon shekaru, hanyoyin sadarwa na jijiyoyi (CNNs) sun mamaye hangen nesa na kwamfuta ta hanyar duba ƙananan tacewa a kan hoto. Takardar 2020 'Hoton Yana Cancantar Kalmomi 16x16' daga Google ta ƙalubalanci wannan ta hanyar yanke hoto zuwa ƙayyadaddun faci, yawanci 16x16 pixels, tana karkatar da kowanne cikin vector, da ciyar da sakamakon da aka samu zuwa madaidaicin gidan wuta. Kowane facin ya zama 'alama,' kamar kalma a cikin jumla. Misalin yana amfani da hankalin kai don haka kowane facin zai iya danganta kai tsaye da kowane facin, yana ɗaukar alaƙa mai nisa, ƙaramin tacewa ba zai iya gani a mataki ɗaya ba. Kama: ViTs suna jin yunwar bayanai saboda basu da ginanniyar zato na CNNs. An horar da su akan manyan bayanai kamar JFT-300M, sun daidaita ko doke mafi kyawun CNNs, suna sake fasalin binciken hangen nesa na zamani.
Fahimtar Fasaha
ViT yana raba hoto zuwa facin da ba a haɗa shi ba, yana aiwatar da layin layi kowanne a cikin haɗawa, kuma yana ƙara ɓoyayyun wurare don ƙirar ta san inda kowane facin ya zauna a ainihin hoton. An riga an riga an riga an shirya wani 'class token' na musamman wanda za'a iya koyo; wakilcinsa na ƙarshe yana tafiyar da rarrabuwa. Matsakaicin matakan kulawa da kai suna barin kowane faci ya auna bayanai daga duk wasu, yana ba da filin karɓuwa na duniya daga layi ɗaya. Saboda hankali yana yin ma'auni quadratically tare da adadin faci, hotuna masu girman gaske sun zama masu tsada, wanda shine dalilin da ya sa girman facin da ingantaccen bambance-bambancen kulawa suna da mahimmanci.
Dabarun Tasiri
Gudu da sikelin
Kayayyakin AI na iya sarrafa aiki da bincike, ganowa, da ayyuka masu alama a sikelin.
Gina zaɓuɓɓuka
Ƙungiyoyin ƙirƙira za su iya samar da ra'ayoyi cikin sauri tare da ƙarancin bita da hannu.
Ƙungiya da aikin aiki
Ayyuka na iya amfani da siginar hoto da bidiyo waɗanda a baya suke da wahalar aiwatarwa.
Makomar Vision Transformers
ViTs da CNN-transformer hybrids yanzu suna da ikon jagorancin tsarin hangen nesa, kuma gine-ginen yana ɗokin ƙirar ƙirar zamani waɗanda ke haɗa hotuna da rubutu, kamar CLIP da mataimakan harshe na zamani. Yi tsammanin ci gaba da aiki akan mai da hankali mai rahusa don babban ƙuduri da bidiyo, tare da horarwa na kulawa da kai (kamar ƙirar hoto mai rufe fuska) wanda ke rage ɗimbin ƙwaƙƙwaran ƙima. Yayin da ƙididdigewa ke girma, layin tsakanin 'samfurin harshe' da 'samfurin hangen nesa' yana ci gaba da ɓarkewa, tare da tasfoma masu aiki a matsayin kashin baya mai ban sha'awa maimakon keɓance ƙira na musamman.
Aiwatar da Gaskiyar Duniya
_AIU_PROTECTED_11_'s Rarraba hoto da tsarin bincike waɗanda suka karɓi kashin bayan transfoma bayan ViT ya tabbatar da gogayya da CNNs.
CLIP da sauran nau'ikan rubutu-hoto waɗanda ke amfani da ViT don ɓoye hotuna ta yadda za a iya daidaita hotuna da taken magana a cikin wuri ɗaya.
Binciken hoto na likitanci ta amfani da ViTs don tabo alamu a duk faɗin sikanin maimakon ƙirar gida kawai
Tuki da kai da kuma na'urori masu auna mutum-mutumi waɗanda ke haɗa kulawar salon ViT don fahimtar fage a cikin cikakken filin kallo.
Hatsari & Tsare-tsare
Haƙƙoƙin hoto da yarda na iya zama haxarin doka idan ba a fayyace ba.
Ayyukan samfuri na iya bambanta a ko'ina cikin haske, ƙididdiga, da mahalli.
Ƙarya tabbataccen ƙila ba za a iya lura da shi ba sai dai idan an kula da ƙofofin amincewa.
Taswirar Hanya
Ƙayyade ma'auni na karɓa don daidaito, tunowa, da farashi na kuskure.
Gwada tare da bayanan da suka dace da ainihin yanayin samarwa.
Ƙara bita na ɗan adam don ƙarancin amincewa ko tsinkaya mai tasiri.
Bi diddigin ƙirar ƙira kuma sake ingantawa bayan canje-canjen kamara ko saitin bayanai.
Ci gaba da Bincike
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Jagora na gaba
CLIP da Samfuran Harshen Hangen nesa
Tambayoyin da ake yawan yi
What is Vision Transformers?
Vision Transformers (ViTs) suna amfani da tsarin gine-ginen tasfoma wanda ke ba da ikon ChatGPT zuwa hotuna, suna ɗaukar hoto azaman jeri na faci maimakon grid na pixels. Sun tabbatar da cewa ba kwa buƙatar jujjuyawa don cimma ingantaccen hoton hoto na zamani.
Ta yaya Vision Transformer ke fara aiwatar da hoton shigarwa?
A ViT yana raba hoton zuwa ƙayyadaddun faci (sau da yawa 16x16 pixels), saka kowane facin azaman alama, kuma yana ciyar da jerin zuwa na'urar wuta.
Wane maɓalli mai mahimmanci zai ba da damar ViT ya danganta sassan hoto mai nisa da juna?
Hankalin kai yana barin kowane facin kai tsaye ya auna bayanai daga kowane facin, yana ba da ra'ayi na duniya daga farkon matakin.
Me yasa masu Canjin hangen nesa a sarari suke buƙatar manyan bayanan horo don yin fice?
Ba kamar CNNs ba, ViTs ba sa ɗaukan yanki ko bambancin fassarar, don haka dole ne su koyi waɗannan alamu daga adadi mai yawa na bayanai.
Menene maƙasudin rikodi na matsayi a cikin Mai Canjin hangen nesa?
Hankalin kai tsari ne-agnostic, don haka rufaffen rikodi na mayar da wurin sararin kowane faci.
Wace magana ce ta fi nuna tasirin ViT akan hangen nesa na kwamfuta?
ViT ya nuna cewa taswira mai tsabta, tare da isassun bayanai da ma'auni, na iya yin hamayya ko zarce mafi kyawun hanyoyin sadarwa na juyin juya hali.