Ntuziaka Visual AI

Ndị ntụgharị ọhụụ

Ọhụụ Transformers (ViTs) na-etinye ihe nrụzigharị mgbanwe nke na-enye ike ChatGPT onyonyo, na-ewere foto dị ka usoro patches kama grid nke pikselụ.

2 nkeji na-agụEmelitere ikpeazụ

Nchịkọta

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

Ime miri emi

Ruo ọtụtụ afọ, netwọkụ akwara ozi (CNNs) na-achịkwa ọhụụ kọmputa site na inyocha obere ihe nzacha n'ofe onyonyo. Akwụkwọ 2020 'Onyinye Kwesịrị Ekwesị Okwu 16 × 16' sitere na Google gbara aka nke a site n'igbuo onyonyo n'ime patches edoziri, dịka pikselụ 16 × 16, na-agbada nke ọ bụla n'ime vector, na inye usoro nke ga-esi na ya pụta ka ọ bụrụ ọkọlọtọ ọkọlọtọ. Ihe nkedo ọ bụla na-aghọ 'token' dị ka okwu dị n'ahịrịokwu. Ihe nlereanya ahụ na-eji nlebara anya nke onwe ya mere kwachie ọ bụla nwere ike jikọta ya na patch ọ bụla ọzọ, na-ewere mmekọrịta dị ogologo, obere nzacha ihe nzacha enweghị ike ịhụ n'otu nzọụkwụ. Ihe nwude: ViT na-agụ agụụ data n'ihi na ha enweghị echiche arụnyere n'ime CNN. A zụrụ azụ na nnukwu dataset dị ka JFT-300M, ha dakọtara ma ọ bụ tie CNN kacha mma, na-emegharị nyocha ọhụụ ọgbara ọhụrụ.

Nghọta nka nka

ViT na-ekewa ihe onyonyo n'ime patches na-adịghị agafe agafe, na-arụ ọrụ n'ahịrị nke ọ bụla n'ime ntinye, ma na-agbakwụnye ntinye ọnọdụ ka ihe nlereanya ahụ mara ebe patch ọ bụla nọdụrụ na foto mbụ. A akwadobere 'klas token' pụrụ iche; nsochi ikpeazụ ya na-akwalite nhazi ọkwa. N'ígwé nlebara anya onwe onye ekpokọtara ọnụ na-eme ka patch ọ bụla tụọ ozi sitere na ndị ọzọ niile, na-enye ubi nnabata zuru ụwa ọnụ site na oyi akwa. N'ihi na nlebara anya na-arịba n'ụzọ anọ na ọnụ ọgụgụ nke patches, onyonyo ndị nwere mkpebi dị elu na-adị oke ọnụ, nke mere nha patch na nlebara anya nke ọma dị mkpa.

Mmetụta atụmatụ

Ọsọ na ọnụ ọgụgụ

Visual AI nwere ike megharịa nyocha, nchọpụta na mkpado ọrụ n'ọtụtụ.

Mee nhọrọ

Otu ndị na-emepụta ihe nwere ike imepụta echiche ngwa ngwa site na ngbanwe akwụkwọ ntuziaka ole na ole.

Team na usoro ọrụ

Ọrụ nwere ike iji onyonyo na akara vidiyo siri ike ịhazi.

Ọdịnihu nke ndị ntụgharị ọhụụ

ViTs na CNN-transformer hybrids ugbu a na-enwe ike na-eduga usoro ọhụụ, na ụkpụrụ ụlọ na-akwado ụdị multimodal na-ejikọta ihe oyiyi na ederede, dị ka CLIP na ndị na-enyere aka n'asụsụ ọhụụ. Na-atụ anya ka ọrụ na-aga n'ihu na-eme ka nlebara anya dị ọnụ ala maka mkpebi dị elu na vidiyo, gbakwunyere ọzụzụ ọzụzụ onwe onye na-elekọta (dị ka ihe nlegharị anya ihe oyiyi) nke na-ebelata nnukwu agụụ data akpọrọ. Ka compute na-eto eto, ahịrị dị n'etiti 'ụdị asụsụ' na 'ụdị ọhụụ' na-aga n'ihu na-enwu enwu, ebe ndị na-agbanwe agbanwe na-eje ozi dị ka ọkpụkpụ azụ na-agafe n'usoro kama ichewapụta atụmatụ pụrụ iche.

Mmejuputa n'ezie n'ụwa

Nkewa onyonyo Google na sistemu ogo ọchụchọ nke nakweere ọkpụkpụ azụ mgbanwe mgbe ViT gosipụtara asọmpi na CNN.

CLIP na ụdị ederede onyonyo ndị ọzọ na-eji ViT na-etinye ihe onyonyo ka e wee kwekọọ na foto na nkọwa okwu na oghere na-ekekọrịta.

Nnyocha onyonyo ahụike na-eji ViT iji hụ ụkpụrụ n'ofe nyocha niile karịa naanị textures mpaghara

Nleba anya nke ịnya ụgbọ ala na robotics na-ejikọta nlebara anya ụdị ViT maka nghọta ihe nkiri n'ofe nlele niile.

Ihe ize ndụ & okporo ụzọ nche

Ikike onyonyo na nkwenye nwere ike bụrụ ihe egwu dị n'iwu ma ọ bụrụ na edoghị anya.

Ọrụ nlereanya nwere ike ịdịgasị iche n'ofe ọkụ, igwe mmadụ, na gburugburu.

Enwere ike ghara ịhụ ihe dị mma ma ọ bụrụ na enyochaghị oke ntụkwasị obi.

Map mmejuputa

1

Kọwaa ụkpụrụ nnabata maka nkenke, icheta, na ụgwọ njehie.

2

Nwalee na data dabara na ọnọdụ mmepụta n'ezie.

3

Tinye nyocha mmadụ maka obere obi ike ma ọ bụ amụma mmetụta dị elu.

4

Sochie ihe nlere anya wee megharịa ka emechara mgbanwe igwefoto ma ọ bụ dataset.

Nọgide na-eme nchọpụta

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Malite ajụjụ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ntuziaka na-esote

Ụdị CLIP na Ọhụụ-Asụsụ

Ajụjụ a na-ajụkarị

What is Vision Transformers?

Ọhụụ Transformers (ViTs) na-etinye ihe nrụzigharị mgbanwe nke na-enye ike ChatGPT onyonyo, na-ewere foto dị ka usoro patches kama grid nke pikselụ. Ha gosipụtara na ị chọghị mgbanwe iji nweta njirimara onyonyo ọgbara ọhụrụ.

Kedu ka onye ntụgharị ọhụụ si ebido onyonyo ntinye?

ViT na-ekewa ihe onyonyo a ka ọ bụrụ patches edoziri (na-abụkarị pikselụ 16 × 16), na-etinye patch ọ bụla dị ka akara, ma na-enye usoro ahụ ka ọ bụrụ ihe ntụgharị.

Kedu usoro bụ isi na-ahapụ ViT ka ọ jikọta akụkụ dị anya nke onyonyo na ibe ya?

Nlebara anya onwe onye na-eme ka patch ọ bụla tụọ ozi sitere na patch ọ bụla, na-enye echiche zuru ụwa ọnụ site na oyi akwa mbụ.

Kedu ihe kpatara ndị ntụgharị ọhụụ doro anya na-achọkarị datasets ọzụzụ buru oke ibu ka ọ dị mma?

N'adịghị ka CNN, ViT anaghị eche na mgbanwe mpaghara ma ọ bụ ntụgharị asụsụ, yabụ na ha ga-amụtarịrị usoro ndị a site na nnukwu data.

Gịnị bụ ebumnobi nke ọnọdụ ọnọdụ na a Vision Transformer?

Nlebara anya onwe onye bụ usoro-agnostic, yabụ ngbanwe ọnọdụ ọnọdụ weghachi ọnọdụ oghere nke patch ọ bụla.

Kedu nkwupụta kacha egosipụta mmetụta ViT na ọhụụ kọmputa?

ViT gosipụtara na ihe ngbanwe dị ọcha, nwere data zuru oke na nha, nwere ike ịsọ mpi ma ọ bụ karịa netwọk mmekọrịta kacha mma.