Visuell AI GUIDE

Visjon Transformers

Vision Transformers (ViTs) bruker transformatorarkitekturen som driver ChatGPT til bilder, og behandler et bilde som en sekvens av patcher i stedet for et rutenett av piksler.

2 min lesingSist oppdatert

Oversikt

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

Dypdykk

I årevis dominerte konvolusjonelle nevrale nettverk (CNN) datasyn ved å skanne små filtre over et bilde. Oppgaven fra 2020 'An Image Is Worth 16x16 Words' fra Google utfordret dette ved å kutte et bilde i faste flekker, typisk 16x16 piksler, flate ut hver til en vektor og mate den resulterende sekvensen inn i en standard transformator. Hver lapp blir et "token", omtrent som et ord i en setning. Modellen bruker deretter selvoppmerksomhet slik at hver patch kan relateres direkte til annenhver patch, og fanger langdistanseforhold som et lite konvolusjonsfilter ikke kan se i ett trinn. Fangsten: ViT-er er datahungrige fordi de mangler de innebygde forutsetningene til CNN-er. Opplært på enorme datasett som JFT-300M, matchet eller slo de de beste CNN-ene, og omformet moderne synforskning.

Teknisk innsikt

En ViT deler opp et bilde i ikke-overlappende patcher, projiserer hver enkelt inn i en innebygging og legger til posisjonelle kodinger slik at modellen vet hvor hver patch satt i det originale bildet. Et spesielt lærebart 'klassetegn' er vedlagt; dens endelige representasjon driver klassifiseringen. Stablede selvoppmerksomhetslag lar hver patch veie informasjon fra alle andre, og gir et globalt mottakelig felt fra lag én. Fordi oppmerksomhet skaleres kvadratisk med antall patcher, blir bilder med høy oppløsning dyre, og derfor er patchstørrelse og effektive oppmerksomhetsvarianter viktig.

Strategisk innvirkning

Speed and scale

Visual AI kan automatisere inspeksjons-, deteksjons- og merkeoppgaver i stor skala.

Build choices

Kreative team kan prototype konsepter raskere med færre manuelle revisjoner.

Team and workflow

Operasjoner kan bruke bilde- og videosignaler som tidligere var vanskelige å behandle.

The Future of Vision Transformers

ViTs og CNN-transformatorhybrider driver nå ledende synssystemer, og arkitekturen underbygger multimodale modeller som smelter sammen bilder med tekst, som CLIP og moderne synsspråkassistenter. Forvent fortsatt arbeid med å gjøre oppmerksomheten billigere for høyoppløsning og video, pluss selvovervåket forhåndstrening (som maskerte bildemodellering) som reduserer den enorme appetitten for merkede data. Etter hvert som databehandlingen vokser, blir linjen mellom 'språkmodell' og 'synsmodell' stadig uskarp, med transformatorer som fungerer som en delt ryggrad på tvers av modaliteter i stedet for separate spesialiserte design.

Real-World Implementering

Googles bildeklassifiserings- og søkerangeringssystemer som tok i bruk transformator-ryggrad etter at ViT viste seg å være konkurransedyktig med CNN-er

CLIP og andre bildetekstmodeller som bruker en ViT for å kode bilder slik at bilder og bildetekster kan matches på et delt rom

Medisinsk bildeforskning ved hjelp av ViTs for å oppdage mønstre over en hel skanning i stedet for bare lokale teksturer

Selvkjørende og robotikk persepsjonsstabler som kombinerer oppmerksomhet i ViT-stil for sceneforståelse over hele synsfeltet

Risikoer og rekkverk

Bilderettigheter og samtykke kan bli juridiske risikoer hvis herkomst er uklart.

Modellytelsen kan variere på tvers av belysning, demografi og miljøer.

Falske positive kan forbli ubemerket med mindre konfidensgrenser overvåkes.

Veikart for implementering

1

Definer akseptkriterier for presisjons-, tilbakekallings- og feilkostnader.

2

Test med data som samsvarer med reelle produksjonsforhold.

3

Legg til menneskelig vurdering for spådommer med lav selvtillit eller stor innvirkning.

4

Spor modelldrift og revalider etter endringer i kamera eller datasett.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

CLIP og Vision-Language Modeller

Ofte stilte spørsmål

What is Vision Transformers?

Vision Transformers (ViTs) bruker transformatorarkitekturen som driver ChatGPT til bilder, og behandler et bilde som en sekvens av patcher i stedet for et rutenett av piksler. De beviste at du ikke trenger konvolusjoner for å oppnå toppmoderne bildegjenkjenning.

Hvordan behandler en Vision Transformer innledningsvis et inndatabilde?

En ViT deler bildet inn i faste patcher (ofte 16x16 piksler), legger inn hver patch som en token, og mater sekvensen inn i en transformator.

Hvilken nøkkelmekanisme lar en ViT relatere fjerne deler av et bilde til hverandre?

Selvoppmerksomhet lar hver patch direkte veie informasjon fra annenhver patch, og gir en global oversikt fra det første laget.

Hvorfor trenger vanlige Vision Transformers vanligvis veldig store opplæringsdatasett for å utmerke seg?

I motsetning til CNN-er, antar ikke ViT-er lokalitet eller oversettelsesinvarians, så de må lære disse mønstrene fra store mengder data.

Hva er hensikten med posisjonskodinger i en Vision Transformer?

Selvoppmerksomhet er rekkefølge-agnostisk, så posisjonskoding gjenoppretter den romlige plasseringen til hver lapp.

Hvilket utsagn gjenspeiler best ViTs innvirkning på datasyn?

ViT demonstrerte at en ren transformator, med tilstrekkelig data og skala, kan konkurrere med eller overgå de beste konvolusjonelle nettverkene.