Visuele AI-GIDS

Visie-transformatoren

Vision Transformers (ViTs) passen de transformatorarchitectuur toe die ChatGPT aanstuurt op afbeeldingen, waarbij een afbeelding wordt behandeld als een reeks vlakken in plaats van als een raster van pixels.

2 min readLaatst bijgewerkt

Overzicht

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

Diepe duik

Jarenlang domineerden convolutionele neurale netwerken (CNN's) het computervisie door kleine filters over een afbeelding te scannen. De paper uit 2020 'An Image Is Worth 16x16 Words' van Google daagde dit uit door een afbeelding in vaste stukken te hakken, doorgaans 16x16 pixels, elk vlak af te vlakken tot een vector, en de resulterende reeks in een standaardtransformator in te voeren. Elke patch wordt een 'token', net als een woord in een zin. Het model maakt vervolgens gebruik van zelfaandacht, zodat elke patch rechtstreeks verband kan houden met elke andere patch, waardoor langeafstandsrelaties worden vastgelegd die een klein convolutioneel filter niet in één stap kan zien. Het addertje onder het gras: ViT's zijn hongerig naar data omdat ze de ingebouwde aannames van CNN's missen. Getraind met enorme datasets zoals JFT-300M, evenaarden of versloegen ze de beste CNN's, waardoor het moderne visieonderzoek een nieuwe vorm kreeg.

Technisch inzicht

Een ViT splitst een afbeelding op in niet-overlappende patches, projecteert elk lineair in een inbedding en voegt positionele coderingen toe zodat het model weet waar elke patch zich in de originele afbeelding bevond. Er wordt een speciaal leerbaar 'klassetoken' toegevoegd; de uiteindelijke representatie ervan drijft classificatie. Gestapelde zelfaandachtslagen zorgen ervoor dat elke patch informatie van alle andere kan afwegen, waardoor een globaal ontvankelijk veld ontstaat vanaf laag één. Omdat de aandacht kwadratisch schaalt met het aantal patches, worden afbeeldingen met een hoge resolutie duur. Daarom zijn de patchgrootte en efficiënte aandachtsvarianten belangrijk.

Strategische impact

Speed and scale

Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.

Build choices

Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.

Team and workflow

Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.

De toekomst van visietransformers

ViTs en CNN-transformator-hybriden voeden nu toonaangevende vision-systemen, en de architectuur ondersteunt multimodale modellen die beelden met tekst combineren, zoals CLIP en moderne vision-taalassistenten. Verwacht verder werk om aandacht goedkoper te maken voor hoge resolutie en video, plus zelfgecontroleerde voortraining (zoals modellering van gemaskeerde afbeeldingen) die de enorme behoefte aan gelabelde gegevens vermindert. Naarmate de rekenkracht groeit, blijft de grens tussen 'taalmodel' en 'visiemodel' vervagen, waarbij transformatoren dienen als een gedeelde ruggengraat voor alle modaliteiten in plaats van als afzonderlijke gespecialiseerde ontwerpen.

Implementatie in de echte wereld

De beeldclassificatie- en zoekrangschikkingssystemen van Google die transformatorbackbones adopteerden nadat ViT concurrerend bleek te zijn met CNN's

CLIP en andere beeld-tekstmodellen die een ViT gebruiken om afbeeldingen te coderen, zodat foto's en bijschriften in een gedeelde ruimte kunnen worden gecombineerd

Medisch beeldvormingsonderzoek waarbij gebruik wordt gemaakt van ViTs om patronen op een hele scan te ontdekken in plaats van alleen lokale texturen

Zelfrijdende en robotica-perceptiestapels die aandacht in ViT-stijl combineren voor begrip van scènes over het volledige gezichtsveld

Risico's en vangrails

Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.

De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.

Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.

Implementatie routekaart

1

Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.

2

Test met gegevens die overeenkomen met echte productieomstandigheden.

3

Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.

4

Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

CLIP- en Vision-Taalmodellen

Frequently asked questions

What is Vision Transformers?

Vision Transformers (ViTs) passen de transformatorarchitectuur toe die ChatGPT aanstuurt op afbeeldingen, waarbij een afbeelding wordt behandeld als een reeks vlakken in plaats van als een raster van pixels. Ze bewezen dat je geen convoluties nodig hebt om state-of-the-art beeldherkenning te bereiken.

Hoe verwerkt een Vision Transformer in eerste instantie een invoerbeeld?

Een ViT verdeelt het beeld in vaste patches (vaak 16x16 pixels), integreert elke patch als een token en voert de reeks in een transformator.

Welk sleutelmechanisme zorgt ervoor dat een ViT verafgelegen delen van een beeld met elkaar in verband brengt?

Door zelfaandacht kan elke patch direct de informatie van elke andere patch afwegen, waardoor een globaal beeld ontstaat vanaf de eerste laag.

Waarom hebben gewone Vision Transformers doorgaans zeer grote trainingsdatasets nodig om uit te blinken?

In tegenstelling tot CNN's gaan ViT's niet uit van lokaliteit of vertalingsinvariantie, dus moeten ze deze patronen leren uit grote hoeveelheden gegevens.

Wat is het doel van positionele coderingen in een Vision Transformer?

Zelfaandacht is order-agnostisch, dus positionele coderingen herstellen de ruimtelijke locatie van elke patch.

Welke uitspraak weerspiegelt het beste de impact van ViT op computer vision?

ViT heeft aangetoond dat een pure transformator, met voldoende data en schaalgrootte, de beste convolutionele netwerken kan evenaren of overtreffen.