Vizuální průvodce AI

Vision Transformers

Vision Transformers (ViTs) aplikují na obrázky architekturu transformátoru, která pohání ChatGPT, přičemž s obrázkem zachází jako s posloupností políček namísto mřížky pixelů.

2 minuty čteníNaposledy aktualizováno

Přehled

Dokázali, že k dosažení špičkového rozpoznávání obrazu není potřeba konvoluce.

Hluboký ponor

Po celá léta dominovaly počítačovému vidění konvoluční neuronové sítě (CNN) skenováním malých filtrů přes obraz. Papír z roku 2020 „Obrázek stojí za 16x16 slov“ od Google to zpochybnil tím, že obrázek rozsekal na pevné pole, obvykle 16x16 pixelů, zploštil každý do vektoru a výslednou sekvenci vložil do standardního transformátoru. Každý patch se stává „tokenem“, podobně jako slovo ve větě. Model pak využívá vlastní pozornost, takže každý patch se může přímo vztahovat ke každému jinému patchi a zachycuje vztahy na dlouhé vzdálenosti, které malý konvoluční filtr v jednom kroku nevidí. Háček: ViTs jsou lační po datech, protože postrádají vestavěné předpoklady CNN. Byli vyškoleni na obrovských souborech dat, jako je JFT-300M, vyrovnali se nebo porazili nejlepší CNN a přetvořili moderní výzkum vize.

Technický přehled

ViT rozdělí obraz na nepřekrývající se záplaty, každou lineárně promítne do vložení a přidá poziční kódování, takže model ví, kde se každá záplata nacházela v původním obrazu. Předřazen je speciální naučitelný „žeton třídy“; jeho konečné zastoupení řídí klasifikaci. Naskládané vrstvy sebepozorování umožňují každému patchi vážit informace od všech ostatních, čímž poskytují globální vnímavé pole z první vrstvy. Vzhledem k tomu, že pozornost se kvadraticky mění s počtem políček, obrázky s vysokým rozlišením se stávají drahými, a proto na velikosti a efektivních variantách pozornosti záleží.

Strategický dopad

Rychlost a měřítko

Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.

Volby sestavy

Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.

Tým a pracovní postup

Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.

Budoucnost Vision Transformers

ViTs a hybridní transformátory CNN nyní pohánějí přední systémy vidění a architektura podporuje multimodální modely, které spojují obrázky s textem, jako je CLIP a moderní asistenti jazyka vidění. Očekávejte pokračující práce na zlevnění pozornosti u videa s vysokým rozlišením a videa a předtrénování s vlastním dohledem (jako je modelování maskovaného obrazu), které snižuje enormní touhu po označování dat. Jak roste výpočetní technika, hranice mezi „jazykovým modelem“ a „modelem vidění“ se stále stírá, přičemž transformátory slouží jako sdílená páteř napříč modalitami spíše než jako samostatné specializované návrhy.

Real-World Implementace

Systémy klasifikace obrázků a hodnocení vyhledávání Google, které přijaly páteřní transformátory poté, co ViT dokázal konkurovat CNN

CLIP a další modely obrázků a textu, které používají ViT ke kódování obrázků, takže fotografie a popisky mohou být porovnávány ve sdíleném prostoru

Lékařský zobrazovací výzkum využívající ViTs k rozpoznání vzorů v rámci celého skenování, nikoli pouze místních textur

Samořídící a robotické sady vnímání, které kombinují pozornost ve stylu ViT pro porozumění scéně v celém zorném poli

Rizika a zábradlí

Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.

Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.

Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.

Plán implementace

1

Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.

2

Testujte s daty, která odpovídají reálným výrobním podmínkám.

3

Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.

4

Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Modely CLIP a Vision-Language

Často kladené otázky

Co jsou Vision Transformers?

Vision Transformers (ViTs) aplikují na obrázky architekturu transformátoru, která pohání ChatGPT, přičemž s obrázkem zachází jako s posloupností políček namísto mřížky pixelů. Dokázali, že k dosažení nejmodernějšího rozpoznávání obrazu nepotřebujete konvoluce.

Jak Vision Transformer zpočátku zpracovává vstupní obraz?

ViT rozdělí obraz do pevných polí (často 16x16 pixelů), vloží každý patch jako token a přivede sekvenci do transformátoru.

Jaký klíčový mechanismus umožňuje ViT spojit vzdálené části obrazu k sobě navzájem?

Vlastní pozornost umožňuje každému patchi přímo vážit informace z každého druhého patche a poskytuje globální pohled z první vrstvy.

Proč plain Vision Transformers obvykle potřebují velmi velké tréninkové datové sady, aby vynikly?

Na rozdíl od CNN nepředpokládají ViT invariantnost lokality nebo překladu, takže se musí tyto vzorce učit z velkého množství dat.

Jaký je účel pozičního kódování ve Vision Transformer?

Vlastní pozornost je nezávislá na řádu, takže poziční kódování obnovuje prostorové umístění každého patche.

Které prohlášení nejlépe odráží vliv ViT na počítačové vidění?

ViT ukázal, že čistý transformátor s dostatečnými daty a rozsahem může konkurovat nebo překonat nejlepší konvoluční sítě.