Vision Transformers
Vision Transformers (ViTs) aplikují na obrázky architekturu transformátoru, která pohání ChatGPT, přičemž s obrázkem zachází jako s posloupností políček namísto mřížky pixelů.
Přehled
Dokázali, že k dosažení špičkového rozpoznávání obrazu není potřeba konvoluce.
Hluboký ponor
Po celá léta dominovaly počítačovému vidění konvoluční neuronové sítě (CNN) skenováním malých filtrů přes obraz. Papír z roku 2020 „Obrázek stojí za 16x16 slov“ od Google to zpochybnil tím, že obrázek rozsekal na pevné pole, obvykle 16x16 pixelů, zploštil každý do vektoru a výslednou sekvenci vložil do standardního transformátoru. Každý patch se stává „tokenem“, podobně jako slovo ve větě. Model pak využívá vlastní pozornost, takže každý patch se může přímo vztahovat ke každému jinému patchi a zachycuje vztahy na dlouhé vzdálenosti, které malý konvoluční filtr v jednom kroku nevidí. Háček: ViTs jsou lační po datech, protože postrádají vestavěné předpoklady CNN. Byli vyškoleni na obrovských souborech dat, jako je JFT-300M, vyrovnali se nebo porazili nejlepší CNN a přetvořili moderní výzkum vize.
Technický přehled
ViT rozdělí obraz na nepřekrývající se záplaty, každou lineárně promítne do vložení a přidá poziční kódování, takže model ví, kde se každá záplata nacházela v původním obrazu. Předřazen je speciální naučitelný „žeton třídy“; jeho konečné zastoupení řídí klasifikaci. Naskládané vrstvy sebepozorování umožňují každému patchi vážit informace od všech ostatních, čímž poskytují globální vnímavé pole z první vrstvy. Vzhledem k tomu, že pozornost se kvadraticky mění s počtem políček, obrázky s vysokým rozlišením se stávají drahými, a proto na velikosti a efektivních variantách pozornosti záleží.
Strategický dopad
Rychlost a měřítko
Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.
Volby sestavy
Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.
Tým a pracovní postup
Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.
Budoucnost Vision Transformers
ViTs a hybridní transformátory CNN nyní pohánějí přední systémy vidění a architektura podporuje multimodální modely, které spojují obrázky s textem, jako je CLIP a moderní asistenti jazyka vidění. Očekávejte pokračující práce na zlevnění pozornosti u videa s vysokým rozlišením a videa a předtrénování s vlastním dohledem (jako je modelování maskovaného obrazu), které snižuje enormní touhu po označování dat. Jak roste výpočetní technika, hranice mezi „jazykovým modelem“ a „modelem vidění“ se stále stírá, přičemž transformátory slouží jako sdílená páteř napříč modalitami spíše než jako samostatné specializované návrhy.
Real-World Implementace
Systémy klasifikace obrázků a hodnocení vyhledávání Google, které přijaly páteřní transformátory poté, co ViT dokázal konkurovat CNN
CLIP a další modely obrázků a textu, které používají ViT ke kódování obrázků, takže fotografie a popisky mohou být porovnávány ve sdíleném prostoru
Lékařský zobrazovací výzkum využívající ViTs k rozpoznání vzorů v rámci celého skenování, nikoli pouze místních textur
Samořídící a robotické sady vnímání, které kombinují pozornost ve stylu ViT pro porozumění scéně v celém zorném poli
Rizika a zábradlí
Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.
Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.
Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.
Plán implementace
Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.
Testujte s daty, která odpovídají reálným výrobním podmínkám.
Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.
Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Modely CLIP a Vision-Language
Často kladené otázky
Co jsou Vision Transformers?
Vision Transformers (ViTs) aplikují na obrázky architekturu transformátoru, která pohání ChatGPT, přičemž s obrázkem zachází jako s posloupností políček namísto mřížky pixelů. Dokázali, že k dosažení nejmodernějšího rozpoznávání obrazu nepotřebujete konvoluce.
Jak Vision Transformer zpočátku zpracovává vstupní obraz?
ViT rozdělí obraz do pevných polí (často 16x16 pixelů), vloží každý patch jako token a přivede sekvenci do transformátoru.
Jaký klíčový mechanismus umožňuje ViT spojit vzdálené části obrazu k sobě navzájem?
Vlastní pozornost umožňuje každému patchi přímo vážit informace z každého druhého patche a poskytuje globální pohled z první vrstvy.
Proč plain Vision Transformers obvykle potřebují velmi velké tréninkové datové sady, aby vynikly?
Na rozdíl od CNN nepředpokládají ViT invariantnost lokality nebo překladu, takže se musí tyto vzorce učit z velkého množství dat.
Jaký je účel pozičního kódování ve Vision Transformer?
Vlastní pozornost je nezávislá na řádu, takže poziční kódování obnovuje prostorové umístění každého patche.
Které prohlášení nejlépe odráží vliv ViT na počítačové vidění?
ViT ukázal, že čistý transformátor s dostatečnými daty a rozsahem může konkurovat nebo překonat nejlepší konvoluční sítě.