Vizuális MI ÚTMUTATÓ

Vision Transformers

A Vision Transformers (ViTs) a ChatGPT transzformátor architektúrát alkalmazza a képekre, és a képet foltok sorozataként kezeli pixelrács helyett.

2 perc olvasásUtoljára frissítve

Áttekintés

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

Mély merülés

Évekig a konvolúciós neurális hálózatok (CNN-ek) uralták a számítógépes látást azáltal, hogy kis szűrőket szkenneltek át egy képen. A Google 2020-as, „An Image Is Worth 16x16 Words” című dolgozata megkérdőjelezte ezt azzal, hogy egy képet rögzített foltokra, jellemzően 16x16 pixelekre vágott, mindegyiket vektorokká lapította, és a kapott sorozatot betáplálta egy szabványos transzformátorba. Minden egyes folt „jelzővé” válik, hasonlóan egy szóhoz egy mondatban. A modell ezután önfigyelmet használ, így minden patch közvetlenül kapcsolódhat minden másik folthoz, rögzítve azokat a hosszú távú kapcsolatokat, amelyeket egy kis konvolúciós szűrő nem láthat egyetlen lépésben. A csapás: a ViT-ek adatéhesek, mert hiányoznak belőlük a CNN-ek beépített feltételezései. Hatalmas adathalmazokra, például a JFT-300M-re képezve a legjobb CNN-eket, vagy felülmúlták azokat, átalakítva a modern látáskutatást.

Technikai betekintés

A ViT felosztja a képet nem átfedő foltokra, mindegyiket lineárisan egy beágyazásba vetíti, és pozíciókódolást ad hozzá, így a modell tudja, hogy az egyes foltok hol helyezkedtek el az eredeti képen. Egy speciális tanulható 'osztályjelző' kerül elébe; végső ábrázolása az osztályozást hajtja végre. A halmozott önfigyelő rétegek lehetővé teszik, hogy minden javítás mérlegelje az összes többitől származó információkat, így globális befogadó mezőt biztosítanak az első rétegtől. Mivel a figyelem a foltok számával négyzetesen skálázódik, a nagy felbontású képek megdrágulnak, ezért számítanak a foltok mérete és a hatékony figyelemváltozatok.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A Vision Transformers jövője

A ViT-ek és a CNN-transzformátor hibridek ma már a vezető látórendszereket hajtják végre, az architektúra pedig olyan multimodális modelleket támaszt alá, amelyek a képeket szöveggel egyesítik, mint például a CLIP és a modern vision-nyelvi asszisztensek. Folyamatos munka várható a figyelem olcsóbbá tételén a nagy felbontású és a videózás terén, valamint az önfelügyelt előképzés (például maszkos képmodellezés), amely csökkenti a címkézett adatok iránti óriási étvágyat. A számítások növekedésével a „nyelvi modell” és a „látásmodell” közötti határ folyamatosan elmosódik, és a transzformátorok nem különálló speciális tervezések, hanem megosztott gerincként szolgálnak a modalitások között.

Valós megvalósítás

Google képosztályozási és keresési rangsoroló rendszerei, amelyek transzformátorgerinceket alkalmaztak, miután a ViT versenyképesnek bizonyult a CNN-ekkel

CLIP és más kép-szöveg modellek, amelyek ViT-t használnak a képek kódolására, így a fényképek és a feliratok egy megosztott térben egyeztethetők

Orvosi képalkotó kutatás ViT-eket használva, hogy a mintákat a teljes szkennelés során észlelje, nem csak a helyi textúrákon

Önvezető és robotikus érzékelési halmok, amelyek kombinálják a ViT-stílusú figyelmet a jelenet megértéséhez a teljes látómezőben

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

CLIP és Vision-Language modellek

Gyakran ismételt kérdések

What is Vision Transformers?

A Vision Transformers (ViTs) a ChatGPT transzformátor architektúrát alkalmazza a képekre, és a képet foltok sorozataként kezeli pixelrács helyett. Bebizonyították, hogy a legmodernebb képfelismerés eléréséhez nincs szükség csavarodásokra.

Hogyan dolgozza fel először a Vision Transformer a bemeneti képet?

A ViT rögzített foltokra osztja fel a képet (gyakran 16x16 pixeles), mindegyik foltot tokenként beágyaz, és a szekvenciát egy transzformátorba táplálja.

Melyik kulcsmechanizmus teszi lehetővé, hogy a ViT a kép távoli részeit összekapcsolja egymással?

Az önfigyelem lehetővé teszi, hogy minden javítás közvetlenül mérlegelje az összes többi javítás információit, így globális képet ad az első rétegből.

Miért van szükségük a sima Vision Transformereknek nagyon nagy képzési adatkészletekre a kiváló teljesítményhez?

A CNN-ekkel ellentétben a ViT-k nem feltételezik a lokalitást vagy a fordítási invarianciát, ezért ezeket a mintákat nagy mennyiségű adatból kell megtanulniuk.

Mi a célja a helyzetkódolásoknak a Vision Transformerben?

Az önfigyelem rend-agnosztikus, így a pozíciókódolások visszaállítják az egyes foltok térbeli helyét.

Melyik állítás tükrözi legjobban a ViT számítógépes látásra gyakorolt hatását?

A ViT bebizonyította, hogy egy tiszta transzformátor elegendő adattal és léptékkel vetekedhet a legjobb konvolúciós hálózatokkal, vagy felülmúlhatja azokat.