Vision Transformers
A Vision Transformers (ViTs) a ChatGPT transzformátor architektúrát alkalmazza a képekre, és a képet foltok sorozataként kezeli pixelrács helyett.
Áttekintés
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
Mély merülés
Évekig a konvolúciós neurális hálózatok (CNN-ek) uralták a számítógépes látást azáltal, hogy kis szűrőket szkenneltek át egy képen. A Google 2020-as, „An Image Is Worth 16x16 Words” című dolgozata megkérdőjelezte ezt azzal, hogy egy képet rögzített foltokra, jellemzően 16x16 pixelekre vágott, mindegyiket vektorokká lapította, és a kapott sorozatot betáplálta egy szabványos transzformátorba. Minden egyes folt „jelzővé” válik, hasonlóan egy szóhoz egy mondatban. A modell ezután önfigyelmet használ, így minden patch közvetlenül kapcsolódhat minden másik folthoz, rögzítve azokat a hosszú távú kapcsolatokat, amelyeket egy kis konvolúciós szűrő nem láthat egyetlen lépésben. A csapás: a ViT-ek adatéhesek, mert hiányoznak belőlük a CNN-ek beépített feltételezései. Hatalmas adathalmazokra, például a JFT-300M-re képezve a legjobb CNN-eket, vagy felülmúlták azokat, átalakítva a modern látáskutatást.
Technikai betekintés
A ViT felosztja a képet nem átfedő foltokra, mindegyiket lineárisan egy beágyazásba vetíti, és pozíciókódolást ad hozzá, így a modell tudja, hogy az egyes foltok hol helyezkedtek el az eredeti képen. Egy speciális tanulható 'osztályjelző' kerül elébe; végső ábrázolása az osztályozást hajtja végre. A halmozott önfigyelő rétegek lehetővé teszik, hogy minden javítás mérlegelje az összes többitől származó információkat, így globális befogadó mezőt biztosítanak az első rétegtől. Mivel a figyelem a foltok számával négyzetesen skálázódik, a nagy felbontású képek megdrágulnak, ezért számítanak a foltok mérete és a hatékony figyelemváltozatok.
Stratégiai hatás
Sebesség és méretarány
A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.
Építési lehetőségek
A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.
Csapat és munkafolyamat
A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.
A Vision Transformers jövője
A ViT-ek és a CNN-transzformátor hibridek ma már a vezető látórendszereket hajtják végre, az architektúra pedig olyan multimodális modelleket támaszt alá, amelyek a képeket szöveggel egyesítik, mint például a CLIP és a modern vision-nyelvi asszisztensek. Folyamatos munka várható a figyelem olcsóbbá tételén a nagy felbontású és a videózás terén, valamint az önfelügyelt előképzés (például maszkos képmodellezés), amely csökkenti a címkézett adatok iránti óriási étvágyat. A számítások növekedésével a „nyelvi modell” és a „látásmodell” közötti határ folyamatosan elmosódik, és a transzformátorok nem különálló speciális tervezések, hanem megosztott gerincként szolgálnak a modalitások között.
Valós megvalósítás
Google képosztályozási és keresési rangsoroló rendszerei, amelyek transzformátorgerinceket alkalmaztak, miután a ViT versenyképesnek bizonyult a CNN-ekkel
CLIP és más kép-szöveg modellek, amelyek ViT-t használnak a képek kódolására, így a fényképek és a feliratok egy megosztott térben egyeztethetők
Orvosi képalkotó kutatás ViT-eket használva, hogy a mintákat a teljes szkennelés során észlelje, nem csak a helyi textúrákon
Önvezető és robotikus érzékelési halmok, amelyek kombinálják a ViT-stílusú figyelmet a jelenet megértéséhez a teljes látómezőben
Kockázatok és védőkorlátok
A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.
A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.
A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.
Végrehajtási ütemterv
Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.
Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.
Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.
A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
CLIP és Vision-Language modellek
Gyakran ismételt kérdések
What is Vision Transformers?
A Vision Transformers (ViTs) a ChatGPT transzformátor architektúrát alkalmazza a képekre, és a képet foltok sorozataként kezeli pixelrács helyett. Bebizonyították, hogy a legmodernebb képfelismerés eléréséhez nincs szükség csavarodásokra.
Hogyan dolgozza fel először a Vision Transformer a bemeneti képet?
A ViT rögzített foltokra osztja fel a képet (gyakran 16x16 pixeles), mindegyik foltot tokenként beágyaz, és a szekvenciát egy transzformátorba táplálja.
Melyik kulcsmechanizmus teszi lehetővé, hogy a ViT a kép távoli részeit összekapcsolja egymással?
Az önfigyelem lehetővé teszi, hogy minden javítás közvetlenül mérlegelje az összes többi javítás információit, így globális képet ad az első rétegből.
Miért van szükségük a sima Vision Transformereknek nagyon nagy képzési adatkészletekre a kiváló teljesítményhez?
A CNN-ekkel ellentétben a ViT-k nem feltételezik a lokalitást vagy a fordítási invarianciát, ezért ezeket a mintákat nagy mennyiségű adatból kell megtanulniuk.
Mi a célja a helyzetkódolásoknak a Vision Transformerben?
Az önfigyelem rend-agnosztikus, így a pozíciókódolások visszaállítják az egyes foltok térbeli helyét.
Melyik állítás tükrözi legjobban a ViT számítógépes látásra gyakorolt hatását?
A ViT bebizonyította, hogy egy tiszta transzformátor elegendő adattal és léptékkel vetekedhet a legjobb konvolúciós hálózatokkal, vagy felülmúlhatja azokat.