Визия Трансформърс
Vision Transformers (ViTs) прилага трансформаторната архитектура, която захранва ChatGPT към изображения, като третира картината като последователност от кръпки вместо решетка от пиксели.
Преглед
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
Дълбоко гмуркане
Години наред конволюционните невронни мрежи (CNN) доминираха в компютърното зрение чрез сканиране на малки филтри върху изображение. Документът от 2020 г. „Изображението струва 16x16 думи“ от Google оспорва това, като нарязва изображение на фиксирани кръпки, обикновено 16x16 пиксела, сплесквайки всеки във вектор и подавайки получената последователност в стандартен трансформатор. Всеки пластир се превръща в „токен“, подобно на дума в изречение. След това моделът използва самовнимание, така че всяка кръпка може директно да се свърже с всяка друга кръпка, улавяйки дългосрочни връзки, които малък конволюционен филтър не може да види в една стъпка. Уловката: ViT са жадни за данни, защото им липсват вградените предположения на CNN. Обучени на огромни набори от данни като JFT-300M, те съвпадаха или победиха най-добрите CNN, променяйки модерните изследвания на зрението.
Техническа информация
ViT разделя изображение на незастъпващи се петна, линейно проектира всеки във вграждане и добавя позиционни кодирания, така че моделът да знае къде се е намирал всеки пластир в оригиналното изображение. Добавя се специален „токен на клас“, който може да се обучава; неговото окончателно представяне води до класификация. Подредените слоеве за самовнимание позволяват на всеки пластир да претегля информация от всички останали, давайки глобално възприемчиво поле от първи слой. Тъй като вниманието се мащабира квадратично с броя на кръпките, изображенията с висока разделителна способност стават скъпи, поради което размерът на кръпката и ефективните варианти на внимание имат значение.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на визуалните трансформатори
ViTs и CNN-трансформаторни хибриди сега захранват водещи визуални системи, а архитектурата е в основата на мултимодални модели, които сливат изображения с текст, като CLIP и модерни асистенти за визуален език. Очаквайте продължителна работа за по-евтино привличане на внимание за висока разделителна способност и видео, плюс самоконтролирано предварително обучение (като моделиране на маскирани изображения), което намалява огромния апетит за етикетирани данни. С нарастването на изчисленията границата между „езиков модел“ и „визионен модел“ продължава да се размива, като трансформаторите служат като споделен гръбнак между модалностите, а не отделни специализирани дизайни.
Внедряване в реалния свят
Системите за класификация на изображения и класиране при търсене на Google, които приеха трансформаторни гръбнаци след ViT, се оказаха конкурентни на CNN
CLIP и други модели на изображение и текст, които използват ViT за кодиране на изображения, така че снимките и надписите да могат да бъдат съпоставени в споделено пространство
Изследване на медицински образи, използващо ViTs за откриване на модели в цялото сканиране, а не само в локални текстури
Стекове за самостоятелно шофиране и роботизирано възприятие, които комбинират внимание в стил ViT за разбиране на сцената в цялото зрително поле
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
CLIP и Vision-Language модели
Frequently asked questions
What is Vision Transformers?
Vision Transformers (ViTs) прилага трансформаторната архитектура, която захранва ChatGPT към изображения, като третира картината като последователност от кръпки вместо решетка от пиксели. Те доказаха, че нямате нужда от навивки, за да постигнете най-съвременното разпознаване на изображения.
Как Vision Transformer първоначално обработва входно изображение?
ViT разделя изображението на фиксирани кръпки (често 16x16 пиксела), вгражда всяка кръпка като токен и захранва последователността в трансформатор.
Какъв ключов механизъм позволява на ViT да свърже отдалечени части от изображение една с друга?
Самовниманието позволява на всеки пач директно да претегля информацията от всеки друг пач, като дава глобален изглед от първия слой.
Защо Plain Vision Transformers обикновено се нуждаят от много големи набори от данни за обучение, за да превъзхождат?
За разлика от CNN, ViT не предполага локалност или инвариантност на превода, така че трябва да научат тези модели от големи количества данни.
Каква е целта на позиционните кодировки във Vision Transformer?
Самовниманието не зависи от реда, така че позиционните кодировки възстановяват пространственото местоположение на всеки пластир.
Кое твърдение най-добре отразява въздействието на ViT върху компютърното зрение?
ViT демонстрира, че един чист трансформатор с достатъчно данни и мащаб може да съперничи или да надмине най-добрите конволюционни мрежи.