Видение Трансформеры
Vision Transformers (ViTs) применяют архитектуру преобразователя, которая обеспечивает ChatGPT к изображениям, рассматривая изображение как последовательность патчей, а не как сетку пикселей.
Обзор
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
Глубокое погружение
В течение многих лет сверточные нейронные сети (CNN) доминировали в компьютерном зрении, сканируя изображение небольшими фильтрами. Статья 2020 года «Изображение стоит 16x16 слов» от Google поставила под сомнение эту задачу, разбивая изображение на фиксированные фрагменты, обычно размером 16x16 пикселей, сглаживая каждый из них в вектор и передавая полученную последовательность в стандартный преобразователь. Каждый патч становится «токеном», во многом похожим на слово в предложении. Затем модель использует самообслуживание, поэтому каждый патч может напрямую относиться к любому другому патчу, фиксируя долгосрочные связи, которые небольшой сверточный фильтр не может увидеть за один шаг. Подвох: ViT жаждут данных, потому что им не хватает встроенных предположений CNN. Обученные на огромных наборах данных, таких как JFT-300M, они сравнялись или превзошли лучшие CNN, изменив современные исследования зрения.
Техническая информация
ViT разбивает изображение на непересекающиеся фрагменты, линейно проецирует каждый из них во встраивание и добавляет позиционные кодировки, чтобы модель знала, где находится каждый фрагмент в исходном изображении. В начале добавляется специальный обучаемый «токен класса»; его окончательное представление определяет классификацию. Слои самообслуживания, расположенные друг над другом, позволяют каждому патчу взвешивать информацию от всех остальных, создавая глобальное восприимчивое поле первого слоя. Поскольку внимание масштабируется квадратично с количеством патчей, изображения с высоким разрешением становятся дорогими, поэтому размер патча и варианты эффективного внимания имеют значение.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее видеотрансформаторов
Гибриды ViT и CNN-трансформатора теперь лежат в основе ведущих систем машинного зрения, а эта архитектура лежит в основе мультимодальных моделей, которые объединяют изображения с текстом, таких как CLIP и современные помощники на языке видения. Ожидайте продолжения работы по удешевлению внимания к видео высокого разрешения и видео, а также предварительному обучению с самоконтролем (например, моделирование замаскированных изображений), которое снижает огромный аппетит к размеченным данным. По мере роста вычислений грань между «языковой моделью» и «моделью видения» продолжает стираться: преобразователи служат общей основой для всех модальностей, а не отдельными специализированными конструкциями.
Реальная реализация
Системы классификации изображений и поискового ранжирования Google, которые приняли на вооружение магистрали-трансформеры после того, как ViT доказала свою конкурентоспособность по сравнению с CNN.
CLIP и другие модели изображения и текста, которые используют ViT для кодирования изображений, чтобы фотографии и подписи можно было сопоставлять в общем пространстве.
Исследования в области медицинской визуализации с использованием ViT для выявления закономерностей по всему сканированию, а не только по локальным текстурам.
Стеки восприятия беспилотного вождения и робототехники, которые сочетают в себе внимание в стиле ViT для понимания сцены по всему полю обзора.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
CLIP и модели визуального языка
Часто задаваемые вопросы
What is Vision Transformers?
Vision Transformers (ViTs) применяют архитектуру преобразователя, которая обеспечивает ChatGPT к изображениям, рассматривая изображение как последовательность патчей, а не как сетку пикселей. Они доказали, что для достижения современного распознавания изображений не нужны свертки.
Как Vision Transformer первоначально обрабатывает входное изображение?
ViT делит изображение на фиксированные фрагменты (часто 16x16 пикселей), встраивает каждый фрагмент как токен и передает последовательность в преобразователь.
Какой ключевой механизм позволяет ViT связывать удаленные части изображения друг с другом?
Самообслуживание позволяет каждому патчу напрямую взвешивать информацию из каждого другого патча, обеспечивая глобальное представление с первого уровня.
Почему для достижения успеха простым Vision Transformers обычно требуются очень большие наборы обучающих данных?
В отличие от CNN, ViT не предполагают локальности или трансляционной инвариантности, поэтому им приходится изучать эти закономерности на больших объемах данных.
Какова цель позиционного кодирования в Vision Transformer?
Самообслуживание не зависит от порядка, поэтому позиционное кодирование восстанавливает пространственное положение каждого патча.
Какое утверждение лучше всего отражает влияние ViT на компьютерное зрение?
ВИТ продемонстрировал, что чистый преобразователь при наличии достаточных данных и масштаба может конкурировать или превосходить лучшие сверточные сети.