Визуальное руководство по искусственному интеллекту

Маскированные автоэнкодеры

Маскированные автоэнкодеры (MAE) — это метод самоконтроля, который учит модель зрения восстанавливать изображения после того, как большая часть изображения была скрыта.

2 минуты чтенияПоследнее обновление

Обзор

Учась заполнять пробелы, модель формирует глубокое визуальное понимание без человеческих ярлыков.

Глубокое погружение

Автоэнкодеры в маске, представленные Каймином Хэ и его коллегами из Meta AI в 2021 году, берут изображение, разбивают его на небольшие фрагменты и случайным образом скрывают очень большую их часть, часто 75%. Кодер Vision Transformer обрабатывает только видимые участки, а облегченный декодер пытается восстановить исходные пиксели недостающих пикселей. Поскольку так много скрыто, модель не может просто копировать близлежащие пиксели и должна изучить осмысленную структуру, например формы и части объектов. Кодировщик пропускает замаскированные патчи, что ускоряет обучение и позволяет эффективно использовать память. После предварительного обучения декодер отбрасывается, а кодер переходит к задачам классификации, обнаружения и сегментации.

Техническая информация

Ключевой трюк — асимметрия: тяжелый кодер видит только немаскированные 25% патчей, тогда как маленький декодер реконструирует остальные. Патчи сглажены, линейно встроены и имеют позиционную кодировку. Потери при реконструкции представляют собой среднеквадратичную ошибку, вычисляемую только для замаскированных участков, обычно для нормализованных значений пикселей. Высокие коэффициенты маскирования требуют семантического обучения, а не низкоуровневой интерполяции, а пропуск маскированных токенов в кодировщике существенно сокращает вычислительные затраты по сравнению с обработкой всего изображения.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее маскированных автоэнкодеров

Маскированная реконструкция в стиле MAE становится рецептом предварительной подготовки по умолчанию для всех модальностей. Исследователи распространяют его на видео (скрывающие кубы пространства-времени), аудиоспектрограммы, медицинские снимки и спутниковые снимки, где меток мало и они дороги. Ожидайте более тесного слияния с языком для мультимодальных базовых моделей, более эффективных декодеров и адаптивного маскирования, нацеленного на информативные области. По мере роста вычислительных ресурсов предварительная подготовка в масках на огромных немаркированных коллекциях изображений должна продолжать повышать точность последующих операций, одновременно уменьшая зависимость от дорогостоящих аннотаций, выполняемых человеком.

Реальная реализация

Предварительное обучение Vision Transformer на миллионах немаркированных фотографий, а затем точная настройка его для классификации ImageNet с высокой точностью.

Возможности обучения на немаркированных медицинских снимках (рентгеновские снимки, МРТ), где экспертные аннотации дороги и ограничены.

Адаптация метода к видео путем маскировки пространственно-временных фрагментов для предварительного обучения моделей распознавания действий (VideoMAE)

Предварительное обучение работе со спутниковыми и аэрофотоснимками для поддержки картирования землепользования и обнаружения изменений без маркировки вручную.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Генеративная визуализация под маской Muse

Часто задаваемые вопросы

Что такое Masked Autoencoders?

Маскированные автоэнкодеры (MAE) — это метод самоконтроля, который учит модель зрения восстанавливать изображения после того, как большая часть изображения была скрыта. Научившись заполнять пробелы, модель создает богатое визуальное понимание без каких-либо человеческих ярлыков.

Какова основная задача самоконтроля в масочном автоэнкодере?

MAE скрывает большинство фрагментов изображения и обучает модель восстанавливать недостающие пиксели, не требуя никаких человеческих меток.

Какую примерно часть фрагментов изображения обычно маскирует исходный MAE?

Исходный MAE маскирует около 75% патчей — высокий коэффициент, который заставляет модель изучать значимую структуру, а не копировать соседей.

Почему кодер MAE обрабатывает только видимые (немаскированные) фрагменты?

Пропуск замаскированных токенов в кодировщике значительно сокращает вычислительные ресурсы и память, поскольку он обрабатывает лишь небольшую часть исправлений.

Что происходит с декодером после завершения предварительного обучения MAE?

Облегченный декодер необходим только для реконструкции во время предварительного обучения; после этого обученный кодер переходит к таким задачам, как обнаружение.

Какую функцию потерь MAE обычно использует для реконструкции?

MAE минимизирует среднеквадратическую ошибку между прогнозируемыми и истинными значениями пикселей, вычисляемую только на замаскированных участках.