РЪКОВОДСТВО за визуален AI

Маскирани автоенкодери

Маскираните автоенкодери (MAE) са самоконтролиран метод, който учи визуален модел да реконструира изображения, след като по-голямата част от картината е била скрита.

2 min readПоследна актуализация

Преглед

By learning to fill in the blanks, the model builds rich visual understanding without any human labels.

Дълбоко гмуркане

Маскираните автоенкодери, представени от Kaiming He и колегите му от Meta AI през 2021 г., правят изображение, разделят го на малки части и произволно скриват много голяма част от тях, често 75%. Енкодер Vision Transformer обработва само видимите петна, докато олекотен декодер се опитва да възстанови оригиналните пиксели на липсващите. Тъй като толкова много е скрито, моделът не може просто да копира близките пиксели и трябва да научи смислена структура, като форми и части на обекти. Енкодерът, който пропуска маскирани пачове, прави обучението бързо и паметта ефективна. След предварително обучение декодерът се изхвърля и енкодерът се прехвърля силно към задачи за класификация, откриване и сегментиране.

Техническа информация

Ключовият трик е асиметрията: тежкият енкодер вижда само немаскираните 25% от пачовете, докато малък декодер реконструира останалите. Пачовете са сплескани, линейно вградени и им се дава позиционно кодиране. Загубата при реконструкция е средна квадратна грешка, изчислена само върху маскирани петна, обикновено върху нормализирани стойности на пиксели. Високите коефициенти на маскиране принуждават семантично обучение, а не интерполация на ниско ниво, а пропускането на маскирани токени в енкодера намалява драстично изчисленията в сравнение с обработката на цялото изображение.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на маскираните автоенкодери

Маскираната реконструкция в стил MAE се превръща в рецепта по подразбиране за предварителна тренировка във всички модалности. Изследователите го разширяват до видео (скриване на кубове пространство-време), аудио спектрограми, медицински сканирания и сателитни изображения, където етикетите са оскъдни и скъпи. Очаквайте по-тясно сливане с език за мултимодални базови модели, по-ефективни декодери и адаптивно маскиране, което е насочено към информативни региони. С нарастването на изчисленията, маскираното предварително обучение върху огромни немаркирани колекции от изображения трябва да продължи да подобрява точността надолу по веригата, като същевременно намалява зависимостта от скъпоструваща човешка анотация.

Внедряване в реалния свят

Предварително обучение на Vision Transformer върху милиони немаркирани снимки, след което фина настройка за класификация на ImageNet със силна точност

Функции за обучение от немаркирани медицински сканирания (рентгенови лъчи, ЯМР), където експертната анотация е скъпа и ограничена

Адаптиране на метода към видео чрез маскиране на пространствено-времеви кръпки към модели за разпознаване на действие преди обучение (VideoMAE)

Предварително обучение за сателитни и въздушни изображения за поддръжка на картографиране на земеползването и откриване на промени без ръчни етикети

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Muse Masked Generative Imaging

Frequently asked questions

What is Masked Autoencoders?

Маскираните автоенкодери (MAE) са самоконтролиран метод, който учи визуален модел да реконструира изображения, след като по-голямата част от картината е била скрита. Като се научи да попълва празните места, моделът изгражда богато визуално разбиране без човешки етикети.

Каква е основната самоконтролирана задача в маскиран автоенкодер?

MAE скрива повечето кръпки на изображението и обучава модела да реконструира липсващите пиксели, като не изисква човешки етикети.

Приблизително каква част от кръпките на изображението обикновено маскира оригиналният MAE?

Оригиналният MAE маскира около 75% от пачовете, високо съотношение, което принуждава модела да научи смислена структура, вместо да копира съседи.

Защо MAE енкодерът обработва само видимите (немаскирани) пачове?

Пропускането на маскирани токени в енкодера значително намалява изчисленията и паметта, тъй като той обработва само малка част от пачовете.

Какво се случва с декодера след завършване на предварителното обучение на MAE?

Лекият декодер е необходим само за реконструкция по време на предварително обучение; след това наученият енкодер се прехвърля към задачи като откриване.

Коя функция на загуба обикновено използва MAE за реконструкция?

MAE минимизира средната квадратна грешка между предвидените и истинските стойности на пикселите, изчислена само върху маскираните петна.