Zamaskowane autoenkodery
Maskowane autoenkodery (MAE) to samonadzorowana metoda, która uczy model widzenia rekonstruowania obrazów po ukryciu większości obrazu.
Przegląd
By learning to fill in the blanks, the model builds rich visual understanding without any human labels.
Głębokie nurkowanie
Zamaskowane autoenkodery, wprowadzone przez Kaiminga He i współpracowników z Meta AI w 2021 r., robią zdjęcie, dzielą je na małe fragmenty i losowo ukrywają bardzo dużą ich część, często 75%. Koder Vision Transformer przetwarza tylko widoczne fragmenty, podczas gdy lekki dekoder próbuje zrekonstruować oryginalne piksele brakujących pikseli. Ponieważ tak wiele jest ukryte, model nie może po prostu skopiować pobliskich pikseli i musi nauczyć się znaczącej struktury, takiej jak kształty i części obiektów. Koder pomijający zamaskowane fragmenty sprawia, że trening jest szybki, a pamięć wydajna. Po wstępnym szkoleniu dekoder jest odrzucany, a koder w dużym stopniu przechodzi do zadań klasyfikacji, wykrywania i segmentacji.
Wgląd techniczny
Kluczową sztuczką jest asymetria: ciężki koder widzi tylko zdemaskowane 25% poprawek, podczas gdy mały dekoder rekonstruuje resztę. Poprawki są spłaszczane, osadzane liniowo i otrzymują kodowanie pozycyjne. Strata rekonstrukcji to błąd średniokwadratowy obliczany tylko na obszarach zamaskowanych, zazwyczaj na znormalizowanych wartościach pikseli. Wysokie współczynniki maskowania wymuszają uczenie się semantyczne, a nie interpolację na niskim poziomie, a pomijanie zamaskowanych tokenów w cięciach kodera znacznie zmniejsza wydajność obliczeniową w porównaniu z przetwarzaniem pełnego obrazu.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość zamaskowanych autoenkoderów
Rekonstrukcja zamaskowana w stylu MAE staje się domyślną receptą na trening przedtreningowy we wszystkich modalnościach. Naukowcy rozszerzają to na wideo (ukrywając kostki czasoprzestrzeni), spektrogramy audio, skany medyczne i zdjęcia satelitarne, w przypadku których etykiet jest niewiele i są drogie. Spodziewaj się ściślejszej fuzji z językiem w przypadku multimodalnych modeli podstawowych, wydajniejszych dekoderów i maskowania adaptacyjnego ukierunkowanego na regiony informacyjne. W miarę zwiększania się mocy obliczeniowej maskowane wstępne uczenie ogromnych kolekcji obrazów bez etykiet powinno w dalszym ciągu zwiększać dokładność dalszych operacji, jednocześnie zmniejszając zależność od kosztownych adnotacji wykonywanych przez człowieka.
Implementacja w świecie rzeczywistym
Wstępne uczenie transformatora wizyjnego na milionach nieoznakowanych zdjęć, a następnie dostrajanie go pod kątem klasyfikacji ImageNet z dużą dokładnością
Funkcje uczenia się na podstawie nieoznakowanych skanów medycznych (prześwietlenia rentgenowskie, rezonans magnetyczny), w przypadku których adnotacje eksperckie są drogie i ograniczone
Dostosowanie metody do wideo poprzez maskowanie fragmentów czasoprzestrzeni w celu wstępnego szkolenia modeli rozpoznawania akcji (VideoMAE)
Wstępne szkolenie na zdjęciach satelitarnych i lotniczych w celu wsparcia mapowania zagospodarowania przestrzennego i wykrywania zmian bez ręcznych etykiet
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Autoencoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Maskowane obrazowanie generatywne Muse
Często zadawane pytania
What is Masked Autoencoders?
Maskowane autoenkodery (MAE) to samonadzorowana metoda, która uczy model widzenia rekonstruowania obrazów po ukryciu większości obrazu. Ucząc się wypełniać puste miejsca, model buduje bogate zrozumienie wizualne bez żadnych ludzkich etykiet.
Jakie jest podstawowe zadanie samonadzorowane w maskowanym autoenkoderze?
MAE ukrywa większość fragmentów obrazu i uczy model rekonstrukcji brakujących pikseli, nie wymagając ludzkich etykiet.
Mniej więcej, jaką część plam obrazu zwykle maskuje oryginalny MAE?
Oryginalne MAE maskuje około 75% poprawek, co stanowi wysoki współczynnik, który zmusza model do uczenia się znaczącej struktury zamiast kopiowania sąsiadów.
Dlaczego koder MAE przetwarza tylko widoczne (niezamaskowane) poprawki?
Pomijanie zamaskowanych tokenów w koderze znacznie zmniejsza moc obliczeniową i pamięć, ponieważ obsługuje on tylko niewielką część poprawek.
Co dzieje się z dekoderem po zakończeniu wstępnego uczenia MAE?
Lekki dekoder jest potrzebny tylko do rekonstrukcji podczas treningu wstępnego; następnie wyuczony koder przechodzi do zadań takich jak wykrywanie.
Jakiej funkcji straty MAE zwykle używa do rekonstrukcji?
MAE minimalizuje błąd średniokwadratowy pomiędzy przewidywanymi i rzeczywistymi wartościami pikseli, obliczony tylko na zamaskowanych obszarach.