屏蔽自動編碼器
遮罩自動編碼器 (MAE) 是一種自監督方法,可教導視覺模型在大部分圖片被隱藏後重建影像。
概述
By learning to fill in the blanks, the model builds rich visual understanding without any human labels.
深入探討
蒙面自動編碼器由 Kaiming He 和 Meta AI 的同事於 2021 年推出,它拍攝一張圖像,將其分割成小塊,然後隨機隱藏其中很大一部分,通常是 75%。 Vision Transformer 編碼器僅處理可見補丁,而輕量級解碼器則嘗試重建遺失補丁的原始像素。由於隱藏了太多內容,因此模型不能簡單地複製附近的像素,並且必須學習有意義的結構,例如形狀和物體部分。編碼器跳過屏蔽補丁使訓練速度更快並且記憶體效率更高。預訓練後,解碼器被丟棄,編碼器強力轉移到分類、偵測和分割任務。
技術洞察
關鍵技巧是不對稱性:重型編碼器只能看到未屏蔽的 25% 的補丁,而小型解碼器則重建其餘部分。補丁被展平、線性嵌入並給出位置編碼。重建損失是僅在遮罩補丁上計算的均方誤差,通常是在歸一化像素值上計算的。高掩蔽比迫使語義學習而不是低階插值,與處理完整影像相比,在編碼器剪切中跳過掩蔽標記的計算量顯著增加。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
屏蔽自動編碼器的未來
MAE 式的光罩重建正成為跨模式的預設預訓練方法。研究人員正在將其擴展到視訊(隱藏時空立方體)、音頻頻譜圖、醫學掃描和衛星影像,這些領域的標籤稀缺且昂貴。期望與多模態基礎模型的語言更緊密地融合、更有效率的解碼器以及針對資訊區域的自適應屏蔽。隨著計算量的增長,對大量未標記影像集的屏蔽預訓練應該會不斷提高下游準確性,同時減少對昂貴的人工註釋的依賴。
現實世界的實施
在數百萬張未標記的照片上預先訓練 Vision Transformer,然後對其進行微調,以實現高精度的 ImageNet 分類
從未標記的醫學掃描(X 射線、MRI)中學習特徵,其中專家註釋昂貴且有限
透過遮蔽時空補丁來預先訓練動作識別模型(VideoMAE),使該方法適應視頻
對衛星和航空圖像進行預訓練,以支援土地利用測繪和變化檢測,無需手動標籤
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Autoencoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Masked Autoencoders?
遮罩自動編碼器 (MAE) 是一種自監督方法,可教導視覺模型在大部分圖片被隱藏後重建影像。透過學習填補空白,該模型無需任何人類標籤即可建立豐富的視覺理解。
遮罩自動編碼器中的核心自監督任務是什麼?
MAE 隱藏了大多數影像區塊並訓練模型來重建遺失的像素,不需要人工標籤。
原始 MAE 通常會大致屏蔽掉影像區塊的多少部分?
原始 MAE 掩蓋了大約 75% 的補丁,這個高比例迫使模型學習有意義的結構而不是複製鄰居。
為什麼 MAE 編碼器只處理可見(未屏蔽)的補丁?
在編碼器中跳過屏蔽標記大大減少了計算量和內存,因為它只處理一小部分補丁。
MAE 預訓練完成後解碼器會發生什麼事?
輕量級解碼器只需要在預訓練時重建;之後,學習到的編碼器轉移到偵測等任務。
MAE 通常使用哪種損失函數進行重建?
MAE 最大限度地減少預測像素值和真實像素值之間的均方誤差,僅在遮罩補丁上計算。