屏蔽自动编码器
掩码自动编码器 (MAE) 是一种自监督方法,可教导视觉模型在大部分图片被隐藏后重建图像。
概述
By learning to fill in the blanks, the model builds rich visual understanding without any human labels.
深入探讨
蒙面自动编码器由 Kaiming He 和 Meta AI 的同事于 2021 年推出,它拍摄一张图像,将其分割成小块,然后随机隐藏其中很大一部分,通常是 75%。 Vision Transformer 编码器仅处理可见补丁,而轻量级解码器则尝试重建丢失补丁的原始像素。由于隐藏了太多内容,因此模型不能简单地复制附近的像素,并且必须学习有意义的结构,例如形状和物体部分。编码器跳过屏蔽补丁使训练速度更快并且内存效率更高。预训练后,解码器被丢弃,编码器强力转移到分类、检测和分割任务。
技术洞察
关键技巧是不对称性:重型编码器只能看到未屏蔽的 25% 的补丁,而小型解码器则重建其余部分。补丁被展平、线性嵌入并给出位置编码。重建损失是仅在掩模补丁上计算的均方误差,通常是在归一化像素值上计算的。高掩蔽比迫使语义学习而不是低级插值,并且与处理完整图像相比,在编码器剪切中跳过掩蔽标记的计算量显着增加。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
屏蔽自动编码器的未来
MAE 式的掩模重建正在成为跨模式的默认预训练方法。研究人员正在将其扩展到视频(隐藏时空立方体)、音频频谱图、医学扫描和卫星图像,这些领域的标签稀缺且昂贵。期望与多模态基础模型的语言更紧密地融合、更高效的解码器以及针对信息区域的自适应屏蔽。随着计算量的增长,对大量未标记图像集的屏蔽预训练应该会不断提高下游准确性,同时减少对昂贵的人工注释的依赖。
现实世界的实施
在数百万张未标记的照片上预训练 Vision Transformer,然后对其进行微调,以实现高精度的 ImageNet 分类
从未标记的医学扫描(X 射线、MRI)中学习特征,其中专家注释昂贵且有限
通过掩蔽时空补丁来预训练动作识别模型(VideoMAE),使该方法适应视频
对卫星和航空图像进行预训练,以支持土地利用测绘和变化检测,无需手动标签
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Autoencoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Masked Autoencoders?
掩码自动编码器 (MAE) 是一种自监督方法,可教导视觉模型在大部分图片被隐藏后重建图像。通过学习填补空白,该模型无需任何人类标签即可建立丰富的视觉理解。
掩码自动编码器中的核心自监督任务是什么?
MAE 隐藏了大多数图像块并训练模型来重建丢失的像素,不需要人工标签。
原始 MAE 通常会大致屏蔽掉图像块的多少部分?
原始 MAE 掩盖了大约 75% 的补丁,这个高比例迫使模型学习有意义的结构而不是复制邻居。
为什么 MAE 编码器只处理可见(未屏蔽)的补丁?
在编码器中跳过屏蔽标记大大减少了计算量和内存,因为它只处理一小部分补丁。
MAE 预训练完成后解码器会发生什么?
轻量级解码器只需要在预训练时进行重建;之后,学习到的编码器转移到检测等任务。
MAE 通常使用哪种损失函数进行重建?
MAE 最大限度地减少预测像素值和真实像素值之间的均方误差,仅在遮罩补丁上计算。