ビジュアルAIガイド

マスクされたオートエンコーダ

マスクされたオートエンコーダー (MAE) は、画像の大部分が隠された後に画像を再構築するように視覚モデルに学習させる自己教師あり手法です。

2分の読書最終更新日

概要

By learning to fill in the blanks, the model builds rich visual understanding without any human labels.

ディープダイブ

2021 年に Meta AI の Kaiming He 氏と同僚によって導入されたマスクされたオートエンコーダーは、画像を取得し、それを小さなパッチに分割し、それらの非常に大きな部分 (多くの場合 75%) をランダムに隠します。 Vision Transformer エンコーダは目に見えるパッチのみを処理しますが、軽量デコーダは失われたパッチの元のピクセルを再構築しようとします。多くのものが隠されているため、モデルは近くのピクセルを単純にコピーすることはできず、形状やオブジェクトの部分などの意味のある構造を学習する必要があります。マスクされたパッチをスキップするエンコーダーにより、トレーニングが高速になり、メモリ効率が向上します。事前トレーニング後、デコーダーは破棄され、エンコーダーは分類、検出、およびセグメンテーションのタスクに強力に移行します。

技術的な洞察

重要なトリックは非対称性です。重いエンコーダーはマスクされていないパッチの 25% のみを認識し、小さなデコーダーは残りを再構築します。パッチは平坦化され、線形に埋め込まれ、位置エンコーディングが与えられます。再構成損失は、マスクされたパッチ上でのみ、通常は正規化されたピクセル値上で計算される平均二乗誤差です。マスキング率が高いと、低レベルの補間ではなくセマンティック学習が強制され、エンコーダーでマスクされたトークンをスキップすると、画像全体を処理する場合と比べて計算量が大幅に削減されます。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

マスクされたオートエンコーダの将来

MAE スタイルのマスクされた再構成は、モダリティ全体でデフォルトの事前トレーニング レシピになりつつあります。研究者らは、ラベルが希少で高価なビデオ (時空キューブを隠す)、オーディオ スペクトログラム、医療スキャン、および衛星画像にそれを拡張しています。マルチモーダル基盤モデル用の言語、より効率的なデコーダー、情報領域を対象とした適応マスキングとのより緊密な融合が期待されます。コンピューティングが増大するにつれて、ラベルのない巨大な画像コレクションに対するマスクされた事前トレーニングにより、コストのかかる人間によるアノテーションへの依存を減らしながら、ダウンストリームの精度が向上し続けるはずです。

現実世界の実装

数百万枚のラベルのない写真で Vision Transformer を事前トレーニングし、高い精度で ImageNet 分類できるように微調整します。

専門家の注釈が高価で制限されている、ラベルのない医療スキャン (X 線、MRI) から特徴を学習する

時空間パッチをマスクして動作認識モデルを事前トレーニングすることにより、この方法をビデオに適応させる (VideoMAE)

手動ラベルを使用せずに土地利用マッピングと変更検出をサポートするための衛星画像と航空画像の事前トレーニング

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

Muse マスクされたジェネレーティブ イメージング

よくある質問

What is Masked Autoencoders?

マスクされたオートエンコーダー (MAE) は、画像の大部分が隠された後に画像を再構築するように視覚モデルに学習させる自己教師あり手法です。空白を埋めることを学習することで、モデルは人間によるラベルなしで豊かな視覚的理解を構築します。

マスクされたオートエンコーダーの中心となる自己教師ありタスクは何ですか?

MAE はほとんどの画像パッチを非表示にし、失われたピクセルを再構築するようにモデルをトレーニングするため、人間によるラベルは必要ありません。

オリジナルの MAE は通常、イメージ パッチのどの部分をマスクしますか?

オリジナルの MAE はパッチの約 75% をマスクします。これは高い比率であり、モデルに隣接するものをコピーするのではなく、意味のある構造を学習させる必要があります。

MAE エンコーダが表示されている (マスクされていない) パッチのみを処理するのはなぜですか?

エンコーダーでマスクされたトークンをスキップすると、パッチのほんの一部しか処理されないため、コンピューティングとメモリが大幅に削減されます。

MAE の事前トレーニングが完了した後、デコーダーはどうなりますか?

軽量デコーダは、事前トレーニング中の再構築にのみ必要です。その後、学習されたエンコーダーは検出などのタスクに移行します。

MAE は通常、再構築にどの損失関数を使用しますか?

MAE は、マスクされたパッチ上でのみ計算される、予測されたピクセル値と真のピクセル値の間の平均二乗誤差を最小限に抑えます。