ビジュアルAIガイド

何でもモデルをセグメント化する

Segment Anything Model (SAM) は、Meta AI の画像セグメンテーションの基礎モデルです。点、ボックス、または大まかなヒントが与えられると、対応するオブジェクトの輪郭が瞬時に表示されます。

2分の読書最終更新日

概要

It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.

ディープダイブ

Meta AI によって 2023 年にリリースされた SAM は、セグメンテーションをプロンプト可能な問題として再構成します。プロンプト (クリック、ボックス、マスク、またはテキスト由来のヒント) を与えると、1 つ以上のオブジェクト マスクが返されます。そのパワーの一部はスケールによるものです。SA​​-1B は、モデルインザループ アノテーション エンジンで構築された 1,100 万枚の画像にわたる 10 億を超えるマスクのデータセットでトレーニングされました。アーキテクチャ的には、SAM には画像ごとに 1 回実行される重い画像エンコーダ、軽量のプロンプト エンコーダ、および高速マスク デコーダがあるため、単一の埋め込み画像をリアルタイムで対話的に再プロンプトできます。多くのタスクへのゼロショット転送が可能になります。 2024 年にリリースされた SAM 2 は、これをビデオに拡張し、フレーム全体でオブジェクトを追跡します。

技術的な洞察

SAM は、Vision Transformer (ViT) 画像エンコーダーを使用し、多くの場合、マスクされた自動エンコーディングで事前トレーニングされ、高密度の画像埋め込みを生成します。プロンプトはトークンにエンコードされ、クロスアテンションを備えたトランスフォーマーベースのデコーダーは、プロンプトトークンと画像埋め込みを融合してマスクと信頼スコアを出力します。曖昧さを解決するために (クリックはボタン、シャツ、または人を意味する可能性があります)、SAM は複数の有効なマスクを一度に予測してランク付けし、下流での使用または追加のプロンプトの曖昧さを解消します。

戦略的影響

速度とスケール

Visual AI は、検査、検出、タグ付けタスクを大規模に自動化できます。

ビルドの選択

クリエイティブ チームは、手動での修正を減らし、より迅速にコンセプトのプロトタイプを作成できます。

チームとワークフロー

以前は処理が困難であった画像信号やビデオ信号を操作に使用できるようになります。

セグメント何でもモデルの未来

SAM は、アノテーション ツール、医療画像処理、ロボット工学、AR パイプラインのデフォルトのバックボーンとなっており、多くの場合、オープンボキャブラリーの「名前によるセグメント化」ワークフロー用の検出器やテキスト モデルと組み合わせられています。デバイス上で使用するための軽量で高速なバリアント (MobileSAM、EfficientSAM)、完全なテキスト駆動型セグメンテーションのための言語とのより深い統合、およびビデオと 3D への継続的な拡張が期待されます。基礎モデルとして、その埋め込みは、他のシステムに供給する認識層として再利用されることが増えています。

現実世界の実装

画像注釈プラットフォームは SAM を使用して、ラベラーが 1 回クリックするだけで正確なオブジェクト マスクを自動生成できるようにし、ラベリング時間を大幅に短縮します。

研究者は、CT および MRI スキャンで臓器や腫瘍の輪郭を描くために SAM (MedSAM など) を適応させています。

写真およびビデオエディタには SAM が統合されており、ワンクリックで被写体を切り取ったり、背景を削除したりできます。

SAM 2 は、AR 効果とロボット認識のために、ビデオ フレーム全体でオブジェクトを追跡およびセグメント化します。

リスクとガードレール

出所が不明瞭な場合、肖像権と同意が法的リスクとなる可能性があります。

モデルのパフォーマンスは、照明、人口統計、環境によって異なる場合があります。

信頼度のしきい値が監視されない限り、誤検知は気付かれない可能性があります。

実装ロードマップ

1

精度、再現率、エラーコストの許容基準を定義します。

2

実際の生産条件に一致するデータを使用してテストします。

3

信頼性の低い予測や影響の大きい予測については、人間によるレビューを追加します。

4

モデルのドリフトを追跡し、カメラまたはデータセットの変更後に再検証します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Segment Anything Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Segment Anything Model?

Segment Anything Model (SAM) は、Meta AI の画像セグメンテーションの基礎モデルです。点、ボックス、または大まかなヒントが与えられると、対応するオブジェクトの輪郭が瞬時に表示されます。これは、トレーニング中に見たことのないオブジェクトや画像を一般化するように構築されており、セグメンテーションを迅速なタスクにします。

SAM をセグメンテーションの「基礎モデル」にする中心となるアイデアは何ですか?

SAM はセグメンテーションをプロンプト可能として再構成し、トレーニング セット外のオブジェクトや画像へのゼロショット転送用に設計されました。

SAM のトレーニングに使用される SA-1B データセットのサイズはおよそどれくらいですか?

SA-1B には、モデルインザループ アノテーション エンジンで構築された、約 1,100 万枚の画像に 10 億を超えるマスクが含まれています。

SAM がそのアーキテクチャを重いイメージ エンコーダと軽量のプロンプト エンコーダ/デコーダに分割しているのはなぜですか?

高価な画像エンコードは 1 回だけ実行されます。さらに、安価なプロンプト エンコーディングとマスク デコーディングにより、同じ画像の高速でインタラクティブな再プロンプトが可能になります。

SAM は、1 回のクリックで複数のオブジェクトを意味する可能性があるなど、あいまいなプロンプトをどのように処理しますか?

SAM はスコア付きのいくつかの候補マスクを出力するため、曖昧さはランク付けまたは追加のプロンプトによって解決できます。

SAM は入力画像をエンコードするためにどのようなタイプのバックボーンを使用しますか?

SAM の画像エンコーダは Vision Transformer であり、多くの場合、マスクされた自動エンコーディングで事前トレーニングされ、高密度の画像埋め込みを生成します。