GUIDA AI visiva

Segmenta qualsiasi modello

Il Segment Anything Model (SAM) è Meta il modello di base dell'AI per la segmentazione delle immagini: dato un punto, una casella o un suggerimento approssimativo, delinea immediatamente l'oggetto corrispondente.

2 minuti di letturaUltimo aggiornamento

Panoramica

È stato progettato per generalizzare a oggetti e immagini che non aveva mai visto durante l'addestramento, rendendo la segmentazione un compito prompt.

Immersione profonda

Rilasciato da Meta AI nel 2023, SAM riformula la segmentazione come un problema che può essere richiesto: gli si dà un prompt (un clic, una casella, una maschera o un suggerimento derivato dal testo) e restituisce una o più maschere di oggetti. La sua potenza deriva in parte dalla scala: è stato addestrato su SA-1B, un set di dati di oltre 1 miliardo di maschere in 11 milioni di immagini, costruito con un motore di annotazione model-in-the-loop. Dal punto di vista architettonico, SAM dispone di un codificatore di immagini pesante eseguito una volta per immagine, un codificatore di prompt leggero e un decodificatore di maschera veloce, in modo che una singola immagine incorporata possa essere riproposta interattivamente in tempo reale. Consente il trasferimento zero-shot a molte attività. SAM 2, rilasciato nel 2024, estende questo al video, tracciando gli oggetti attraverso i fotogrammi.

Approfondimento tecnico

SAM utilizza un codificatore di immagini Vision Transformer (ViT), spesso preaddestrato con codifica automatica mascherata, per produrre un denso incorporamento di immagini. I suggerimenti sono codificati in token e un decodificatore basato su trasformatore con fusibili di attenzione incrociata richiede token con l'incorporamento dell'immagine nelle maschere di output più i punteggi di confidenza. Per risolvere l'ambiguità (un clic potrebbe significare un pulsante, una maglietta o una persona), SAM prevede diverse maschere valide contemporaneamente e le classifica, consentendo di disambiguare l'uso a valle o i suggerimenti aggiuntivi.

Impatto strategico

Velocità e scala

L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.

Scelte di build

I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.

Team e flusso di lavoro

Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.

Il futuro del modello Segment Anything

SAM è diventato una spina dorsale predefinita per strumenti di annotazione, imaging medico, robotica e pipeline AR, spesso abbinato a rilevatori o modelli di testo per flussi di lavoro "segmentati per nome" con vocabolario aperto. Aspettatevi varianti più leggere e veloci (MobileSAM, EfficientSAM) per l'utilizzo sul dispositivo, un'integrazione più profonda con il linguaggio per una segmentazione completamente basata su testo e una continua espansione in video e 3D. Come modello fondamentale, i suoi incastri vengono sempre più riutilizzati come strato di percezione che alimenta altri sistemi.

Implementazione nel mondo reale

Le piattaforme di annotazione delle immagini utilizzano SAM per consentire agli etichettatori di fare clic una volta e generare automaticamente maschere di oggetti precise, riducendo drasticamente i tempi di etichettatura.

I ricercatori adattano il SAM (ad esempio MedSAM) per delineare organi e tumori nelle scansioni TC e MRI.

Gli editor di foto e video integrano SAM per ritagliare soggetti o rimuovere sfondi con un solo clic.

SAM 2 traccia e segmenta gli oggetti attraverso fotogrammi video per effetti AR e percezione robotica.

Rischi e guardrail

I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.

Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.

I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.

Tabella di marcia per l'implementazione

1

Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.

2

Testare con dati che corrispondono alle reali condizioni di produzione.

3

Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.

4

Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Segment Anything Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Modelli di coerenza

Domande frequenti

Cos'è il modello Segment Anything?

Il Segment Anything Model (SAM) è Meta il modello di base dell'AI per la segmentazione delle immagini: dato un punto, una casella o un suggerimento approssimativo, delinea immediatamente l'oggetto corrispondente. È stato costruito per generalizzare a oggetti e immagini mai visti durante l'addestramento, rendendo la segmentazione un compito immediato.

Quale idea centrale rende SAM un "modello fondamentale" per la segmentazione?

SAM riformula la segmentazione come sollecitabile ed è stato progettato per il trasferimento zero-shot a oggetti e immagini al di fuori del suo set di addestramento.

Quanto è grande all'incirca il set di dati SA-1B utilizzato per addestrare SAM?

SA-1B contiene oltre 1 miliardo di maschere su circa 11 milioni di immagini, realizzate con un motore di annotazione model-in-the-loop.

Perché SAM divide la sua architettura in un codificatore di immagini pesante e un codificatore/decodificatore di prompt leggero?

La costosa codifica delle immagini viene eseguita una volta; quindi la codifica economica del prompt e la decodifica della maschera consentono una nuova richiesta rapida e interattiva della stessa immagine.

In che modo SAM gestisce un messaggio ambiguo, come un singolo clic che potrebbe significare più oggetti?

SAM genera diverse maschere dei candidati con punteggi in modo che l'ambiguità possa essere risolta classificando o richiedendo ulteriori informazioni.

Che tipo di backbone utilizza SAM per codificare l'immagine di input?

Il codificatore di immagini di SAM è un Vision Transformer, spesso pre-addestrato con codifica automatica mascherata, che produce un denso incorporamento di immagini.