Visual AI GUIDE

Segmentera Anything Model

Segment Anything Model (SAM) är Meta AI:s grundmodell för bildsegmentering: givet en punkt, ruta eller grov hint, skisserar den omedelbart motsvarande objekt.

2 min readSenast uppdaterad

Översikt

It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.

Djupdykning

Utgiven av Meta AI 2023, SAM omformulerar segmentering som ett promptbart problem: du ger den en prompt (ett klick, en ruta, en mask eller texthärledd ledtråd) och den returnerar en eller flera objektmasker. Dess kraft kommer delvis från skalan: den tränades på SA-1B, en datauppsättning med över 1 miljard masker över 11 miljoner bilder, byggd med en modell-i-slingan-anteckningsmotor. Arkitektoniskt har SAM en tung bildkodare som körs en gång per bild, en lätt promptkodare och en snabb maskavkodare, så att en enda inbäddad bild kan återupptas interaktivt i realtid. Det möjliggör noll-shot-överföring till många uppgifter. SAM 2, som släpptes 2024, utökar detta till video och spårar objekt över bildrutor.

Teknisk insikt

SAM använder en Vision Transformer (ViT) bildkodare, ofta förtränad med maskerad autoencoding, för att skapa en tät bildinbäddning. Uppmaningar är kodade till tokens, och en transformatorbaserad avkodare med korsuppmärksamhet säkringar prompter tokens med bilden inbäddad för att utmata masker plus konfidenspoäng. För att lösa tvetydigheter (ett klick kan betyda en knapp, en skjorta eller en person), förutsäger SAM flera giltiga masker samtidigt och rangordnar dem, vilket låter nedströmsanvändning eller extra uppmaningar otydliga.

Strategisk inverkan

Speed and scale

Visual AI kan automatisera inspektion, upptäckt och taggningsuppgifter i stor skala.

Build choices

Kreativa team kan prototypa koncept snabbare med färre manuella revisioner.

Team and workflow

Operationer kan använda bild- och videosignaler som tidigare var svåra att bearbeta.

Framtiden för Segment Anything Model

SAM har blivit en standardryggrad för annoteringsverktyg, medicinsk bildbehandling, robotteknik och AR-pipelines, ofta ihopkopplade med detektorer eller textmodeller för arbetsflöden med öppna ordförråd "segmentera efter namn". Förvänta dig lättare, snabbare varianter (MobileSAM, EfficientSAM) för användning på enheten, djupare integration med språk för helt textdriven segmentering och fortsatt expansion till video och 3D. Som en grundmodell återanvänds dess inbäddningar alltmer som ett perceptionslager som matar andra system.

Real-World Implementation

Bildkommentarsplattformar använder SAM för att låta etikettskrivare klicka en gång och automatiskt generera exakta objektmasker, vilket minskar märkningstiden.

Forskare anpassar SAM (t.ex. MedSAM) för att skissera organ och tumörer i CT- och MRI-skanningar.

Foto- och videoredigerare integrerar SAM för att klippa ut motiv eller ta bort bakgrunder med ett enda klick.

SAM 2 spårar och segmenterar objekt över videorutor för AR-effekter och robotuppfattning.

Risker & skyddsräcken

Bildrättigheter och samtycke kan bli juridiska risker om härkomst är oklart.

Modellens prestanda kan variera mellan belysning, demografi och miljöer.

Falska positiva resultat kan gå obemärkt förbi om inte konfidensgränser övervakas.

Färdplan för genomförande

1

Definiera acceptanskriterier för precision, återkallelse och felkostnader.

2

Testa med data som matchar verkliga produktionsförhållanden.

3

Lägg till mänsklig granskning för lågt förtroende eller förutsägelser med stor inverkan.

4

Spåra modelldrift och återvalidera efter ändringar av kamera eller datauppsättning.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Segment Anything Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Konsistensmodeller

Frequently asked questions

What is Segment Anything Model?

Segment Anything Model (SAM) är Meta AI:s grundmodell för bildsegmentering: givet en punkt, ruta eller grov hint, skisserar den omedelbart motsvarande objekt. Den byggdes för att generalisera till objekt och bilder som den aldrig såg under träning, vilket gör segmentering till en snabb uppgift.

Vilken kärnidé gör SAM till en "grundmodell" för segmentering?

SAM omformulerar segmentering som promptbar och designades för noll-shot-överföring till objekt och bilder utanför sin träningsuppsättning.

Ungefär hur stor är SA-1B-datauppsättningen som används för att träna SAM?

SA-1B innehåller över 1 miljard masker på cirka 11 miljoner bilder, byggda med en modell-i-slingan annoteringsmotor.

Varför delar SAM upp sin arkitektur i en tung bildkodare och en lätt promptkodare/avkodare?

Den dyra bildkodningen körs en gång; sedan möjliggör billig promptkodning och maskavkodning snabb, interaktiv återuppmaning av samma bild.

Hur hanterar SAM en tvetydig prompt, som ett enda klick som kan betyda flera objekt?

SAM matar ut flera kandidatmasker med poäng så tvetydighet kan lösas genom rangordning eller ytterligare uppmaningar.

Vilken typ av ryggrad använder SAM för att koda inmatningsbilden?

SAM:s bildkodare är en Vision Transformer, ofta förtränad med maskerad autoencoding, vilket ger en tät bildinbäddning.