Segmenteer alles-model
Het Segment Anything Model (SAM) is Meta AI's basismodel voor beeldsegmentatie: gegeven een punt, kader of ruwe hint, schetst het onmiddellijk het overeenkomstige object.
Overzicht
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
Diepe duik
SAM, uitgebracht door Meta AI in 2023, herformuleert segmentatie als een probleem dat kan worden opgeroepen: je geeft er een prompt aan (een klik, een vakje, een masker of een uit tekst afgeleide hint) en het retourneert een of meer objectmaskers. De kracht komt deels voort uit de schaal: het is getraind op SA-1B, een dataset van meer dan 1 miljard maskers verspreid over 11 miljoen afbeeldingen, gebouwd met een model-in-the-loop annotatie-engine. Architectonisch gezien beschikt SAM over een zware beeld-encoder die één keer per afbeelding wordt uitgevoerd, een lichtgewicht prompt-encoder en een snelle maskerdecoder, zodat een enkele ingebedde afbeelding in realtime interactief opnieuw kan worden opgeroepen. Het maakt zero-shot-overdracht naar veel taken mogelijk. SAM 2, uitgebracht in 2024, breidt dit uit naar video, waarbij objecten over frames heen worden gevolgd.
Technisch inzicht
SAM maakt gebruik van een Vision Transformer (ViT) beeldencoder, vaak vooraf getraind met gemaskeerde autocodering, om een dichte beeldinbedding te produceren. Prompts worden gecodeerd in tokens, en een op transformatoren gebaseerde decoder met kruisaandacht combineert prompttokens met de ingesloten afbeelding om maskers plus betrouwbaarheidsscores uit te voeren. Om dubbelzinnigheid op te lossen (een klik kan een knop, een shirt of een persoon betekenen), voorspelt SAM meerdere geldige maskers tegelijk en rangschikt deze, waardoor downstream-gebruik of extra aanwijzingen ondubbelzinnig kunnen worden gemaakt.
Strategische impact
Speed and scale
Visuele AI kan inspectie-, detectie- en taggingtaken op schaal automatiseren.
Build choices
Creatieve teams kunnen concepten sneller prototypen met minder handmatige revisies.
Team and workflow
Bij bewerkingen kan gebruik worden gemaakt van beeld- en videosignalen die voorheen moeilijk te verwerken waren.
De toekomst van het Segment Anything-model
SAM is een standaardruggengraat geworden voor annotatietools, medische beeldvorming, robotica en AR-pijplijnen, vaak gecombineerd met detectoren of tekstmodellen voor 'segmenteer op naam'-workflows met open woordenschat. Verwacht lichtere, snellere varianten (MobileSAM, EfficientSAM) voor gebruik op het apparaat, diepere integratie met taal voor volledig tekstgestuurde segmentatie en voortdurende uitbreiding naar video en 3D. Als basismodel worden de inbedding ervan steeds vaker hergebruikt als perceptielaag die andere systemen voedt.
Implementatie in de echte wereld
Beeldannotatieplatforms gebruiken SAM om labelers één keer te laten klikken en automatisch nauwkeurige objectmaskers te genereren, waardoor de labeltijd wordt verkort.
Onderzoekers passen SAM (bijvoorbeeld MedSAM) aan om organen en tumoren in CT- en MRI-scans in kaart te brengen.
Foto- en video-editors integreren SAM om met één klik onderwerpen uit te snijden of achtergronden te verwijderen.
SAM 2 volgt en segmenteert objecten over videoframes voor AR-effecten en robotica-perceptie.
Risico's en vangrails
Beeldrechten en toestemming kunnen juridische risico's worden als de herkomst onduidelijk is.
De prestaties van modellen kunnen variëren afhankelijk van de belichting, demografische gegevens en omgevingen.
Valse positieve resultaten kunnen onopgemerkt blijven, tenzij de vertrouwensdrempels worden gecontroleerd.
Implementatie routekaart
Definieer acceptatiecriteria voor precisie-, terugroep- en foutkosten.
Test met gegevens die overeenkomen met echte productieomstandigheden.
Voeg menselijke beoordeling toe voor voorspellingen met weinig vertrouwen of hoge impact.
Volg modelafwijkingen en valideer opnieuw na wijzigingen in de camera of dataset.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Consistentiemodellen
Frequently asked questions
What is Segment Anything Model?
Het Segment Anything Model (SAM) is Meta AI's basismodel voor beeldsegmentatie: gegeven een punt, kader of ruwe hint, schetst het onmiddellijk het overeenkomstige object. Het is gebouwd om te generaliseren naar objecten en afbeeldingen die het tijdens de training nooit heeft gezien, waardoor segmentatie een snelle taak wordt.
Welk kernidee maakt SAM tot een ‘fundamenteel model’ voor segmentatie?
SAM herformuleert segmentatie als prompt en is ontworpen voor zero-shot-overdracht naar objecten en afbeeldingen buiten de trainingsset.
Hoe groot is de SA-1B-dataset die wordt gebruikt om SAM te trainen ongeveer?
SA-1B bevat meer dan 1 miljard maskers op ongeveer 11 miljoen afbeeldingen, gebouwd met een model-in-the-loop annotatie-engine.
Waarom splitst SAM zijn architectuur op in een zware image-encoder en een lichtgewicht prompt-encoder/decoder?
De dure beeldcodering wordt één keer uitgevoerd; dan maken goedkope promptcodering en maskerdecodering het snel, interactief opnieuw oproepen van hetzelfde beeld mogelijk.
Hoe gaat SAM om met een dubbelzinnige prompt, zoals een enkele klik die meerdere objecten kan betekenen?
SAM voert verschillende kandidaatmaskers met scores uit, zodat dubbelzinnigheid kan worden opgelost door middel van rangschikking of aanvullende aanwijzingen.
Welk type backbone gebruikt SAM om het invoerbeeld te coderen?
De beeldencoder van SAM is een Vision Transformer, vaak vooraf getraind met gemaskeerde auto-codering, waardoor een compacte beeldinbedding ontstaat.