Segment Anything-Modell
Das Segment Anything Model (SAM) ist Meta AIs Grundmodell für die Bildsegmentierung: Wenn ein Punkt, ein Kästchen oder ein grober Hinweis gegeben wird, umreißt es sofort das entsprechende Objekt.
Übersicht
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
Tiefer Einblick
SAM wurde 2023 von Meta AI veröffentlicht und definiert die Segmentierung als ein aufforderungsfähiges Problem: Sie geben ihm eine Eingabeaufforderung (einen Klick, ein Feld, eine Maske oder einen vom Text abgeleiteten Hinweis) und es gibt eine oder mehrere Objektmasken zurück. Seine Stärke beruht zum Teil auf der Skalierung: Es wurde auf SA-1B trainiert, einem Datensatz von über 1 Milliarde Masken in 11 Millionen Bildern, der mit einer Model-in-the-Loop-Annotations-Engine erstellt wurde. Architektonisch verfügt SAM über einen umfangreichen Bildencoder, der einmal pro Bild ausgeführt wird, einen leichten Prompt-Encoder und einen schnellen Maskendecoder, sodass ein einzelnes eingebettetes Bild interaktiv in Echtzeit erneut aufgefordert werden kann. Es ermöglicht die Zero-Shot-Übertragung vieler Aufgaben. SAM 2, veröffentlicht im Jahr 2024, erweitert dies auf Videos und verfolgt Objekte über Frames hinweg.
Technischer Einblick
SAM verwendet einen Vision Transformer (ViT)-Bildkodierer, der häufig mit maskierter automatischer Kodierung vorab trainiert wird, um eine dichte Bildeinbettung zu erzeugen. Eingabeaufforderungen werden in Token codiert, und ein transformatorbasierter Decoder mit Queraufmerksamkeit verschmilzt Eingabeaufforderungstoken mit der Bildeinbettung, um Masken und Konfidenzwerte auszugeben. Um Mehrdeutigkeiten zu beseitigen (ein Klick könnte einen Knopf, ein Hemd oder eine Person bedeuten), sagt SAM mehrere gültige Masken gleichzeitig voraus und ordnet sie, sodass nachgeschaltete Verwendung oder zusätzliche Eingabeaufforderungen eindeutig sein können.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Visuelle KI kann Inspektions-, Erkennungs- und Kennzeichnungsaufgaben im großen Maßstab automatisieren.
Bauen Sie Entscheidungen auf
Kreativteams können mit weniger manuellen Überarbeitungen schneller Prototypen von Konzepten erstellen.
Team und Arbeitsablauf
Vorgänge können Bild- und Videosignale nutzen, die bisher schwer zu verarbeiten waren.
Die Zukunft des Segment Anything-Modells
SAM ist zu einem Standard-Rückgrat für Annotationstools, medizinische Bildgebung, Robotik und AR-Pipelines geworden, oft gepaart mit Detektoren oder Textmodellen für Workflows mit offenem Vokabular zum „Segmentieren nach Namen“. Erwarten Sie leichtere, schnellere Varianten (MobileSAM, EfficientSAM) für die Verwendung auf dem Gerät, eine tiefere Integration mit der Sprache für vollständig textgesteuerte Segmentierung und eine weitere Expansion in Video und 3D. Als Grundmodell werden seine Einbettungen zunehmend als Wahrnehmungsschicht wiederverwendet, die andere Systeme speist.
Reale Umsetzung
Bildanmerkungsplattformen nutzen SAM, damit Beschrifter einmal klicken und automatisch präzise Objektmasken generieren können, wodurch die Beschriftungszeit verkürzt wird.
Forscher passen SAM (z. B. MedSAM) an, um Organe und Tumore in CT- und MRT-Scans darzustellen.
Foto- und Videoeditoren integrieren SAM, um mit einem einzigen Klick Motive auszuschneiden oder Hintergründe zu entfernen.
SAM 2 verfolgt und segmentiert Objekte über Videobilder hinweg für AR-Effekte und robotische Wahrnehmung.
Risiken und Leitplanken
Bildrechte und Einwilligungen können zu rechtlichen Risiken werden, wenn die Herkunft unklar ist.
Die Modellleistung kann je nach Beleuchtung, Demografie und Umgebung variieren.
Fehlalarme können unbemerkt bleiben, wenn die Konfidenzschwellen nicht überwacht werden.
Implementierungs-Roadmap
Definieren Sie Akzeptanzkriterien für Präzision, Rückruf und Fehlerkosten.
Testen Sie mit Daten, die den realen Produktionsbedingungen entsprechen.
Fügen Sie eine menschliche Überprüfung für Vorhersagen mit geringem Vertrauen oder großer Auswirkung hinzu.
Verfolgen Sie die Modelldrift und führen Sie nach Kamera- oder Datensatzänderungen eine erneute Validierung durch.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Konsistenzmodelle
Häufig gestellte Fragen
What is Segment Anything Model?
Das Segment Anything Model (SAM) ist Meta AIs Grundmodell für die Bildsegmentierung: Wenn ein Punkt, ein Kästchen oder ein grober Hinweis gegeben wird, umreißt es sofort das entsprechende Objekt. Es wurde entwickelt, um auf Objekte und Bilder zu verallgemeinern, die es während des Trainings nie gesehen hat, wodurch die Segmentierung zu einer aufforderungsgerechten Aufgabe wird.
Welche Kernidee macht SAM zu einem „Grundlagenmodell“ für die Segmentierung?
SAM gestaltet die Segmentierung als aufforderungsfähig neu und wurde für die Zero-Shot-Übertragung auf Objekte und Bilder außerhalb seines Trainingssatzes entwickelt.
Wie groß ist ungefähr der SA-1B-Datensatz, der zum Trainieren von SAM verwendet wird?
SA-1B enthält über 1 Milliarde Masken auf rund 11 Millionen Bildern, erstellt mit einer Model-in-the-Loop-Annotations-Engine.
Warum teilt SAM seine Architektur in einen schweren Bild-Encoder und einen leichten Prompt-Encoder/Decoder auf?
Die teure Bildkodierung läuft einmal; Dann ermöglichen kostengünstige Eingabeaufforderungskodierung und Maskendekodierung eine schnelle, interaktive erneute Eingabeaufforderung desselben Bildes.
Wie geht SAM mit einer mehrdeutigen Eingabeaufforderung um, beispielsweise einem einzelnen Klick, der mehrere Objekte bedeuten könnte?
SAM gibt mehrere Kandidatenmasken mit Bewertungen aus, sodass Unklarheiten durch Rangfolge oder zusätzliche Eingabeaufforderungen behoben werden können.
Welche Art von Backbone verwendet SAM zum Codieren des Eingabebildes?
Der Bildencoder von SAM ist ein Vision Transformer, der häufig mit maskierter automatischer Kodierung vorab trainiert wird und eine dichte Bildeinbettung erzeugt.