Segmentează orice model
Modelul Segment Anything (SAM) este modelul de bază al Meta AI pentru segmentarea imaginii: având în vedere un punct, o casetă sau un indiciu aproximativ, conturează instantaneu obiectul corespunzător.
Prezentare generală
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
Scufundare în profunzime
Lansat de Meta AI în 2023, SAM reîncadrează segmentarea ca o problemă care poate fi solicitată: îi oferiți un prompt (un clic, o casetă, o mască sau un indiciu derivat din text) și returnează una sau mai multe măști de obiect. Puterea sa provine parțial de la scară: a fost antrenat pe SA-1B, un set de date de peste 1 miliard de măști în 11 milioane de imagini, construit cu un motor de adnotare model-in-the-loop. Din punct de vedere arhitectural, SAM are un codificator de imagine greu rulat o dată pe imagine, un encoder rapid ușor și un decodor rapid de mască, astfel încât o singură imagine încorporată poate fi reprovocată interactiv în timp real. Permite transferul zero-shot la multe sarcini. SAM 2, lansat în 2024, extinde acest lucru și la video, urmărind obiectele pe cadre.
Perspectivă tehnică
SAM folosește un codificator de imagine Vision Transformer (ViT), adesea antrenat în prealabil cu codificare automată mascată, pentru a produce o încorporare densă a imaginii. Prompt-urile sunt codificate în jetoane, iar un decodor bazat pe transformator cu atenție încrucișată combină jetoanele prompte cu imaginea încorporată în măștile de ieșire plus scorurile de încredere. Pentru a rezolva ambiguitatea (un clic ar putea însemna un nasture, o cămașă sau o persoană), SAM prezice mai multe măști valide simultan și le ierarhizează, lăsând utilizarea în aval sau solicitările suplimentare să dezambigueze.
Impact strategic
Viteză și scară
Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.
Alegeri de construcție
Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.
Echipa și fluxul de lucru
Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.
Viitorul modelului de segmentare orice
SAM a devenit o coloană vertebrală implicită pentru instrumentele de adnotare, imagistica medicală, robotică și conductele AR, adesea asociate cu detectoare sau modele de text pentru fluxurile de lucru „segmentați după nume” cu vocabular deschis. Așteptați-vă la variante mai ușoare și mai rapide (MobileSAM, EfficientSAM) pentru utilizarea pe dispozitiv, o integrare mai profundă cu limbajul pentru o segmentare complet bazată pe text și o extindere continuă în video și 3D. Ca model de fundație, înglobările sale sunt din ce în ce mai reutilizate ca strat de percepție care alimentează alte sisteme.
Implementare în lumea reală
Platformele de adnotare a imaginilor folosesc SAM pentru a permite etichetatorilor să facă clic o dată și să genereze automat măști precise pentru obiecte, reducând timpul de etichetare.
Cercetătorii adaptează SAM (de exemplu, MedSAM) pentru a contura organele și tumorile în scanările CT și RMN.
Editorii foto și video integrează SAM pentru a decupa subiectele sau pentru a elimina fundalurile dintr-un singur clic.
SAM 2 urmărește și segmentează obiectele în cadre video pentru efecte AR și percepție robotică.
Riscuri și balustrade
Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.
Performanța modelului poate varia în funcție de iluminare, demografie și mediu.
Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.
Foaia de parcurs de implementare
Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.
Testați cu date care corespund condițiilor reale de producție.
Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.
Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Modele de consistență
Întrebări frecvente
What is Segment Anything Model?
Modelul Segment Anything (SAM) este modelul de bază al Meta AI pentru segmentarea imaginii: având în vedere un punct, o casetă sau un indiciu aproximativ, conturează instantaneu obiectul corespunzător. A fost construit pentru a se generaliza la obiecte și imagini pe care nu le-a văzut niciodată în timpul antrenamentului, făcând segmentarea o sarcină promptă.
Ce idee de bază face din SAM un „model de bază” pentru segmentare?
SAM reîncadrează segmentarea ca fiind promptă și a fost conceput pentru transferul zero-shot la obiecte și imagini din afara setului său de antrenament.
Cât de mare este setul de date SA-1B folosit pentru a antrena SAM?
SA-1B conține peste 1 miliard de măști pe aproximativ 11 milioane de imagini, construite cu un motor de adnotare model-in-the-loop.
De ce SAM își împarte arhitectura într-un codificator de imagine greu și un encoder/decodor rapid ușor?
Codificarea costisitoare a imaginii rulează o singură dată; apoi codificarea promptă ieftină și decodificarea măștilor permit repromptarea rapidă și interactivă a aceleiași imagini.
Cum gestionează SAM o solicitare ambiguă, cum ar fi un singur clic care ar putea însemna mai multe obiecte?
SAM emite mai multe măști de candidat cu scoruri, astfel încât ambiguitatea poate fi rezolvată prin clasare sau solicitări suplimentare.
Ce tip de coloană vertebrală folosește SAM pentru a codifica imaginea de intrare?
Codificatorul de imagine de la SAM este un transformator de viziune, adesea preantrenat cu autocodare mascata, producând o încorporare densă a imaginii.