Τμηματοποιήστε το μοντέλο για οτιδήποτε
Το Segment Anything Model (SAM) είναι το Meta μοντέλο βάσης της τεχνητής νοημοσύνης για την τμηματοποίηση εικόνας: δίνοντας ένα σημείο, πλαίσιο ή πρόχειρη υπόδειξη, σκιαγραφεί αμέσως το αντίστοιχο αντικείμενο.
Επισκόπηση
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
Βαθιά κατάδυση
Κυκλοφόρησε από Meta AI το 2023, η SAM επαναπλαισιώνει την τμηματοποίηση ως προτρεπτικό πρόβλημα: της δίνετε μια προτροπή (ένα κλικ, ένα πλαίσιο, μια μάσκα ή υπόδειξη που προέρχεται από κείμενο) και επιστρέφει μία ή περισσότερες μάσκες αντικειμένων. Η δύναμή του προέρχεται εν μέρει από την κλίμακα: εκπαιδεύτηκε στο SA-1B, ένα σύνολο δεδομένων με πάνω από 1 δισεκατομμύριο μάσκες σε 11 εκατομμύρια εικόνες, κατασκευασμένο με μια μηχανή σχολιασμού μοντέλου-in-the-loop. Αρχιτεκτονικά, η SAM διαθέτει έναν βαρύ κωδικοποιητή εικόνας που εκτελείται μία φορά ανά εικόνα, έναν ελαφρύ κωδικοποιητή προτροπής και έναν γρήγορο αποκωδικοποιητή μάσκας, έτσι ώστε μια ενσωματωμένη εικόνα να μπορεί να ζητηθεί εκ νέου διαδραστικά σε πραγματικό χρόνο. Επιτρέπει τη μεταφορά μηδενικής λήψης σε πολλές εργασίες. Το SAM 2, που κυκλοφόρησε το 2024, το επεκτείνει σε βίντεο, παρακολουθώντας αντικείμενα σε καρέ.
Τεχνική διορατικότητα
Το SAM χρησιμοποιεί έναν κωδικοποιητή εικόνας Vision Transformer (ViT), συχνά προεκπαιδευμένο με μάσκα αυτόματη κωδικοποίηση, για να παράγει μια πυκνή ενσωμάτωση εικόνας. Οι προτροπές κωδικοποιούνται σε διακριτικά και ένας αποκωδικοποιητής που βασίζεται σε μετασχηματιστή με ασφάλειες διασταυρούμενης προσοχής προτρέπει διακριτικά με την ενσωμάτωση της εικόνας στις μάσκες εξόδου συν βαθμολογίες εμπιστοσύνης. Για την επίλυση της ασάφειας (ένα κλικ θα μπορούσε να σημαίνει ένα κουμπί, ένα πουκάμισο ή ένα άτομο), η SAM προβλέπει πολλές έγκυρες μάσκες ταυτόχρονα και τις κατατάσσει, αφήνοντας τη μεταγενέστερη χρήση ή τα επιπλέον μηνύματα να αποσαφηνίζονται.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Το Visual AI μπορεί να αυτοματοποιήσει εργασίες επιθεώρησης, ανίχνευσης και επισήμανσης σε κλίμακα.
Δημιουργήστε επιλογές
Οι δημιουργικές ομάδες μπορούν να δημιουργήσουν πρωτότυπες ιδέες γρηγορότερα με λιγότερες μη αυτόματες αναθεωρήσεις.
Ομάδα και ροή εργασίας
Οι λειτουργίες μπορούν να χρησιμοποιούν σήματα εικόνας και βίντεο που προηγουμένως ήταν δύσκολο να επεξεργαστούν.
The Future of Segment Anything Model
Το SAM έχει γίνει η προεπιλεγμένη ραχοκοκαλιά για εργαλεία σχολιασμού, ιατρική απεικόνιση, ρομποτική και αγωγούς AR, που συχνά συνδυάζονται με ανιχνευτές ή μοντέλα κειμένου για ροές εργασίας «τμήμα κατά όνομα» ανοιχτού λεξιλογίου. Αναμένετε ελαφρύτερες, πιο γρήγορες παραλλαγές (MobileSAM, EfficientSAM) για χρήση στη συσκευή, βαθύτερη ενοποίηση με τη γλώσσα για τμηματοποίηση πλήρως βάσει κειμένου και συνεχή επέκταση σε βίντεο και 3D. Ως μοντέλο θεμελίωσης, οι ενσωματώσεις του επαναχρησιμοποιούνται όλο και περισσότερο ως στρώμα αντίληψης που τροφοδοτεί άλλα συστήματα.
Υλοποίηση σε πραγματικό κόσμο
Οι πλατφόρμες σχολιασμού εικόνας χρησιμοποιούν το SAM για να επιτρέπουν στους ετικετογράφους να κάνουν κλικ μία φορά και να δημιουργούν αυτόματα μάσκες ακριβών αντικειμένων, μειώνοντας τον χρόνο επισήμανσης.
Οι ερευνητές προσαρμόζουν το SAM (π.χ. MedSAM) για να περιγράψουν τα όργανα και τους όγκους σε αξονικές τομογραφίες και μαγνητικές τομογραφίες.
Τα προγράμματα επεξεργασίας φωτογραφιών και βίντεο ενσωματώνουν το SAM για να κόβουν θέματα ή να αφαιρούν φόντο με ένα μόνο κλικ.
Το SAM 2 παρακολουθεί και τμηματοποιεί αντικείμενα σε καρέ βίντεο για εφέ AR και αντίληψη ρομποτικής.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα δικαιώματα εικόνας και η συναίνεση μπορεί να αποτελέσουν νομικούς κινδύνους εάν η προέλευση είναι ασαφής.
Η απόδοση του μοντέλου μπορεί να διαφέρει ανάλογα με το φωτισμό, τα δημογραφικά στοιχεία και τα περιβάλλοντα.
Τα ψευδώς θετικά μπορεί να περάσουν απαρατήρητα εκτός εάν παρακολουθούνται τα όρια εμπιστοσύνης.
Οδικός Χάρτης Εφαρμογής
Καθορίστε κριτήρια αποδοχής για το κόστος ακρίβειας, ανάκλησης και σφάλματος.
Δοκιμή με δεδομένα που ταιριάζουν με πραγματικές συνθήκες παραγωγής.
Προσθέστε ανθρώπινη κριτική για προβλέψεις χαμηλής εμπιστοσύνης ή υψηλού αντίκτυπου.
Παρακολουθήστε τη μετατόπιση του μοντέλου και επικυρώστε εκ νέου μετά από αλλαγές κάμερας ή δεδομένων.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Μοντέλα Συνέπειας
Συχνές ερωτήσεις
What is Segment Anything Model?
Το Segment Anything Model (SAM) είναι το Meta μοντέλο βάσης της τεχνητής νοημοσύνης για την τμηματοποίηση εικόνας: δίνοντας ένα σημείο, πλαίσιο ή πρόχειρη υπόδειξη, σκιαγραφεί αμέσως το αντίστοιχο αντικείμενο. Κατασκευάστηκε για να γενικεύει αντικείμενα και εικόνες που δεν είδε ποτέ κατά τη διάρκεια της εκπαίδευσης, καθιστώντας την τμηματοποίηση μια άμεση εργασία.
Ποια βασική ιδέα καθιστά το SAM «μοντέλο θεμελίωσης» για τμηματοποίηση;
Το SAM επανακαθορίζει την τμηματοποίηση όπως απαιτείται και σχεδιάστηκε για μεταφορά μηδενικής λήψης σε αντικείμενα και εικόνες εκτός του συνόλου εκπαίδευσης.
Πόσο μεγάλο είναι περίπου το σύνολο δεδομένων SA-1B που χρησιμοποιείται για την εκπαίδευση του SAM;
Το SA-1B περιέχει πάνω από 1 δισεκατομμύριο μάσκες σε περίπου 11 εκατομμύρια εικόνες, κατασκευασμένες με μια μηχανή σχολιασμού μοντέλου-in-the-loop.
Γιατί η SAM χωρίζει την αρχιτεκτονική της σε έναν βαρύ κωδικοποιητή εικόνας και έναν ελαφρύ κωδικοποιητή/αποκωδικοποιητή προτροπής;
Η ακριβή κωδικοποίηση εικόνας εκτελείται μία φορά. Στη συνέχεια, η φθηνή κωδικοποίηση προτροπής και η αποκωδικοποίηση μάσκας επιτρέπουν γρήγορη, διαδραστική επαναπροτροπή της ίδιας εικόνας.
Πώς χειρίζεται η SAM μια διφορούμενη προτροπή, όπως ένα μόνο κλικ που μπορεί να σημαίνει πολλά αντικείμενα;
Το SAM εξάγει αρκετές μάσκες υποψηφίων με βαθμολογίες, ώστε η ασάφεια να μπορεί να επιλυθεί με κατάταξη ή πρόσθετα μηνύματα.
Τι τύπο κορμού χρησιμοποιεί η SAM για την κωδικοποίηση της εικόνας εισόδου;
Ο κωδικοποιητής εικόνας της SAM είναι ένας μετασχηματιστής Vision, συχνά προεκπαιδευμένος με μάσκα αυτόματης κωδικοποίησης, παράγοντας πυκνή ενσωμάτωση εικόνας.