Segmenter n'importe quel modèle
Le Segment Anything Model (SAM) est le modèle de base de Meta AI pour la segmentation d'images : à partir d'un point, d'un cadre ou d'un indice approximatif, il décrit instantanément l'objet correspondant.
Aperçu
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
Plongée profonde
Lancé par Meta AI en 2023, SAM recadre la segmentation comme un problème pouvant être déclenché : vous lui donnez une invite (un clic, une zone, un masque ou un indice dérivé de texte) et il renvoie un ou plusieurs masques d'objet. Sa puissance vient en partie de son échelle : il a été formé sur SA-1B, un ensemble de données de plus d'un milliard de masques répartis sur 11 millions d'images, construit avec un moteur d'annotation de modèle dans la boucle. Sur le plan architectural, SAM dispose d'un encodeur d'image lourd exécuté une fois par image, d'un encodeur d'invite léger et d'un décodeur de masque rapide, de sorte qu'une seule image intégrée peut être réinjectée de manière interactive en temps réel. Il permet un transfert zéro-shot vers de nombreuses tâches. SAM 2, sorti en 2024, étend cela à la vidéo, en suivant les objets à travers les images.
Aperçu technique
SAM utilise un encodeur d'image Vision Transformer (ViT), souvent pré-entraîné avec un encodage automatique masqué, pour produire une intégration d'image dense. Les invites sont codées en jetons, et un décodeur basé sur un transformateur avec une attention croisée fusionne les jetons d'invite avec l'intégration de l'image dans les masques de sortie ainsi que les scores de confiance. Pour résoudre toute ambiguïté (un clic peut signifier un bouton, une chemise ou une personne), SAM prédit plusieurs masques valides à la fois et les classe, permettant à l'utilisation en aval ou à des invites supplémentaires de lever l'ambiguïté.
Impact stratégique
Vitesse et échelle
L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.
Choix de construction
Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.
Équipe et flux de travail
Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.
L’avenir du modèle Segment Anything
SAM est devenu l'épine dorsale par défaut des outils d'annotation, de l'imagerie médicale, de la robotique et des pipelines AR, souvent associé à des détecteurs ou à des modèles de texte pour les flux de travail de « segment par nom » à vocabulaire ouvert. Attendez-vous à des variantes plus légères et plus rapides (MobileSAM, EfficientSAM) pour une utilisation sur appareil, à une intégration plus approfondie avec le langage pour une segmentation entièrement basée sur le texte et à une expansion continue dans la vidéo et la 3D. En tant que modèle de base, ses intégrations sont de plus en plus réutilisées comme couche de perception alimentant d’autres systèmes.
Mise en œuvre dans le monde réel
Les plates-formes d'annotation d'images utilisent SAM pour permettre aux étiqueteurs de cliquer une seule fois et de générer automatiquement des masques d'objet précis, réduisant ainsi le temps d'étiquetage.
Les chercheurs adaptent le SAM (par exemple MedSAM) pour décrire les organes et les tumeurs lors des tomodensitométries et des IRM.
Les éditeurs de photos et de vidéos intègrent SAM pour découper des sujets ou supprimer des arrière-plans en un seul clic.
SAM 2 suit et segmente les objets sur des images vidéo pour les effets AR et la perception robotique.
Risques et garde-fous
Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.
Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.
Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.
Feuille de route de mise en œuvre
Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.
Testez avec des données qui correspondent aux conditions de production réelles.
Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.
Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Modèles de cohérence
Questions fréquemment posées
What is Segment Anything Model?
Le Segment Anything Model (SAM) est le modèle de base de Meta AI pour la segmentation d'images : à partir d'un point, d'un cadre ou d'un indice approximatif, il décrit instantanément l'objet correspondant. Il a été conçu pour généraliser aux objets et aux images qu'il n'a jamais vus pendant la formation, faisant de la segmentation une tâche rapide.
Quelle idée fondamentale fait de SAM un « modèle de base » pour la segmentation ?
SAM recadre la segmentation comme une invite et a été conçu pour un transfert zéro vers des objets et des images en dehors de son ensemble de formation.
Quelle est la taille approximative de l'ensemble de données SA-1B utilisé pour entraîner SAM ?
SA-1B contient plus d'un milliard de masques sur environ 11 millions d'images, construits avec un moteur d'annotation de modèle dans la boucle.
Pourquoi SAM divise-t-il son architecture en un encodeur d'image lourd et un encodeur/décodeur d'invite léger ?
Le coûteux codage d’image s’exécute une seule fois ; Ensuite, le codage d'invite bon marché et le décodage de masque permettent une nouvelle invite rapide et interactive de la même image.
Comment SAM gère-t-il une invite ambiguë, comme un simple clic pouvant désigner plusieurs objets ?
SAM génère plusieurs masques candidats avec des scores afin que l'ambiguïté puisse être résolue par un classement ou des invites supplémentaires.
Quel type de backbone SAM utilise-t-il pour encoder l’image d’entrée ?
L'encodeur d'image de SAM est un transformateur de vision, souvent pré-entraîné avec un encodage automatique masqué, produisant une intégration d'image dense.