GUIDE DE L'IA Visuelle

Segmenter n'importe quel modèle

Le Segment Anything Model (SAM) est le modèle de base de Meta AI pour la segmentation d'images : à partir d'un point, d'un cadre ou d'un indice approximatif, il décrit instantanément l'objet correspondant.

2 minutes de lectureDernière mise à jour

Aperçu

It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.

Plongée profonde

Lancé par Meta AI en 2023, SAM recadre la segmentation comme un problème pouvant être déclenché : vous lui donnez une invite (un clic, une zone, un masque ou un indice dérivé de texte) et il renvoie un ou plusieurs masques d'objet. Sa puissance vient en partie de son échelle : il a été formé sur SA-1B, un ensemble de données de plus d'un milliard de masques répartis sur 11 millions d'images, construit avec un moteur d'annotation de modèle dans la boucle. Sur le plan architectural, SAM dispose d'un encodeur d'image lourd exécuté une fois par image, d'un encodeur d'invite léger et d'un décodeur de masque rapide, de sorte qu'une seule image intégrée peut être réinjectée de manière interactive en temps réel. Il permet un transfert zéro-shot vers de nombreuses tâches. SAM 2, sorti en 2024, étend cela à la vidéo, en suivant les objets à travers les images.

Aperçu technique

SAM utilise un encodeur d'image Vision Transformer (ViT), souvent pré-entraîné avec un encodage automatique masqué, pour produire une intégration d'image dense. Les invites sont codées en jetons, et un décodeur basé sur un transformateur avec une attention croisée fusionne les jetons d'invite avec l'intégration de l'image dans les masques de sortie ainsi que les scores de confiance. Pour résoudre toute ambiguïté (un clic peut signifier un bouton, une chemise ou une personne), SAM prédit plusieurs masques valides à la fois et les classe, permettant à l'utilisation en aval ou à des invites supplémentaires de lever l'ambiguïté.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L’avenir du modèle Segment Anything

SAM est devenu l'épine dorsale par défaut des outils d'annotation, de l'imagerie médicale, de la robotique et des pipelines AR, souvent associé à des détecteurs ou à des modèles de texte pour les flux de travail de « segment par nom » à vocabulaire ouvert. Attendez-vous à des variantes plus légères et plus rapides (MobileSAM, EfficientSAM) pour une utilisation sur appareil, à une intégration plus approfondie avec le langage pour une segmentation entièrement basée sur le texte et à une expansion continue dans la vidéo et la 3D. En tant que modèle de base, ses intégrations sont de plus en plus réutilisées comme couche de perception alimentant d’autres systèmes.

Mise en œuvre dans le monde réel

Les plates-formes d'annotation d'images utilisent SAM pour permettre aux étiqueteurs de cliquer une seule fois et de générer automatiquement des masques d'objet précis, réduisant ainsi le temps d'étiquetage.

Les chercheurs adaptent le SAM (par exemple MedSAM) pour décrire les organes et les tumeurs lors des tomodensitométries et des IRM.

Les éditeurs de photos et de vidéos intègrent SAM pour découper des sujets ou supprimer des arrière-plans en un seul clic.

SAM 2 suit et segmente les objets sur des images vidéo pour les effets AR et la perception robotique.

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Segment Anything Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modèles de cohérence

Questions fréquemment posées

What is Segment Anything Model?

Le Segment Anything Model (SAM) est le modèle de base de Meta AI pour la segmentation d'images : à partir d'un point, d'un cadre ou d'un indice approximatif, il décrit instantanément l'objet correspondant. Il a été conçu pour généraliser aux objets et aux images qu'il n'a jamais vus pendant la formation, faisant de la segmentation une tâche rapide.

Quelle idée fondamentale fait de SAM un « modèle de base » pour la segmentation ?

SAM recadre la segmentation comme une invite et a été conçu pour un transfert zéro vers des objets et des images en dehors de son ensemble de formation.

Quelle est la taille approximative de l'ensemble de données SA-1B utilisé pour entraîner SAM ?

SA-1B contient plus d'un milliard de masques sur environ 11 millions d'images, construits avec un moteur d'annotation de modèle dans la boucle.

Pourquoi SAM divise-t-il son architecture en un encodeur d'image lourd et un encodeur/décodeur d'invite léger ?

Le coûteux codage d’image s’exécute une seule fois ; Ensuite, le codage d'invite bon marché et le décodage de masque permettent une nouvelle invite rapide et interactive de la même image.

Comment SAM gère-t-il une invite ambiguë, comme un simple clic pouvant désigner plusieurs objets ?

SAM génère plusieurs masques candidats avec des scores afin que l'ambiguïté puisse être résolue par un classement ou des invites supplémentaires.

Quel type de backbone SAM utilise-t-il pour encoder l’image d’entrée ?

L'encodeur d'image de SAM est un transformateur de vision, souvent pré-entraîné avec un encodage automatique masqué, produisant une intégration d'image dense.