Segmentar qualquer modelo
O Segment Anything Model (SAM) é Meta o modelo básico da IA para segmentação de imagens: dado um ponto, caixa ou dica aproximada, ele descreve instantaneamente o objeto correspondente.
Visão geral
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
Mergulho profundo
Lançado pela Meta AI em 2023, o SAM reformula a segmentação como um problema que pode ser solicitado: você dá um prompt (um clique, uma caixa, uma máscara ou dica derivada de texto) e ele retorna uma ou mais máscaras de objeto. Seu poder vem em parte da escala: ele foi treinado no SA-1B, um conjunto de dados de mais de 1 bilhão de máscaras em 11 milhões de imagens, construído com um mecanismo de anotação model-in-the-loop. Arquitetonicamente, o SAM possui um codificador de imagem pesado executado uma vez por imagem, um codificador de prompt leve e um decodificador de máscara rápido, para que uma única imagem incorporada possa ser solicitada novamente de forma interativa em tempo real. Ele permite a transferência imediata para muitas tarefas. SAM 2, lançado em 2024, estende isso ao vídeo, rastreando objetos entre quadros.
Visão Técnica
O SAM usa um codificador de imagem Vision Transformer (ViT), geralmente pré-treinado com codificação automática mascarada, para produzir uma incorporação de imagem densa. Os prompts são codificados em tokens, e um decodificador baseado em transformador com atenção cruzada funde os tokens de prompt com a incorporação da imagem nas máscaras de saída, além das pontuações de confiança. Para resolver a ambiguidade (um clique pode significar um botão, uma camisa ou uma pessoa), o SAM prevê várias máscaras válidas de uma só vez e as classifica, permitindo que o uso posterior ou prompts extras desambiguam.
Impacto Estratégico
Velocidade e escala
A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.
Escolhas de construção
As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.
Equipe e fluxo de trabalho
As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.
O Futuro do Modelo Segmentar Qualquer Coisa
O SAM tornou-se um backbone padrão para ferramentas de anotação, imagens médicas, robótica e pipelines de AR, muitas vezes combinados com detectores ou modelos de texto para fluxos de trabalho de vocabulário aberto 'segmentar por nome'. Espere variantes mais leves e rápidas (MobileSAM, EfficientSAM) para uso no dispositivo, integração mais profunda com a linguagem para segmentação totalmente baseada em texto e expansão contínua para vídeo e 3D. Como modelo base, seus embeddings são cada vez mais reutilizados como uma camada de percepção que alimenta outros sistemas.
Implementação no mundo real
As plataformas de anotação de imagens usam SAM para permitir que os rotuladores cliquem uma vez e gerem automaticamente máscaras de objetos precisas, reduzindo o tempo de rotulagem.
Os pesquisadores adaptam o SAM (por exemplo, MedSAM) para delinear órgãos e tumores em tomografias computadorizadas e ressonâncias magnéticas.
Editores de fotos e vídeos integram o SAM para recortar assuntos ou remover fundos com um único clique.
O SAM 2 rastreia e segmenta objetos em quadros de vídeo para efeitos de AR e percepção robótica.
Riscos e guarda-corpos
Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.
O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.
Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.
Roteiro de implementação
Defina critérios de aceitação para precisão, recall e custos de erro.
Teste com dados que correspondam às condições reais de produção.
Adicione revisão humana para previsões de baixa confiança ou de alto impacto.
Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Modelos de consistência
Perguntas frequentes
What is Segment Anything Model?
O Segment Anything Model (SAM) é Meta o modelo básico da IA para segmentação de imagens: dado um ponto, caixa ou dica aproximada, ele descreve instantaneamente o objeto correspondente. Ele foi construído para generalizar para objetos e imagens que nunca viu durante o treinamento, tornando a segmentação uma tarefa fácil.
Qual ideia central faz do SAM um “modelo básico” para segmentação?
O SAM reformula a segmentação conforme solicitado e foi projetado para transferência zero-shot para objetos e imagens fora de seu conjunto de treinamento.
Qual é o tamanho aproximado do conjunto de dados SA-1B usado para treinar o SAM?
SA-1B contém mais de 1 bilhão de máscaras em cerca de 11 milhões de imagens, construídas com um mecanismo de anotação model-in-the-loop.
Por que o SAM divide sua arquitetura em um codificador de imagem pesado e um codificador/decodificador de prompt leve?
A cara codificação de imagem é executada uma vez; então, a codificação de prompt barata e a decodificação de máscara permitem uma nova solicitação rápida e interativa da mesma imagem.
Como o SAM lida com um prompt ambíguo, como um único clique que pode significar vários objetos?
O SAM gera diversas máscaras candidatas com pontuações para que a ambigüidade possa ser resolvida por classificação ou prompts adicionais.
Que tipo de backbone o SAM usa para codificar a imagem de entrada?
O codificador de imagem do SAM é um Vision Transformer, geralmente pré-treinado com codificação automática mascarada, produzindo uma incorporação de imagem densa.