Segmentuj dowolny model
Model dowolnego segmentu (SAM) to Meta podstawowy model sztucznej inteligencji służący do segmentacji obrazu: po otrzymaniu punktu, ramki lub przybliżonej wskazówki natychmiast zarysowuje odpowiedni obiekt.
Przegląd
It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.
Głębokie nurkowanie
Wydany przez Meta AI w 2023 r. SAM przekształca segmentację w problem, który można podpowiedzieć: dajesz mu monit (kliknięcie, pole, maskę lub wskazówkę tekstową), a on zwraca jedną lub więcej masek obiektów. Jego moc wynika częściowo ze skali: został wyszkolony na SA-1B, zbiorze danych obejmującym ponad 1 miliard masek na 11 milionach obrazów, zbudowanym przy użyciu silnika adnotacji typu model-in-the-loop. Architektonicznie SAM ma duży koder obrazu uruchamiany raz na obraz, lekki koder podpowiedzi i szybki dekoder maski, dzięki czemu pojedynczy osadzony obraz może być interaktywnie ponownie monitowany w czasie rzeczywistym. Umożliwia zero-shotowe przeniesienie do wielu zadań. SAM 2, wydany w 2024 roku, rozszerza to na wideo, śledząc obiekty w klatkach.
Wgląd techniczny
SAM wykorzystuje koder obrazu Vision Transformer (ViT), często wstępnie przeszkolony za pomocą maskowanego automatycznego kodowania, aby uzyskać gęste osadzanie obrazu. Podpowiedzi są kodowane w tokenach, a dekoder oparty na transformatorze z bezpiecznikami krzyżowo-uważnymi wyświetla tokeny podpowiedzi z obrazem osadzanym w maskach wyjściowych oraz wskaźnikami ufności. Aby rozwiązać niejasności (kliknięcie może oznaczać guzik, koszulę lub osobę), SAM przewiduje kilka prawidłowych masek na raz i klasyfikuje je, umożliwiając dalszemu użyciu lub dodatkowym podpowiedziom ujednoznacznienie.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość modelu dowolnego segmentu
SAM stał się domyślnym szkieletem narzędzi do adnotacji, obrazowania medycznego, robotyki i rurociągów AR, często w połączeniu z detektorami lub modelami tekstowymi na potrzeby przepływów pracy opartych na otwartym słownictwie „segment po nazwie”. Spodziewaj się lżejszych i szybszych wariantów (MobileSAM, EfficientSAM) do użytku na urządzeniu, głębszej integracji z językiem w celu segmentacji w pełni opartej na tekście oraz ciągłej ekspansji na wideo i 3D. Jako model podstawowy, jego elementy są coraz częściej ponownie wykorzystywane jako warstwa percepcyjna zasilająca inne systemy.
Implementacja w świecie rzeczywistym
Platformy do adnotacji obrazów wykorzystują SAM, aby umożliwić osobom zajmującym się etykietowaniem jednorazowe kliknięcie i automatyczne generowanie precyzyjnych masek obiektów, skracając czas etykietowania.
Naukowcy dostosowują SAM (np. MedSAM) do zarysowania narządów i guzów w tomografii komputerowej i rezonansie magnetycznym.
Edytory zdjęć i wideo integrują SAM w celu wycinania tematów lub usuwania tła jednym kliknięciem.
SAM 2 śledzi i segmentuje obiekty w klatkach wideo w celu uzyskania efektów AR i percepcji robotyki.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Segment Anything Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Modele spójności
Często zadawane pytania
What is Segment Anything Model?
Model dowolnego segmentu (SAM) to Meta podstawowy model sztucznej inteligencji służący do segmentacji obrazu: po otrzymaniu punktu, ramki lub przybliżonej wskazówki natychmiast zarysowuje odpowiedni obiekt. Został zbudowany w celu uogólniania obiektów i obrazów, których nigdy nie widział podczas szkolenia, dzięki czemu segmentacja jest łatwym zadaniem.
Jaka podstawowa idea sprawia, że SAM jest „modelem podstawowym” segmentacji?
SAM przekształca segmentację w sposób umożliwiający podpowiedzi i został zaprojektowany z myślą o transferze zerowym do obiektów i obrazów poza zestawem szkoleniowym.
Jak duży jest w przybliżeniu zbiór danych SA-1B używany do szkolenia SAM?
SA-1B zawiera ponad 1 miliard masek na około 11 milionach obrazów, zbudowanych przy użyciu silnika adnotacji typu model-in-the-loop.
Dlaczego SAM dzieli swoją architekturę na ciężki koder obrazu i lekki koder/dekoder podpowiedzi?
Kosztowne kodowanie obrazu jest uruchamiane raz; wówczas tanie kodowanie podpowiedzi i dekodowanie maski umożliwiają szybkie, interaktywne ponowne wyświetlanie tego samego obrazu.
W jaki sposób SAM radzi sobie z niejednoznacznym monitem, np. pojedynczym kliknięciem, które może oznaczać kilka obiektów?
SAM generuje kilka masek kandydatów z wynikami, więc niejednoznaczność można rozwiązać poprzez ranking lub dodatkowe monity.
Jakiego typu szkieletu używa SAM do kodowania obrazu wejściowego?
Koder obrazu firmy SAM to transformator wizyjny, często wstępnie przeszkolony za pomocą maskowanego automatycznego kodowania, zapewniający gęste osadzanie obrazu.