PRZEWODNIK Wizualnej AI

Wykrywanie obiektów w otwartym słownictwie

Wykrywanie obiektów przy użyciu otwartego słownika umożliwia modelowi znajdowanie i umieszczanie w ramkach obiektów opisanych dowolnym tekstem, w tym kategorii, których nigdy nie widział oznaczonych etykietami podczas uczenia.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.

Głębokie nurkowanie

Klasyczne detektory są szkolone w oparciu o zamknięty zestaw kategorii, powiedzmy 80 klas w COCO, i nie są w stanie rozpoznać „rzeczy” spoza tej listy. Wykrywanie otwartego słownictwa przełamuje te ograniczenia, dopasowując cechy obszaru wizualnego do wspólnej przestrzeni osadzania wizji i języka, zwykle wyuczonej na podstawie ogromnych par obraz-tekst (jak w CLIP). Podsumowując, podajesz etykiety tekstowe, model osadza te etykiety i dopasowuje wykryte regiony do tego, które osadzenie tekstu jest najbliższe, więc nowe kategorie działają tak długo, jak możesz je opisać. Systemy takie jak ViLD, GLIP, OWL-ViT, Detic i Grounding DINO spopularyzowały to podejście, łącząc szkielety wykrywania z uziemieniem języka i poprzez szkolenie na dużych, słabo oznakowanych lub ugruntowanych zbiorach danych.

Wgląd techniczny

Sztuką jest zastąpienie stałej warstwy klasyfikatora osadzeniem tekstu. Zamiast uczyć się jednego wektora wag dla każdej znanej klasy, detektor rzutuje każdy region w tę samą przestrzeń, co koder języka; klasyfikacja staje się porównaniem podobieństw między cechami regionu a osadzeniem nazw kategorii lub wyrażeń dostarczonych przez użytkownika. Ponieważ koder tekstu generalizuje na niewidoczne słowa, zamiana nowych ciągów etykiet w czasie testu umożliwia wykrycie kategorii nieobecnych w danych szkoleniowych obwiedni.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość wykrywania obiektów w otwartym słownictwie

Wykrywanie otwartego słownictwa łączy się z uziemianiem i segmentacją, w której swobodne frazy (nie tylko pojedyncze słowa) lokalizują obiekty, a także z systemami podpowiedzi w połączeniu z modelami takimi jak SAM dla masek. Oczekuj większej dokładności zerowej, dłuższych i bardziej złożonych zapytań tekstowych („czerwony kubek za laptopem”) oraz ścisłego połączenia z asystentami multimodalnymi, które wykrywają na żądanie. W miarę doskonalenia szkoleń obrazowo-tekstowych w skali internetowej granica między wykrywaniem, wyszukiwaniem i rozumieniem języka będzie się zacierać w kierunku ogólnych podstaw wizualnych.

Implementacja w świecie rzeczywistym

Wyszukiwanie obrazów w poszukiwaniu rzadkich lub niestandardowych obiektów poprzez wpisanie ich nazw bez ponownego szkolenia

Systemy robotyki lokalizują przedmiot, który użytkownik nazywa w języku naturalnym, zanim go uchwyci

Automatyczne etykietowanie zbiorów danych poprzez wykrywanie wielu nowych kategorii z listy tekstowej

Moderowanie treści, które oznacza opisane obiekty, których nie ma w oryginalnych etykietach szkoleniowych

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Vocabulary Object Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Open-Vocabulary Object Detection?

Wykrywanie obiektów przy użyciu otwartego słownika umożliwia modelowi znajdowanie i umieszczanie w ramkach obiektów opisanych dowolnym tekstem, w tym kategorii, których nigdy nie widział oznaczonych etykietami podczas uczenia. Ma to znaczenie, ponieważ tradycyjne detektory są przypisane do stałej listy klas, podczas gdy modele z otwartym słownictwem mogą wykryć prawie wszystko, co można nazwać.

Jaka jest definiująca zdolność wykrywania obiektów przy użyciu otwartego słownika?

Wykrywanie otwartego słownika może zlokalizować kategorie określone w tekście w czasie testu, nawet te, które nigdy nie były oznaczone ramkami ograniczającymi.

Jak te modele klasyfikują wykryty region?

Projektują regiony w przestrzeń osadzania języka wizyjnego i dopasowują każdy region do najbliższego osadzania etykiety tekstowej.

Jaki zasób przedszkoleniowy najlepiej umożliwia wykrywanie otwartego słownika?

Ogromne dane obrazowo-tekstowe (wykorzystywane w modelach w stylu CLIP) tworzą wspólną przestrzeń do osadzania, która umożliwia uogólnianie tekstu na nowe kategorie.

Który element należy wymienić w porównaniu z detektorem o układzie zamkniętym?

Zamiast stałych wektorów wag klas, klasyfikacja wykorzystuje podobieństwo do osadzania tekstu, więc w czasie testu można dodawać nowe ciągi etykiet.

Który z nich jest przykładem otwartego słownika lub modelu wykrywania uziemienia?

Uziemienie DINO, wraz z GLIP, OWL-ViT, ViLD i Detic, to dobrze znane detektory otwartego słownika lub uziemiające.