PRZEWODNIK Wizualnej AI

DETR Wykrywanie transformatora

DETR (DEtection TRansformer) przekształca wykrywanie obiektów w problem bezpośredniego przewidywania zbioru rozwiązywany za pomocą transformatora, eliminując ręcznie zaprojektowane kroki, takie jak skrzynki kotwiczące i tłumienie niemaksymalne.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it gave detection a clean, end-to-end pipeline that inspired a wave of transformer-based vision models.

Głębokie nurkowanie

Wprowadzony przez Facebook AI w 2020 roku, DETR łączy szkielet CNN z koderem-dekoderem transformatorowym. CNN wyodrębnia cechy obrazu; koder miesza globalny kontekst w całym obrazie; a dekoder pobiera ustalony zestaw wyuczonych „zapytań o obiekt” i zamienia każde z nich albo na wykryty obiekt (klasa plus ramka ograniczająca), albo na wynik „brak obiektu”. Kluczową nowością jest dopasowywanie dwustronne: podczas uczenia węgierski algorytm znajduje przypisanie jeden do jednego między przewidywaniami a obiektami naziemnymi, dzięki czemu model uczy się bezpośrednio wyprowadzać unikalne pudełko dla każdego obiektu. Eliminuje to niemaksymalne tłumienie i strojenie kotwicy. Kompromisami były powolna zbieżność i słabsza dokładność małych obiektów, czym zajęto się w rozwiązaniach takich jak Deformable DETR.

Wgląd techniczny

Mechanizmem definiującym DETR jest strata oparta na zestawie z dopasowaniem węgierskim. Zamiast oceniać tysiące skrzynek zakotwiczeń, emituje stałą liczbę predykcji (często 100 zapytań obiektowych) i dopasowuje je jeden do jednego do prawdziwych obiektów, karząc zarówno błędy klasyfikacji, jak i skrzynek w dopasowanych parach i wypychając niedopasowane zapytania do „braku obiektu”. Ponieważ dopasowywanie odbywa się w trybie jeden do jednego, wykrywanie duplikatów jest eliminowane na etapie projektowania, a nie w ramach oddzielnego etapu przetwarzania końcowego.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość detekcji transformatorów DETR

Firma DETR wprowadziła na rynek całą rodzinę transformatorów detekcyjnych. Warianty takie jak Deformable DETR, DAB-DETR, DN-DETR i DINO radykalnie przyspieszyły szkolenie i poprawiły dokładność, a modele w stylu DINO osiągnęły najwyższe standardy wykrywania. Oparty na zapytaniach, kompleksowy paradygmat obejmuje teraz segmentację, śledzenie i wykrywanie 3D, a na nim opierają się detektory otwartego słownictwa. Spodziewaj się ciągłej konwergencji wykrywania, segmentacji i uziemiania języka w ujednolicone architektury transformatorów, przy czym DETR zostanie zapamiętany jako kluczowy krok, który wyeliminował ręcznie opracowaną heurystykę.

Implementacja w świecie rzeczywistym

Wykrywanie i blokowanie pieszych i pojazdów w zbiorach danych badawczych dotyczących jazdy autonomicznej

Zasilanie segmentacji panoptycznej po rozszerzeniu o przewidywanie maski na piksel

Służy jako architektura szkieletowa dla detektorów otwartego słownika i uziemienia

Lokalizowanie obiektów na obrazach półek sklepowych bez dostosowywania rozmiarów kotwic na zbiór danych

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DETR Transformer Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Regeneracja transformatora SwinIR

Często zadawane pytania

What is DETR Transformer Detection?

DETR (DEtection TRansformer) przekształca wykrywanie obiektów w problem bezpośredniego przewidywania zbioru rozwiązywany za pomocą transformatora, eliminując ręcznie zaprojektowane kroki, takie jak skrzynki kotwiczące i tłumienie niemaksymalne. Ma to znaczenie, ponieważ umożliwiło wykrywanie czystego, kompleksowego potoku, który zainspirował falę modeli wizyjnych opartych na transformatorach.

Co usuwa DETR w porównaniu z tradycyjnymi detektorami, takimi jak Faster R-CNN?

DETR działa kompleksowo i bezpośrednio przewiduje zestaw pól, eliminując kotwice i etap przetwarzania końcowego, który nie zapewnia maksymalnego tłumienia.

Którego algorytmu używa DETR do dopasowywania przewidywań do obiektów naziemnych podczas szkolenia?

DETR wykorzystuje algorytm węgierski do utworzenia przypisania jeden do jednego między przewidywaniami a obiektami naziemnymi dla ustalonej straty.

Czym są „zapytania obiektowe” DETR?

Zapytania obiektowe to stała liczba wyuczonych wektorów; dekoder konwertuje każdy z nich na przewidywanie obiektu lub wynik „brak obiektu”.

Jaką ogólną architekturę łączy DETR?

DETR łączy splotowy szkielet dla funkcji z koderem-dekoderem transformatorowym w celu przewidywania zestawu.

Dlaczego DETR nie potrzebuje tłumienia innego niż maksymalne?

Strata dopasowania jeden do jednego uczy model emitowania pojedynczej prognozy na obiekt, więc przetwarzanie końcowe polegające na usuwaniu duplikatów jest niepotrzebne.