PRZEWODNIK Wizualnej AI

Wykrywanie w czasie rzeczywistym YOLO

YOLO (You Only Look Once) to rodzina modeli wykrywania obiektów, które znajdują i oznaczają każdy obiekt na obrazie za pomocą jednego przejścia sieci neuronowej, z szybkością wystarczającą do transmisji obrazu na żywo.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Jego prędkość umożliwiła podgląd wszystkiego w czasie rzeczywistym, od dronów po kioski samoobsługowe.

Głębokie nurkowanie

Przed YOLO detektory takie jak R-CNN uruchamiały klasyfikator tysiące razy w różnych obszarach obrazu, co było powolne. YOLO, wprowadzone przez Josepha Redmona w 2015 r., przekształciło wykrywanie w jeden problem regresji: podziel obraz na siatkę i dla każdej komórki przewiduj ramki ograniczające, wynik obiektywności i prawdopodobieństwa klas w jednym przejściu do przodu. Dzięki konstrukcji „jednorazowego spojrzenia” był on znacznie szybszy niż detektory dwustopniowe, zachowując jednocześnie dokładność. Rodzina szybko ewoluowała poprzez wiele wersji (YOLOv2 do YOLOv8 i później), dodając skrzynki kotwiczące, lepsze szkielety i głowy wolne od kotwic. Nowoczesne warianty działają z szybkością znacznie ponad 100 klatek na sekundę na GPU, co sprawia, że ​​YOLO jest domyślnym wyborem, gdy opóźnienie jest równie ważne jak dokładność.

Wgląd techniczny

YOLO dzieli obraz na siatkę S na S. Każda komórka przewiduje ustalony zestaw obwiedni z (x, y, szerokość, wysokość), współczynnikiem ufności i prawdopodobieństwami klas, a wszystko to w jednym przebiegu. Nakładające się zduplikowane pola są usuwane przez tłumienie inne niż maksymalne, które utrzymuje pole o najwyższym poziomie zaufania i odrzuca inne powyżej progu IoU. Strata wspólnie optymalizuje współrzędne skrzynki, obiektywność i klasyfikację, dzięki czemu cały detektor szkoli od końca do końca.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość wykrywania w czasie rzeczywistym YOLO

YOLO stale zmierza w kierunku wdrażania brzegowego, z mniejszymi, skwantowanymi modelami działającymi na telefonach, mikrokontrolerach i wbudowanych kamerach bez połączenia z chmurą. Nowsze wersje łączą komponenty transformatorów i konstrukcje bez kotew, aby zapewnić dokładność bez utraty szybkości. Oczekuj ściślejszej integracji ze śledzeniem i segmentacją, wykrywania otwartego słownictwa, które rozpoznaje obiekty na podstawie podpowiedzi tekstowych, a nie ustalonych etykiet, oraz ciągłego zwracania uwagi na wydajne działanie na tanim sprzęcie brzegowym o niskim poborze mocy.

Implementacja w świecie rzeczywistym

Systemy kas samoobsługowych i sklepy bez kasjerów wykrywają produkty w momencie ich odebrania przez kupującego

Drony i roboty rolnicze wykrywające uprawy, chwasty lub zwierzęta gospodarskie w czasie rzeczywistym

Kamery drogowe i monitorujące zliczają pojazdy i wykrywają pieszych na potrzeby analiz inteligentnych miast

Linie produkcyjne oznaczające wadliwe części na szybko poruszającym się przenośniku taśmowym

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YOLO Real-Time Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Agenci głosowi w czasie rzeczywistym

Często zadawane pytania

Co to jest wykrywanie w czasie rzeczywistym YOLO?

YOLO (You Only Look Once) to rodzina modeli wykrywania obiektów, które znajdują i oznaczają każdy obiekt na obrazie za pomocą jednego przejścia sieci neuronowej, z szybkością wystarczającą do transmisji obrazu na żywo. Jego prędkość umożliwiła podgląd wszystkiego w czasie rzeczywistym, od dronów po kioski samoobsługowe.

Co w tym kontekście oznacza akronim YOLO?

YOLO oznacza „You Only Look Once”, co oznacza, że ​​wykrywa wszystkie obiekty w pojedynczej sieci neuronowej przechodzące przez obraz.

Jaka była kluczowa innowacja, która sprawiła, że YOLO było szybsze niż wcześniejsze detektory, takie jak R-CNN?

Projekt YOLO przeformułował wykrywanie w jeden problem regresji na siatce obrazu, zastępując powolną klasyfikację region po regionie w przypadku detektorów dwustopniowych.

Jaka technika usuwa zduplikowane, nakładające się ramki ograniczające z danych wyjściowych YOLO?

Tłumienie inne niż maksymalne utrzymuje pole o najwyższej ufności i odrzuca nakładające się pola powyżej progu przecięcia przez połączenie.

Jak w oryginalnym projekcie YOLO dzielony jest obraz wejściowy w celu przewidywania?

YOLO dzieli obraz na siatkę S na S, a każda komórka jest odpowiedzialna za przewidywanie pudełek i prawdopodobieństw klas dla obiektów w środku.

Jaką wielkość przewiduje każda komórka siatki wraz ze współrzędnymi ramki ograniczającej?

Każda komórka przewiduje współrzędne pudełka, poziom pewności obiektywności i prawdopodobieństwa klas, a wszystko to łącznie w jednym przebiegu do przodu.