Wykrywanie w czasie rzeczywistym YOLO
YOLO (You Only Look Once) to rodzina modeli wykrywania obiektów, które znajdują i oznaczają każdy obiekt na obrazie za pomocą jednego przejścia sieci neuronowej, z szybkością wystarczającą do transmisji obrazu na żywo.
Przegląd
Jego prędkość umożliwiła podgląd wszystkiego w czasie rzeczywistym, od dronów po kioski samoobsługowe.
Głębokie nurkowanie
Przed YOLO detektory takie jak R-CNN uruchamiały klasyfikator tysiące razy w różnych obszarach obrazu, co było powolne. YOLO, wprowadzone przez Josepha Redmona w 2015 r., przekształciło wykrywanie w jeden problem regresji: podziel obraz na siatkę i dla każdej komórki przewiduj ramki ograniczające, wynik obiektywności i prawdopodobieństwa klas w jednym przejściu do przodu. Dzięki konstrukcji „jednorazowego spojrzenia” był on znacznie szybszy niż detektory dwustopniowe, zachowując jednocześnie dokładność. Rodzina szybko ewoluowała poprzez wiele wersji (YOLOv2 do YOLOv8 i później), dodając skrzynki kotwiczące, lepsze szkielety i głowy wolne od kotwic. Nowoczesne warianty działają z szybkością znacznie ponad 100 klatek na sekundę na GPU, co sprawia, że YOLO jest domyślnym wyborem, gdy opóźnienie jest równie ważne jak dokładność.
Wgląd techniczny
YOLO dzieli obraz na siatkę S na S. Każda komórka przewiduje ustalony zestaw obwiedni z (x, y, szerokość, wysokość), współczynnikiem ufności i prawdopodobieństwami klas, a wszystko to w jednym przebiegu. Nakładające się zduplikowane pola są usuwane przez tłumienie inne niż maksymalne, które utrzymuje pole o najwyższym poziomie zaufania i odrzuca inne powyżej progu IoU. Strata wspólnie optymalizuje współrzędne skrzynki, obiektywność i klasyfikację, dzięki czemu cały detektor szkoli od końca do końca.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość wykrywania w czasie rzeczywistym YOLO
YOLO stale zmierza w kierunku wdrażania brzegowego, z mniejszymi, skwantowanymi modelami działającymi na telefonach, mikrokontrolerach i wbudowanych kamerach bez połączenia z chmurą. Nowsze wersje łączą komponenty transformatorów i konstrukcje bez kotew, aby zapewnić dokładność bez utraty szybkości. Oczekuj ściślejszej integracji ze śledzeniem i segmentacją, wykrywania otwartego słownictwa, które rozpoznaje obiekty na podstawie podpowiedzi tekstowych, a nie ustalonych etykiet, oraz ciągłego zwracania uwagi na wydajne działanie na tanim sprzęcie brzegowym o niskim poborze mocy.
Implementacja w świecie rzeczywistym
Systemy kas samoobsługowych i sklepy bez kasjerów wykrywają produkty w momencie ich odebrania przez kupującego
Drony i roboty rolnicze wykrywające uprawy, chwasty lub zwierzęta gospodarskie w czasie rzeczywistym
Kamery drogowe i monitorujące zliczają pojazdy i wykrywają pieszych na potrzeby analiz inteligentnych miast
Linie produkcyjne oznaczające wadliwe części na szybko poruszającym się przenośniku taśmowym
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YOLO Real-Time Detection quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Agenci głosowi w czasie rzeczywistym
Często zadawane pytania
Co to jest wykrywanie w czasie rzeczywistym YOLO?
YOLO (You Only Look Once) to rodzina modeli wykrywania obiektów, które znajdują i oznaczają każdy obiekt na obrazie za pomocą jednego przejścia sieci neuronowej, z szybkością wystarczającą do transmisji obrazu na żywo. Jego prędkość umożliwiła podgląd wszystkiego w czasie rzeczywistym, od dronów po kioski samoobsługowe.
Co w tym kontekście oznacza akronim YOLO?
YOLO oznacza „You Only Look Once”, co oznacza, że wykrywa wszystkie obiekty w pojedynczej sieci neuronowej przechodzące przez obraz.
Jaka była kluczowa innowacja, która sprawiła, że YOLO było szybsze niż wcześniejsze detektory, takie jak R-CNN?
Projekt YOLO przeformułował wykrywanie w jeden problem regresji na siatce obrazu, zastępując powolną klasyfikację region po regionie w przypadku detektorów dwustopniowych.
Jaka technika usuwa zduplikowane, nakładające się ramki ograniczające z danych wyjściowych YOLO?
Tłumienie inne niż maksymalne utrzymuje pole o najwyższej ufności i odrzuca nakładające się pola powyżej progu przecięcia przez połączenie.
Jak w oryginalnym projekcie YOLO dzielony jest obraz wejściowy w celu przewidywania?
YOLO dzieli obraz na siatkę S na S, a każda komórka jest odpowiedzialna za przewidywanie pudełek i prawdopodobieństw klas dla obiektów w środku.
Jaką wielkość przewiduje każda komórka siatki wraz ze współrzędnymi ramki ograniczającej?
Każda komórka przewiduje współrzędne pudełka, poziom pewności obiektywności i prawdopodobieństwa klas, a wszystko to łącznie w jednym przebiegu do przodu.