GHID AI vizual

Detectare în timp real YOLO

YOLO (You Only Look Once) este o familie de modele de detectare a obiectelor care găsesc și etichetează fiecare obiect dintr-o imagine cu o singură trecere a rețelei neuronale, suficient de rapid pentru videoclipuri live.

2 minute de lecturăUltima actualizare

Prezentare generală

Its speed unlocked real-time vision on everything from drones to self-checkout kiosks.

Scufundare în profunzime

Înainte de YOLO, detectoare precum R-CNN rulau un clasificator de mii de ori în regiunile imaginii, ceea ce era lent. YOLO, introdus de Joseph Redmon în 2015, a reîncadrat detectarea ca o problemă de regresie: împărțiți imaginea într-o grilă și pentru fiecare celulă preziceți casete de delimitare, un scor de obiectitate și probabilitățile de clasă într-o singură trecere înainte. Acest design „look once” l-a făcut dramatic mai rapid decât detectoarele în două trepte, rămânând în același timp precis. Familia a evoluat rapid prin multe versiuni (YOLOv2 prin YOLOv8 și nu numai), adăugând cutii de ancorare, coloane vertebrale mai bune și capete fără ancore. Variantele moderne rulează cu mult peste 100 de cadre pe secundă pe un GPU, ceea ce face din YOLO alegerea implicită atunci când latența contează la fel de mult ca precizia.

Perspectivă tehnică

YOLO împarte o imagine într-o grilă S cu S. Fiecare celulă prezice un set fix de casete de delimitare cu (x, y, lățime, înălțime), un scor de încredere și probabilități de clasă, toate într-o singură trecere. Cutiile duplicat suprapuse sunt tăiate prin suprimare non-maximală, care păstrează caseta cu cea mai mare încredere și elimină altele peste un prag IoU. Pierderea optimizează în comun coordonatele casetei, obiectitatea și clasificarea, astfel încât întregul tren al detectoarelor cap la cap.

Impact strategic

Viteză și scară

Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.

Alegeri de construcție

Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.

Echipa și fluxul de lucru

Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.

Viitorul detectării în timp real YOLO

YOLO continuă să aibă tendința de implementare edge, cu modele cuantificate mai mici care rulează pe telefoane, microcontrolere și camere încorporate fără o conexiune la cloud. Versiunile mai noi combină componentele transformatorului și modelele fără ancora pentru precizie, fără a sacrifica viteza. Așteptați-vă la o integrare mai strânsă cu urmărirea și segmentarea, detectarea vocabularului deschis care recunoaște obiectele din solicitările de text, mai degrabă decât etichetele fixe, și atenția continuă pentru funcționarea eficientă pe hardware ieftin, cu consum redus de energie.

Implementare în lumea reală

Sisteme de plată automată și magazine fără casierie care detectează articolele pe măsură ce cumpărătorii le ridică

Drone și roboți agricoli care observă culturi, buruieni sau animale în timp real

Camere de trafic și supraveghere care numără vehiculele și detectează pietonii pentru analiza orașului inteligent

Linii de producție care semnalează piesele defecte pe o bandă transportoare cu mișcare rapidă

Riscuri și balustrade

Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.

Performanța modelului poate varia în funcție de iluminare, demografie și mediu.

Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.

Foaia de parcurs de implementare

1

Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.

2

Testați cu date care corespund condițiilor reale de producție.

3

Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.

4

Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YOLO Real-Time Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Agenți de voce în timp real

Întrebări frecvente

What is YOLO Real-Time Detection?

YOLO (You Only Look Once) este o familie de modele de detectare a obiectelor care găsesc și etichetează fiecare obiect dintr-o imagine cu o singură trecere a rețelei neuronale, suficient de rapid pentru videoclipuri live. Viteza sa a deblocat viziunea în timp real pe orice, de la drone până la chioșcuri de auto-checkout.

Ce înseamnă acronimul YOLO în acest context?

YOLO înseamnă „You Only Look Once”, ceea ce reflectă faptul că detectează toate obiectele dintr-o singură rețea neuronală care trec peste imagine.

Care a fost inovația cheie care a făcut YOLO mai rapid decât detectoarele anterioare precum R-CNN?

YOLO a reîncadrat detectarea ca o problemă de regresie pe o grilă de imagine, înlocuind clasificarea lentă regiune cu regiune a detectorilor în două etape.

Ce tehnică elimină casetele de delimitare duplicate, suprapuse din rezultatul YOLO?

Suprimarea non-maximă păstrează caseta cu cea mai mare încredere și elimină casetele care se suprapun peste un prag de intersecție peste unire.

În designul original YOLO, cum este împărțită imaginea de intrare pentru predicție?

YOLO împarte imaginea într-o grilă S cu S, iar fiecare celulă este responsabilă de prezicerea casetelor și a probabilităților de clasă pentru obiectele centrate în ea.

Ce cantitate prezice fiecare celulă de grilă alături de coordonatele căsuței de delimitare?

Fiecare celulă prezice coordonatele casetei, un scor de încredere în obiectitate și probabilitățile de clasă, toate împreună într-o singură trecere înainte.