Vizuální průvodce AI

Regionální CNN

Region-Based CNN (R-CNN) jsou rodinou detektorů objektů, které nejprve navrhnou kandidátské oblasti v obraze, poté použijí CNN ke klasifikaci a přesnému ohraničení každého objektu.

2 minuty čteníNaposledy aktualizováno

Přehled

They turned image classification into full object detection, locating and labeling many objects at once.

Hluboký ponor

Klasifikace obrázků odpovídá „co je na tomto obrázku?“ ale detekce musí také odpovědět 'kde a kolik?' Původní R-CNN (2014) pomocí externího algoritmu (Selective Search) navrhl přibližně 2 000 regionů, každý zkroutil na pevnou velikost a na každém spustil CNN, což bylo přesné, ale bolestně pomalé. Rychlé R-CNN to urychlilo spuštěním CNN jednou nad celým obrazem a sdružováním funkcí pro region (sdružování návratnosti investic). Rychlejší R-CNN pak nahradilo selektivní vyhledávání naučenou sítí pro návrh regionu (RPN), díky čemuž je celý kanál kompletní a téměř v reálném čase. Maska R-CNN ji dále rozšířila o výstup masek na úrovni pixelů pro každý detekovaný objekt.

Technický přehled

Klíčovým skokem v efektivitě je sdružování návratnosti investic: namísto opětovného spuštění CNN na každém navrhovaném boxu síť vypočítá jednu sdílenou mapu prvků pro obrázek, poté ořízne a změní velikost prvků v každé oblasti zájmu na pevnou mřížku. Rychlejší R-CNN RPN klouže přes tuto mapu funkcí předpovídající skóre „objektivnosti“ a úpravy rámečků pro přednastavené kotevní rámečky různých velikostí a poměrů stran a generují návrhy téměř zdarma.

Strategický dopad

Rychlost a měřítko

Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.

Volby sestavy

Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.

Tým a pracovní postup

Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.

Budoucnost regionálních CNN

Dvoustupňové detektory R-CNN zůstávají silné tam, kde na přesnosti záleží nejvíce, ale jednostupňové detektory (YOLO, SSD) a detektory založené na transformátoru jako DETR, které zcela vynechávají ručně navržené kotvy a návrhy, jsou stále oblíbenější pro rychlost a jednoduchost. Trend je směrem k end-to-end, bezkotvové detekci založené na dotazech. Základní myšlenky linie R-CNN, sdílené funkce a uvažování na úrovni regionu však nadále ovlivňují segmentaci, video a 3D detekční systémy.

Real-World Implementace

Detekce a počítání produktů na maloobchodních regálech pro řízení zásob

Instance segmentace buněk nebo orgánů v lékařských skenech pomocí masky R-CNN

Identifikace závad a jejich umístění na tovární výrobní lince

Lokalizace více vozidel a chodců v kamerách s autonomním řízením

Rizika a zábradlí

Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.

Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.

Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.

Plán implementace

1

Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.

2

Testujte s daty, která odpovídají reálným výrobním podmínkám.

3

Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.

4

Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Region-Based CNNs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Generativní modely založené na skóre

Často kladené otázky

What is Region-Based CNNs?

Region-Based CNN (R-CNN) jsou rodinou detektorů objektů, které nejprve navrhnou kandidátské oblasti v obraze, poté použijí CNN ke klasifikaci a přesnému ohraničení každého objektu. Udělali z klasifikace obrazu úplnou detekci objektů, lokalizaci a označení mnoha objektů najednou.

Jaká je hlavní myšlenka regionální CNN?

R-CNN navrhují oblasti, které mohou obsahovat objekty, a poté spouštějí CNN pro klasifikaci každé oblasti a upřesnění jejího ohraničení.

Proč byl původní R-CNN (2014) pomalý?

Původní R-CNN provozovala CNN nezávisle na zhruba 2 000 regionálních návrzích na snímek, což bylo extrémně výpočetně nákladné.

Co zavedlo Faster R-CNN, aby nahradilo selektivní vyhledávání?

Rychlejší R-CNN představilo naučenou síť pro návrhy regionů, díky níž je vytváření návrhů součástí trénovatelné sítě a je mnohem rychlejší.

Čeho dosahuje sdružování návratnosti investic?

Sdružování návratnosti investic extrahuje mřížky prvků s pevnou velikostí z jediné sdílené mapy prvků na region, čímž se zabrání přepočítávání a zrychlí se detekce.

Jaké další funkce přidává Mask R-CNN?

Maska R-CNN rozšiřuje Faster R-CNN předpovídáním přesné masky na úrovni pixelů pro každý objekt, což umožňuje segmentaci instancí.