Visuell AI GUIDE

Regionbaserte CNN-er

Region-baserte CNN-er (R-CNN-er) er en familie av objektdetektorer som først foreslår kandidatregioner i et bilde, og deretter bruker en CNN til å klassifisere og presist innbokse hvert objekt.

2 min lesingSist oppdatert

Oversikt

They turned image classification into full object detection, locating and labeling many objects at once.

Dypdykk

Bildeklassifisering svarer "hva er på dette bildet?" men deteksjon må også svare 'hvor, og hvor mange?' Den originale R-CNN (2014) brukte en ekstern algoritme (selektivt søk) for å foreslå rundt 2000 regioner, forvridd hver til en fast størrelse, og kjørte en CNN på hver, som var nøyaktig, men smertelig sakte. Rask R-CNN fremskyndet dette ved å kjøre CNN én gang over hele bildet og samle funksjoner per region (RoI-pooling). Raskere R-CNN erstattet deretter Selective Search med et lært Region Proposal Network (RPN), noe som gjorde hele rørledningen ende-til-ende og nesten sanntid. Mask R-CNN utvidet den ytterligere for å gi ut masker på pikselnivå for hvert oppdaget objekt.

Teknisk innsikt

Det viktigste effektivitetsspranget er RoI-pooling: i stedet for å kjøre et CNN på nytt på hver foreslåtte boks, beregner nettverket ett delt funksjonskart for bildet, og beskjærer og endrer størrelsen på funksjonene i hver region av interesse til et fast rutenett. Raskere R-CNNs RPN sklir over det funksjonskartet som forutsier "objektivitet"-score og boksjusteringer for forhåndsinnstilte ankerbokser med varierende størrelser og sideforhold, og genererer forslag nesten gratis.

Strategisk innvirkning

Speed and scale

Visual AI kan automatisere inspeksjons-, deteksjons- og merkeoppgaver i stor skala.

Build choices

Kreative team kan prototype konsepter raskere med færre manuelle revisjoner.

Team and workflow

Operasjoner kan bruke bilde- og videosignaler som tidligere var vanskelige å behandle.

Fremtiden til regionbaserte CNN-er

To-trinns R-CNN-detektorer forblir sterke der nøyaktigheten betyr mest, men enkelt-trinns detektorer (YOLO, SSD) og transformatorbaserte detektorer som DETR, som hopper over hånddesignede ankere og forslag, blir stadig mer populære for hastighet og enkelhet. Trenden går mot ende-til-ende, ankerfri, spørringsbasert deteksjon. Likevel fortsetter R-CNN-avstamningens kjerneideer, delte funksjoner og resonnement på regionnivå å påvirke segmenterings-, video- og 3D-deteksjonssystemer.

Real-World Implementering

Oppdage og telle produkter i detaljhandelshyllene for lagerstyring

Forekomstsegmentering av celler eller organer i medisinske skanninger ved bruk av Mask R-CNN

Identifisere defekter og deres plassering på en fabrikkproduksjonslinje

Finne flere kjøretøy og fotgjengere i selvkjørende kamerafeeder

Risikoer og rekkverk

Bilderettigheter og samtykke kan bli juridiske risikoer hvis herkomst er uklart.

Modellytelsen kan variere på tvers av belysning, demografi og miljøer.

Falske positive kan forbli ubemerket med mindre konfidensgrenser overvåkes.

Veikart for implementering

1

Definer akseptkriterier for presisjons-, tilbakekallings- og feilkostnader.

2

Test med data som samsvarer med reelle produksjonsforhold.

3

Legg til menneskelig vurdering for spådommer med lav selvtillit eller stor innvirkning.

4

Spor modelldrift og revalider etter endringer i kamera eller datasett.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Region-Based CNNs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Score-baserte generative modeller

Ofte stilte spørsmål

What is Region-Based CNNs?

Region-baserte CNN-er (R-CNN-er) er en familie av objektdetektorer som først foreslår kandidatregioner i et bilde, og deretter bruker en CNN til å klassifisere og presist innbokse hvert objekt. De gjorde bildeklassifisering til full gjenkjenning av objekter, lokalisering og merking av mange objekter samtidig.

Hva er kjerneideen til et regionbasert CNN?

R-CNN-er foreslår regioner som kan inneholde objekter, og kjører deretter en CNN for å klassifisere hver region og avgrense avgrensningsboksen.

Hvorfor var den originale R-CNN (2014) treg?

Den opprinnelige R-CNN drev CNN uavhengig på omtrent 2000 regionforslag per bilde, noe som var ekstremt beregningsmessig dyrt.

Hva introduserte Faster R-CNN for å erstatte selektivt søk?

Raskere R-CNN introduserte et lært Region Proposal Network, noe som gjorde forslagsgenerering til en del av det trenerbare nettverket og langt raskere.

Hva oppnår RoI-pooling?

RoI-pooling trekker ut funksjonsnett i fast størrelse fra et enkelt delt funksjonskart per region, og unngår omberegning og øker hastigheten på gjenkjenning.

Hvilken ekstra funksjon legger Mask R-CNN til?

Mask R-CNN utvider Raskere R-CNN ved å forutsi en presis maske på pikselnivå for hvert objekt, noe som muliggjør forekomstsegmentering.