Regionbaserte CNN-er
Region-baserte CNN-er (R-CNN-er) er en familie av objektdetektorer som først foreslår kandidatregioner i et bilde, og deretter bruker en CNN til å klassifisere og presist innbokse hvert objekt.
Oversikt
They turned image classification into full object detection, locating and labeling many objects at once.
Dypdykk
Bildeklassifisering svarer "hva er på dette bildet?" men deteksjon må også svare 'hvor, og hvor mange?' Den originale R-CNN (2014) brukte en ekstern algoritme (selektivt søk) for å foreslå rundt 2000 regioner, forvridd hver til en fast størrelse, og kjørte en CNN på hver, som var nøyaktig, men smertelig sakte. Rask R-CNN fremskyndet dette ved å kjøre CNN én gang over hele bildet og samle funksjoner per region (RoI-pooling). Raskere R-CNN erstattet deretter Selective Search med et lært Region Proposal Network (RPN), noe som gjorde hele rørledningen ende-til-ende og nesten sanntid. Mask R-CNN utvidet den ytterligere for å gi ut masker på pikselnivå for hvert oppdaget objekt.
Teknisk innsikt
Det viktigste effektivitetsspranget er RoI-pooling: i stedet for å kjøre et CNN på nytt på hver foreslåtte boks, beregner nettverket ett delt funksjonskart for bildet, og beskjærer og endrer størrelsen på funksjonene i hver region av interesse til et fast rutenett. Raskere R-CNNs RPN sklir over det funksjonskartet som forutsier "objektivitet"-score og boksjusteringer for forhåndsinnstilte ankerbokser med varierende størrelser og sideforhold, og genererer forslag nesten gratis.
Strategisk innvirkning
Speed and scale
Visual AI kan automatisere inspeksjons-, deteksjons- og merkeoppgaver i stor skala.
Build choices
Kreative team kan prototype konsepter raskere med færre manuelle revisjoner.
Team and workflow
Operasjoner kan bruke bilde- og videosignaler som tidligere var vanskelige å behandle.
Fremtiden til regionbaserte CNN-er
To-trinns R-CNN-detektorer forblir sterke der nøyaktigheten betyr mest, men enkelt-trinns detektorer (YOLO, SSD) og transformatorbaserte detektorer som DETR, som hopper over hånddesignede ankere og forslag, blir stadig mer populære for hastighet og enkelhet. Trenden går mot ende-til-ende, ankerfri, spørringsbasert deteksjon. Likevel fortsetter R-CNN-avstamningens kjerneideer, delte funksjoner og resonnement på regionnivå å påvirke segmenterings-, video- og 3D-deteksjonssystemer.
Real-World Implementering
Oppdage og telle produkter i detaljhandelshyllene for lagerstyring
Forekomstsegmentering av celler eller organer i medisinske skanninger ved bruk av Mask R-CNN
Identifisere defekter og deres plassering på en fabrikkproduksjonslinje
Finne flere kjøretøy og fotgjengere i selvkjørende kamerafeeder
Risikoer og rekkverk
Bilderettigheter og samtykke kan bli juridiske risikoer hvis herkomst er uklart.
Modellytelsen kan variere på tvers av belysning, demografi og miljøer.
Falske positive kan forbli ubemerket med mindre konfidensgrenser overvåkes.
Veikart for implementering
Definer akseptkriterier for presisjons-, tilbakekallings- og feilkostnader.
Test med data som samsvarer med reelle produksjonsforhold.
Legg til menneskelig vurdering for spådommer med lav selvtillit eller stor innvirkning.
Spor modelldrift og revalider etter endringer i kamera eller datasett.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Region-Based CNNs quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Score-baserte generative modeller
Ofte stilte spørsmål
What is Region-Based CNNs?
Region-baserte CNN-er (R-CNN-er) er en familie av objektdetektorer som først foreslår kandidatregioner i et bilde, og deretter bruker en CNN til å klassifisere og presist innbokse hvert objekt. De gjorde bildeklassifisering til full gjenkjenning av objekter, lokalisering og merking av mange objekter samtidig.
Hva er kjerneideen til et regionbasert CNN?
R-CNN-er foreslår regioner som kan inneholde objekter, og kjører deretter en CNN for å klassifisere hver region og avgrense avgrensningsboksen.
Hvorfor var den originale R-CNN (2014) treg?
Den opprinnelige R-CNN drev CNN uavhengig på omtrent 2000 regionforslag per bilde, noe som var ekstremt beregningsmessig dyrt.
Hva introduserte Faster R-CNN for å erstatte selektivt søk?
Raskere R-CNN introduserte et lært Region Proposal Network, noe som gjorde forslagsgenerering til en del av det trenerbare nettverket og langt raskere.
Hva oppnår RoI-pooling?
RoI-pooling trekker ut funksjonsnett i fast størrelse fra et enkelt delt funksjonskart per region, og unngår omberegning og øker hastigheten på gjenkjenning.
Hvilken ekstra funksjon legger Mask R-CNN til?
Mask R-CNN utvider Raskere R-CNN ved å forutsi en presis maske på pikselnivå for hvert objekt, noe som muliggjør forekomstsegmentering.