GUÍA visual de IA

CNN basadas en regiones

Las CNN basadas en regiones (R-CNN) son una familia de detectores de objetos que primero proponen regiones candidatas en una imagen y luego usan una CNN para clasificar y encuadrar con precisión cada objeto.

2 minutos de lecturaÚltima actualización

Descripción general

They turned image classification into full object detection, locating and labeling many objects at once.

Buceo profundo

La clasificación de imágenes responde "¿qué hay en esta imagen?" pero la detección también debe responder "¿dónde y cuántos?" La R-CNN original (2014) utilizó un algoritmo externo (búsqueda selectiva) para proponer alrededor de 2000 regiones, deformó cada una a un tamaño fijo y ejecutó una CNN en cada una, lo cual era preciso pero tremendamente lento. Fast R-CNN aceleró esto ejecutando CNN una vez sobre toda la imagen y agrupando características por región (agrupación de RoI). Luego, un R-CNN más rápido reemplazó la búsqueda selectiva con una red de propuestas regionales (RPN) aprendida, lo que hizo que todo el proceso fuera de un extremo a otro y casi en tiempo real. Mask R-CNN lo amplió aún más para generar máscaras a nivel de píxeles para cada objeto detectado.

Información técnica

El salto de eficiencia clave es la agrupación de RoI: en lugar de volver a ejecutar una CNN en cada cuadro propuesto, la red calcula un mapa de características compartido para la imagen, luego recorta y cambia el tamaño de las características dentro de cada región de interés a una cuadrícula fija. El RPN de R-CNN más rápido se desliza sobre ese mapa de características prediciendo puntuaciones de "objetividad" y ajustes de cuadro para cuadros de anclaje preestablecidos de diferentes tamaños y relaciones de aspecto, generando propuestas casi gratis.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de las CNN regionales

Los detectores R-CNN de dos etapas siguen siendo fuertes donde la precisión es más importante, pero los detectores de una sola etapa (YOLO, SSD) y los detectores basados ​​en transformadores como DETR, que omiten por completo los anclajes y las propuestas diseñadas a mano, son cada vez más populares por su velocidad y simplicidad. La tendencia es hacia una detección basada en consultas, de extremo a extremo y sin anclajes. Aún así, las ideas centrales del linaje R-CNN, las características compartidas y el razonamiento a nivel regional continúan influyendo en los sistemas de segmentación, video y detección 3D.

Implementación en el mundo real

Detección y conteo de productos en estantes minoristas para gestión de inventario

Segmentación de instancias de células u órganos en exploraciones médicas utilizando Mask R-CNN

Identificar defectos y sus ubicaciones en una línea de producción de una fábrica.

Localización de múltiples vehículos y peatones en transmisiones de cámaras de conducción autónoma

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Region-Based CNNs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Modelos generativos basados ​​en puntuaciones

Preguntas frecuentes

What is Region-Based CNNs?

Las CNN basadas en regiones (R-CNN) son una familia de detectores de objetos que primero proponen regiones candidatas en una imagen y luego usan una CNN para clasificar y encuadrar con precisión cada objeto. Convertieron la clasificación de imágenes en detección completa de objetos, localizando y etiquetando muchos objetos a la vez.

¿Cuál es la idea central de una CNN regional?

Las R-CNN proponen regiones que podrían contener objetos y luego ejecutan una CNN para clasificar cada región y refinar su cuadro delimitador.

¿Por qué fue lento el R-CNN original (2014)?

La R-CNN original ejecutó la CNN de forma independiente en aproximadamente 2000 propuestas de región por imagen, lo que era extremadamente costoso desde el punto de vista computacional.

¿Qué introdujo Faster R-CNN para reemplazar la búsqueda selectiva?

R-CNN más rápido introdujo una red de propuestas regionales aprendida, lo que hace que la generación de propuestas forme parte de la red entrenable y sea mucho más rápida.

¿Qué logra la agrupación de RoI?

La agrupación de RoI extrae cuadrículas de características de tamaño fijo de un único mapa de características compartido por región, evitando el recálculo y acelerando la detección.

¿Qué capacidad adicional agrega Mask R-CNN?

Mask R-CNN extiende Faster R-CNN al predecir una máscara precisa a nivel de píxel para cada objeto, lo que permite la segmentación de instancias.