A continuaciónSiguiente guía
Redes de carreteras y conexiones de salto
Técnico
GUÍA Técnica
Las redes de cápsulas son una arquitectura neuronal que agrupa neuronas en 'cápsulas' que generan vectores que codifican tanto si existe una característica como su pose (posición, orientación, escala).
They aim to fix a core blindness in standard convolutional networks: losing track of spatial relationships between parts.
Propuestas por Geoffrey Hinton, Sara Sabour y Nicholas Frosst en 2017, las redes de cápsulas reemplazan la salida de una neurona escalar con un vector. La longitud del vector representa la probabilidad de que una entidad (como un ojo o una nariz) esté presente, mientras que su orientación codifica los parámetros de pose. Las cápsulas de nivel inferior predicen la posición de las cápsulas de nivel superior a través de matrices de transformación, y un proceso llamado enrutamiento dinámico por acuerdo decide en qué predicciones confiar. Cuando varias cápsulas parciales coinciden en el mismo todo, el enrutamiento fortalece esa conexión. El CapsNet original logró resultados sólidos en MNIST y fue notablemente robusto ante la superposición de dígitos y transformaciones afines, abordando el "problema de Picasso" donde las CNN aceptan rasgos faciales mezclados como una cara válida.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
Las redes cápsula siguen siendo más una dirección de investigación que un estándar implementado, en gran parte porque el enrutamiento dinámico es computacionalmente costoso y no se adapta bien a imágenes grandes como ImageNet. Trabajos posteriores exploraron el enrutamiento EM (Matrix Capsules) y el enrutamiento basado en la atención personal para mejorar la eficiencia. A medida que crece el interés en la equivarianza, la eficiencia de las muestras y las jerarquías interpretables parte-todo, las ideas cápsula continúan influyendo en la investigación, incluida la posterior propuesta GLOM de Hinton, incluso cuando los Transformers dominan la visión general.
Clasificar dígitos escritos a mano en MNIST mientras se reconstruye la entrada de los vectores de cápsula, mostrando que los parámetros de pose son significativos.
Separar dos dígitos superpuestos (la tarea MultiMNIST) segmentando qué píxeles pertenecen a qué entidad.
Investigación de imágenes médicas que utiliza cápsulas para detectar nódulos pulmonares o tumores cerebrales donde importan las relaciones espaciales parte-todo.
Reconocimiento de objetos desde puntos de vista novedosos con menos ejemplos de entrenamiento, aprovechando la equivarianza de puntos de vista incorporada en la arquitectura.
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Las redes de cápsulas son una arquitectura neuronal que agrupa neuronas en 'cápsulas' que generan vectores que codifican tanto si existe una característica como su pose (posición, orientación, escala). Su objetivo es solucionar una ceguera central en las redes convolucionales estándar: perder la pista de las relaciones espaciales entre las partes.
La longitud (magnitud) del vector codifica la probabilidad de que la entidad exista, mientras que su orientación codifica parámetros de pose como la posición y la rotación.
Las CNN con agrupación máxima descartan relaciones espaciales precisas, por lo que una cara con características fuera de lugar aún puede obtener una puntuación alta. Este es el 'problema de Picasso' que las cápsulas intentan solucionar.
El enrutamiento dinámico por acuerdo fortalece de forma iterativa las conexiones entre cápsulas cuyas predicciones coinciden con la salida de una cápsula mayor.
El artículo de 2017 'Enrutamiento dinámico entre cápsulas' fue escrito por Sara Sabour, Nicholas Frosst y Geoffrey Hinton.
La no linealidad de aplastamiento reduce los vectores cortos hacia cero y limita los vectores largos cerca de la longitud uno, por lo que la magnitud se puede leer como una probabilidad mientras se conserva la orientación (pose).
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Redes de carreteras y conexiones de salto
Técnico