Als nächstesNächster Leitfaden
Autobahnnetze und Skip-Verbindungen
Technisch
Technischer Leitfaden
Kapselnetzwerke sind eine neuronale Architektur, die Neuronen in „Kapseln“ gruppiert, die Vektoren ausgeben, die sowohl die Existenz eines Merkmals als auch seine Lage (Position, Ausrichtung, Maßstab) kodieren.
Sie zielen darauf ab, eine zentrale Schwachstelle in Standard-Faltungsnetzwerken zu beheben: den Überblick über räumliche Beziehungen zwischen Teilen zu verlieren.
Kapselnetzwerke wurden 2017 von Geoffrey Hinton, Sara Sabour und Nicholas Frosst vorgeschlagen und ersetzen einen skalaren Neuronenausgang durch einen Vektor. Die Länge des Vektors stellt die Wahrscheinlichkeit dar, dass eine Entität (wie ein Auge oder eine Nase) vorhanden ist, während seine Ausrichtung Posenparameter kodiert. Kapseln auf niedrigerer Ebene sagen die Position von Kapseln auf höherer Ebene durch Transformationsmatrizen voraus, und ein Prozess namens dynamisches Routing-by-Agreement entscheidet, welchen Vorhersagen vertraut werden soll. Wenn sich mehrere Teilkapseln auf dasselbe Ganze einigen, stärkt das Routing diese Verbindung. Das ursprüngliche CapsNet erzielte starke Ergebnisse bei MNIST und war besonders robust gegenüber überlappenden Ziffern und affinen Transformationen, wodurch das „Picasso-Problem“ gelöst wurde, bei dem CNNs durcheinandergebrachte Gesichtszüge als gültiges Gesicht akzeptieren.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Kapselnetzwerke bleiben eher eine Forschungsrichtung als ein implementierter Standard, vor allem weil dynamisches Routing rechenintensiv ist und sich schlecht auf große Bilder wie ImageNet skalieren lässt. Spätere Arbeiten untersuchten EM-Routing (Matrix Capsules) und auf Selbstaufmerksamkeit basierendes Routing, um die Effizienz zu verbessern. Während das Interesse an Äquivarianz, Stichprobeneffizienz und interpretierbaren Teil-Ganze-Hierarchien zunimmt, beeinflussen Kapselideen weiterhin die Forschung, einschließlich Hintons späterem GLOM-Vorschlag, auch wenn Transformer die Mainstream-Vision dominieren.
Die Klassifizierung handgeschriebener Ziffern auf MNIST bei gleichzeitiger Rekonstruktion der Eingabe aus Kapselvektoren und die Anzeige der Posenparameter sind aussagekräftig.
Trennen zweier überlappender Ziffern (die MultiMNIST-Aufgabe) durch Segmentieren, welche Pixel zu welcher Entität gehören.
Medizinische Bildgebungsforschung mit Kapseln zur Erkennung von Lungenknötchen oder Hirntumoren, bei denen Teil-Ganzes-Raumbeziehungen von Bedeutung sind.
Erkennen von Objekten aus neuartigen Blickwinkeln mit weniger Trainingsbeispielen unter Nutzung der integrierten Blickpunktäquivarianz der Architektur.
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Kapselnetzwerke sind eine neuronale Architektur, die Neuronen in „Kapseln“ gruppiert, die Vektoren ausgeben, die sowohl die Existenz eines Merkmals als auch seine Lage (Position, Ausrichtung, Maßstab) kodieren. Sie zielen darauf ab, eine zentrale Schwachstelle in Standard-Faltungsnetzwerken zu beheben: den Überblick über räumliche Beziehungen zwischen Teilen zu verlieren.
Die Länge (Größe) des Vektors kodiert die Wahrscheinlichkeit, dass die Entität existiert, während seine Ausrichtung Posenparameter wie Position und Drehung kodiert.
CNNs mit Max-Pooling verwerfen präzise räumliche Beziehungen, sodass ein Gesicht mit falsch platzierten Merkmalen immer noch gut punkten kann. Dies ist das „Picasso-Problem“, das die Kapseln zu beheben versuchen.
Dynamisches Routing-by-Agreement stärkt iterativ die Verbindungen zwischen Kapseln, deren Vorhersagen mit der Leistung einer höheren Kapsel übereinstimmen.
Der Artikel „Dynamic Routing Between Capsules“ aus dem Jahr 2017 wurde von Sara Sabour, Nicholas Frosst und Geoffrey Hinton verfasst.
Die Squash-Nichtlinearität schrumpft kurze Vektoren in Richtung Null und begrenzt lange Vektoren nahe der Länge eins, sodass die Größe als Wahrscheinlichkeit gelesen werden kann, während die Ausrichtung (Pose) erhalten bleibt.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Autobahnnetze und Skip-Verbindungen
Technisch