Műszaki ÚTMUTATÓ

Kapszula hálózatok

A kapszulahálózatok olyan neurális architektúrák, amelyek a neuronokat „kapszulákba” csoportosítják, amelyek vektorokat adnak ki, amelyek kódolják mind azt, hogy létezik-e egy adottság, mind pedig annak helyzetét (pozíció, tájolás, lépték).

2 perc olvasásUtoljára frissítve

Áttekintés

They aim to fix a core blindness in standard convolutional networks: losing track of spatial relationships between parts.

Mély merülés

A Geoffrey Hinton, Sara Sabour és Nicholas Frosst által 2017-ben javasolt kapszulahálózatok a skaláris neuron kimenetét vektorral helyettesítik. A vektor hossza azt a valószínűséget jelenti, hogy egy entitás (például egy szem vagy egy orr) jelen van, míg az orientációja pózparamétereket kódol. Az alacsonyabb szintű kapszulák transzformációs mátrixokon keresztül jósolják meg a magasabb szintű kapszulák helyzetét, és egy megállapodásonkénti dinamikus útválasztásnak nevezett folyamat dönti el, hogy melyik előrejelzésben bízzon meg. Ha több részkapszula megegyezik ugyanabban az egészben, az útválasztás megerősíti ezt a kapcsolatot. Az eredeti CapsNet erős eredményeket ért el az MNIST-en, és különösen robusztus volt az átfedő számjegyek és az affin transzformációk tekintetében, megoldva a „Picasso-problémát”, ahol a CNN-ek a zavaros arcvonásokat érvényes arcként fogadják el.

Technikai betekintés

A kulcsmechanizmus egy „squash” nemlinearitás, amely a rövid vektorokat nulla felé, a hosszú vektorokat pedig egy hosszúság felé zsugorítja, így a vektor nagysága valószínűségnek számít. A dinamikus útválasztás ezután néhány iterációt futtat egy softmax-súlyozott megegyezési lépésből: minden alsó kapszula felfelé küldi az előrejelzését, és a csatolási együtthatók nőnek a magasabb kapszuláknál, amelyek kimenete (pontszorzaton keresztül) igazodik ehhez az előrejelzéshez. Ez felváltja a max-pooling-et, megőrizve a pontos térinformációkat ahelyett, hogy elvetné azokat.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A kapszulahálózatok jövője

A kapszulahálózatok továbbra is inkább kutatási irányok, semmint alkalmazott szabványok, főként azért, mert a dinamikus útválasztás számítási szempontból költséges, és rosszul méretezhető olyan nagyméretű képekhez, mint az ImageNet. A későbbi munkák az EM útválasztást (Matrix Capsules) és az önfigyelem alapú útválasztást vizsgálták a hatékonyság javítása érdekében. Ahogy az ekvivariancia, a minta hatékonysága és az értelmezhető rész-egész hierarchiák iránti érdeklődés növekszik, a kapszulaötletek továbbra is befolyásolják a kutatást, beleértve Hinton későbbi GLOM-javaslatát, még akkor is, ha a Transformers uralja a mainstream víziót.

Valós megvalósítás

A kézírásos számjegyek osztályozása az MNIST-en, miközben a kapszulavektorokból rekonstruálja a bemenetet, és megmutatja a pózparamétereket, értelmes.

Két egymást átfedő számjegy elválasztása (a MultiMNIST feladat) szegmentálva, hogy mely pixelek melyik entitáshoz tartoznak.

Orvosi képalkotó kutatás kapszulákkal tüdőcsomók vagy agydaganatok kimutatására, ahol a rész-egész térbeli kapcsolatok számítanak.

Az objektumok felismerése újszerű nézőpontokból, kevesebb gyakorlati példával, kihasználva az architektúra beépített nézőpont-egyenértékűségét.

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Capsule Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Autópálya-hálózatok és kapcsolatok kihagyása

Gyakran ismételt kérdések

What is Capsule Networks?

A kapszulahálózatok olyan neurális architektúrák, amelyek a neuronokat „kapszulákba” csoportosítják, amelyek vektorokat adnak ki, amelyek kódolják mind azt, hogy létezik-e egy adottság, mind pedig annak helyzetét (pozíció, tájolás, lépték). Céljuk a szabványos konvolúciós hálózatok alapvető vakságának kijavítása: az alkatrészek közötti térbeli kapcsolatok nyomának elvesztése.

Mit jelent egy kapszula hálózatban a kapszula kimeneti vektorának HOSSZA?

A vektor hossza (nagysága) az entitás létezésének valószínűségét kódolja, míg az orientációja olyan pózparamétereket kódol, mint a pozíció és az elforgatás.

Milyen problémára tervezték a kapszulahálózatokat a szabványos CNN-ekkel?

A max-pooling funkcióval rendelkező CNN-ek elvetik a pontos térbeli kapcsolatokat, így a rosszul elhelyezett jellemzőkkel rendelkező arc továbbra is magas pontszámot érhet el. Ezt a „Picasso-problémát” próbálják megoldani a kapszulák.

Mi a neve annak az algoritmusnak, amely eldönti, hogy melyik alacsonyabb szintű kapszula melyik magasabb szintű kapszulához csatlakozzon?

A megállapodásonkénti dinamikus útválasztás iteratív módon erősíti a kapcsolatokat a kapszulák között, amelyek előrejelzései megegyeznek a magasabb kapszula kimenetével.

Ki vezette be a kapszulahálózatot dinamikus útválasztással 2017-ben?

A 2017-es „Dynamic Routing Between Capsules” című tanulmányt Sara Sabour, Nicholas Frosst és Geoffrey Hinton írta.

Mi a célja a „squash” funkciónak egy kapszulahálózatban?

A squash nemlinearitás a rövid vektorokat nulla felé zsugorítja, a hosszú vektorokat pedig egy hosszúság közelébe zárja, így a nagyság valószínűségként olvasható le, miközben az orientáció (póz) megmarad.