Alapok ÚTMUTATÓ

Konvolúciós neurális hálózatok

A konvolúciós neurális hálózatok (CNN-ek) a képek megértésének igásló architektúrája.

2 perc olvasásUtoljára frissítve

Áttekintés

They learn visual patterns by sliding small filters across a picture, which is why they power everything from face unlock to medical scan analysis.

Mély merülés

A CNN úgy dolgozza fel a képet, hogy kis súlyrácsokat, úgynevezett szűrőket vagy kerneleket csúsztat a pixeleken. Mindegyik szűrő egy mintát, például élt, színfoltot vagy sarkot keres. A korai rétegek egyszerű jellemzőket észlelnek; mélyebb rétegek egyesítik őket szemekké, kerekekké vagy szöveggé. Mivel ugyanazt a szűrőt minden pozícióban újrahasznosítják (súlymegosztás), a CNN-nek sokkal kevesebb paraméterre van szüksége, mint egy teljesen csatlakoztatott hálózatnak, és képes észlelni egy macskát, akár a bal felső, akár a jobb alsó sarokban jelenik meg. A rétegek összevonása csökkenti a képet a lépések között, így a hálózat gyorsabb és toleránsabb a kis eltolódásokkal szemben. Az olyan nevezetes tervek, mint a LeNet, az AlexNet (2012) és a ResNet indították el a mély tanulási fellendülést, az AlexNet ImageNet győzelme pedig elindította a terület modern korszakát.

Technikai betekintés

Az alapművelet a konvolúció: egy szűrőt (mondjuk 3x3-as súlyokat) egy pixelfoltra helyeznek, minden súlyt megszoroznak a pixelével, és az eredményeket egy kimeneti számba összegzik. A szűrő elcsúsztatásával egy tereptérkép jön létre. Két ötlet teszi ezt hatékonnyá: a súlymegosztás (egy szűrőt mindenhol újra használnak) és a helyi kapcsolat (minden neuron csak egy kis régiót lát). A halmozási konvolúció, a ReLU-hoz hasonló nemlinearitás és a pooling lehetővé teszi a hálózat számára, hogy egyre absztraktabb vizuális jellemzők hierarchiáját építse fel.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

A konvolúciós neurális hálózatok jövője

A CNN-ek továbbra is dominánsak a valós idejű és az erőforrások által korlátozott látásmódban, például a telefonkamerákban és az önvezető észlelésben, mivel gyorsak és adathatékonyak. A Vision Transformers ma már nagy adathalmazokon vetekszik vagy legyőzi őket, így a terület egyre inkább a hibrid tervek felé közeledik, amelyek a konvolúció hatékonyságát a figyelem globális érvelésével kombinálják. Várható, hogy a CNN-ek megmaradnak a beágyazott és szélső eszközökben, az orvosi képalkotásban, ahol kevés az adat, és mint hatékony funkció-elnyelők, amelyek a nagyobb multimodális rendszereket táplálják az elkövetkező években.

Valós megvalósítás

Daganatok, törések és diabéteszes retinopátia kimutatása röntgenfelvételeken, CT-vizsgálatokon és retinafotókon

Arcfelismerés a telefon feloldásához és a fényképek címkézéséhez olyan alkalmazásokban, mint a Google Photos

Utcatáblák, sávjelzések és gyalogosok olvasása az önvezető autók érzékelési rendszerében

A hibás termékek automatikus megjelölése a gyári összeszerelő sorokon kamerás ellenőrzéssel

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, hol segít a konvolúciós neurális hálózat, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Convolutional Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Neurális hálózatok gráfja

Gyakran ismételt kérdések

What is Convolutional Neural Networks?

A konvolúciós neurális hálózatok (CNN-ek) a képek megértésének igásló architektúrája. Úgy tanulják meg a vizuális mintákat, hogy kis szűrőket csúsztatnak a képen, ezért mindent megtesznek az arcfeloldástól az orvosi szkennelés elemzéséig.

Mi a szűrő (kernel) fő feladata a CNN-ben?

A szűrő egy kis súlyrács, amely a kép fölé csúszik, és akkor aktiválódik, amikor megtalálja a megtanult mintát, például egy élt vagy textúrát.

Miért van szüksége egy CNN-nek sokkal kevesebb paraméterre, mint egy teljesen csatlakoztatott hálózatnak a képekhez?

A súlymegosztás azt jelenti, hogy a képen mindenhol egy kis szűrőt alkalmaznak, így a hálózat ugyanazokat a súlyokat használja, ahelyett, hogy minden pixelhelyhez külön tanulna.

Mit csinál a pooling réteg általában?

A pooling (mint például a max pooling) lemintázza a tereptárgytérképet, csökkentve a számítási időt, és kevésbé érzékennyé teszi a hálózatot arra, hogy pontosan hol jelennek meg a jellemzők.

Egy mély CNN-ben hogyan változnak a jellemzők általában a korai rétegekről a későbbi rétegekre?

A korai rétegek olyan alacsony szintű elemeket észlelnek, mint az élek és a színek; a mélyebb rétegek ezeket magasabb szintű fogalmakban, például arcokban vagy tárgyrészekben egyesítik.

Melyik eseménynek tulajdonítják széles körben a jövőkép modern mélytanulási fellendülését?

Az AlexNet drámai, 2012-es ImageNet győzelme a GPU-kon végzett mély CNN segítségével meggyőzte a kutatókat arról, hogy a mélytanulás felülmúlhatja a régebbi módszereket, ami a terület gyors növekedését idézi elő.