Műszaki ÚTMUTATÓ

Mélységben szétválasztható konvolúciók

A mélységben szétválasztható konvolúciók a standard konvolúciót két olcsóbb lépésre teszik, csökkentve a szorzások és a paraméterek számát.

2 perc olvasásUtoljára frissítve

Áttekintés

They are the trick that lets neural networks run on phones and edge devices without melting the battery.

Mély merülés

A szabványos konvolúció egyetlen sűrű műveletben keveri össze az információkat mind a térben, mind a csatornákon keresztül, ami drága. Egy mélységben szétválasztható konvolúció ezt két szakaszra osztja. Először is, a mélységi lépés egy kis szűrőt alkalmaz bemeneti csatornánként függetlenül, térbeli mintázatokat rögzítve az egyes csatornákon belül, de soha nem keveri a csatornákat. Másodszor, a pontonkénti lépés 1x1 konvolúciót használ a csatornák egyesítésére az egyes pixeleknél, keverve a csatornainformációkat anélkül, hogy a szomszédokra nézne. A térbeli szűrés és a csatornakeverés szétválasztásával a teljes számítás drámaian csökken, gyakran 8-9-szeresére egy 3x3-as szűrő esetén, csak kis pontossági veszteséggel. Ez a faktorizáció a MobileNet és az Xception gerince.

Technikai betekintés

Egy 3x3-as kernel esetében, amely M bemeneti csatornát N kimenetre leképez egy jellemzőtérképen, egy szabványos konvolúció nagyjából 9-szer M-szer N szorzóösszeadás helyenként. A szétválasztható változat ára 9-szer M a mélységi résznél, plusz M-szer N a hegyes 1x1-nél. Az arány körülbelül 1/N + 1/9, tehát nagy N esetén a megtakarítás megközelíti az 1/9-es térbeli tényezőt.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A mélységben szétválasztható konvolúciók jövője

A mélyen szétválasztható konvolúciók továbbra is a hatékony látásmodellek egyik legfontosabb eleme, és egyre gyakrabban jelennek meg a hibrid CNN-transzformátorokban, mint például a MobileViT és a ConvNeXt blokkok. Az eszközön lévő mesterséges intelligencia növekedésével a hardveres gyorsítók natív támogatást adnak a mélységi műveletekhez. Folyamatos használat várható a valós idejű látásban, a hordható érzékelőkben és minden olyan beállításban, ahol szűk a késleltetés, a memória és az energiaköltség, gyakran kvantálással és neurális architektúra kereséssel kombinálva.

Valós megvalósítás

A MobileNet és a MobileNetV2 ezeket használja a képosztályozás közvetlen futtatására az okostelefonokon minimális késleltetéssel

A valós idejű portrészegmentálás és a háttér elmosódása a videohívási alkalmazásokban a könnyű, szétválasztható gerinceken alapul

Objektumérzékelés az eszközön a biztonsági kamerákban és drónokban, ahol a teljesítmény és a számítási teljesítmény korlátozott

Az Xception nagy léptékben alkalmazza őket az ImageNet pontosságának növelésére, miközben szabályozza a paraméterek számát

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Depthwise Separable Convolutions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Deformálható konvolúciók

Gyakran ismételt kérdések

What is Depthwise Separable Convolutions?

A mélységben szétválasztható konvolúciók a standard konvolúciót két olcsóbb lépésre teszik, csökkentve a szorzások és a paraméterek számát. Ezek a trükkök, amelyek lehetővé teszik a neurális hálózatok futtatását telefonokon és szélső eszközökön anélkül, hogy az akkumulátor megolvadna.

Mi az a két lépés, amelyre a mélységben szétválasztható konvolúció felosztja a standard konvolúciót?

A mélységi lépés az egyes csatornákat külön térben szűri, a pontirányú 1x1 lépés pedig egyesíti az információkat a csatornák között.

A mélységi lépésben hogyan kezelik a bemeneti csatornákat?

A mélységi konvolúció minden bemeneti csatornára külön térbeli szűrőt alkalmaz csatornák keverése nélkül, ami miatt olcsó.

Körülbelül mennyivel csökkentheti a számítást egy 3x3-as mélységben szétválasztható konvolúció egy szabványos, sok kimeneti csatornával rendelkező 3x3-as konvolúcióhoz képest?

Egy 3x3-as kernel esetében a megtakarítási arány megközelíti az 1/9-et, ha nagy a kimeneti csatornák száma, ami nagyjából 8-9-szer kevesebb műveletet eredményez.

Mi a szerepe a pontszerű (1x1) konvolúciónak ebben a tervezésben?

Az 1x1 pontszerű konvolúció minden pixelnél keveri a csatornákat, amit a mélységi lépés szándékosan elkerült.

Melyik jól ismert architektúra népszerűsítette a mélységben szétválasztható konvolúciókat a mobil eszközök számára?

A MobileNet mélységben szétválasztható konvolúciók köré épült, kifejezetten azért, hogy hatékony következtetéseket lehessen levonni a telefonokon.