PODSTAWOWY PRZEWODNIK

Konwolucyjne sieci neuronowe

Konwolucyjne sieci neuronowe (CNN) są architekturą niezbędną do zrozumienia obrazów.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Uczą się wzorców wizualnych, przesuwając małe filtry po obrazie, dlatego napędzają wszystko – od odblokowywania twarzy po analizę badań medycznych.

Głębokie nurkowanie

CNN przetwarza obraz, przesuwając po pikselach małe siatki wag, zwane filtrami lub jądrami. Każdy filtr skanuje w poszukiwaniu jednego wzoru, takiego jak krawędź, kolorowa plama lub narożnik. Wczesne warstwy wykrywają proste funkcje; głębsze warstwy łączą je w oczy, koła lub tekst. Ponieważ ten sam filtr jest ponownie używany w każdej pozycji (podział wagi), CNN potrzebuje znacznie mniej parametrów niż w pełni połączona sieć i może wykryć kota, niezależnie od tego, czy pojawia się on w lewym górnym, czy prawym dolnym rogu. Warstwy łączenia zmniejszają obraz pomiędzy krokami, dzięki czemu sieć jest szybsza i bardziej tolerancyjna na małe przesunięcia. Przełomowe projekty, takie jak LeNet, AlexNet (2012) i ResNet, przyczyniły się do boomu w zakresie głębokiego uczenia się, a zwycięstwo ImageNet firmy AlexNet zapoczątkowało nowoczesną erę w tej dziedzinie.

Wgląd techniczny

Podstawową operacją jest splot: filtr (powiedzmy 3x3 wagi) jest nakładany na obszar pikseli, każda waga jest mnożona przez jej piksel, a wyniki są sumowane w jedną liczbę wyjściową. Przesuwanie filtra tworzy mapę obiektów. Dwa pomysły czynią to skutecznym: podział wagi (jeden filtr używany wszędzie) i łączność lokalna (każdy neuron widzi tylko mały obszar). Splot układania, nieliniowość taka jak ReLU i łączenie pozwalają sieci budować hierarchię coraz bardziej abstrakcyjnych cech wizualnych.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość konwolucyjnych sieci neuronowych

Sieci CNN nadal dominują w zakresie widzenia w czasie rzeczywistym i przy ograniczonych zasobach, takich jak kamery telefoniczne i percepcja autonomiczna, ponieważ są szybkie i wydajne w przetwarzaniu danych. Transformatory wizyjne obecnie konkurują z nimi lub je pokonują w przypadku dużych zbiorów danych, zatem cała dziedzina skupia się na projektach hybrydowych, które łączą wydajność splotu z globalnym rozumowaniem uwagi. Można się spodziewać, że CNN pozostaną w urządzeniach wbudowanych i brzegowych, w obrazowaniu medycznym, gdzie jest mało danych, oraz jako wydajne ekstraktory cech zasilające większe systemy multimodalne przez wiele lat.

Implementacja w świecie rzeczywistym

Wykrywanie guzów, złamań i retinopatii cukrzycowej na zdjęciach rentgenowskich, tomografii komputerowej i zdjęciach siatkówki

Obsługa rozpoznawania twarzy w celu odblokowywania telefonu i oznaczania zdjęć w aplikacjach takich jak Google Zdjęcia

Odczytywanie znaków drogowych, oznaczeń pasów ruchu i pieszych w systemach percepcji samochodów autonomicznych

Automatyczne oznaczanie wadliwych produktów na fabrycznych liniach montażowych poprzez kontrolę kamer

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokument, w którym pomocne są konwolucyjne sieci neuronowe i gdzie lepsze są prostsze metody.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Convolutional Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Wykres sieci neuronowych

Często zadawane pytania

Czym są sieci neuronowe splotowe?

Konwolucyjne sieci neuronowe (CNN) są architekturą niezbędną do zrozumienia obrazów. Uczą się wzorców wizualnych, przesuwając małe filtry po obrazie, dlatego wspierają wszystko, od rozpoznawania twarzy po analizę skanów medycznych.

Jakie jest główne zadanie filtra (jądra) w CNN?

Filtr to mała siatka ciężarków, która przesuwa się po obrazie i aktywuje się, gdy znajdzie wyuczony wzór, taki jak krawędź lub tekstura.

Dlaczego CNN potrzebuje znacznie mniej parametrów do obrazów niż w pełni połączona sieć?

Dzielenie wag oznacza, że ​​w każdym miejscu obrazu stosowany jest jeden mały filtr, dzięki czemu sieć ponownie wykorzystuje te same wagi, zamiast uczyć się oddzielnych dla każdej lokalizacji piksela.

Do czego zazwyczaj służy warstwa łącząca?

Łączenie (takie jak maksymalne łączenie) zmniejsza próbkowanie mapy obiektów, ograniczając obliczenia i czyniąc sieć mniej wrażliwą na dokładne miejsce pojawienia się obiektu.

Jak w głębokim CNN ogólnie zmieniają się funkcje z wczesnych warstw na późniejsze?

Wczesne warstwy wykrywają cechy niskiego poziomu, takie jak krawędzie i kolory; głębsze warstwy łączą je w koncepcje wyższego poziomu, takie jak twarze lub części obiektów.

Któremu wydarzeniu powszechnie przypisuje się zapoczątkowanie współczesnego boomu na głębokie uczenie się w zakresie wizji?

Dramatyczne zwycięstwo AlexNet w ImageNet w 2012 r., w którym wykorzystano głębokie CNN na procesorach graficznych, przekonało badaczy, że głębokie uczenie się może przewyższać starsze metody, powodując szybki rozwój tej dziedziny.