Konwolucyjne sieci neuronowe
Konwolucyjne sieci neuronowe (CNN) są architekturą niezbędną do zrozumienia obrazów.
Przegląd
Uczą się wzorców wizualnych, przesuwając małe filtry po obrazie, dlatego napędzają wszystko – od odblokowywania twarzy po analizę badań medycznych.
Głębokie nurkowanie
CNN przetwarza obraz, przesuwając po pikselach małe siatki wag, zwane filtrami lub jądrami. Każdy filtr skanuje w poszukiwaniu jednego wzoru, takiego jak krawędź, kolorowa plama lub narożnik. Wczesne warstwy wykrywają proste funkcje; głębsze warstwy łączą je w oczy, koła lub tekst. Ponieważ ten sam filtr jest ponownie używany w każdej pozycji (podział wagi), CNN potrzebuje znacznie mniej parametrów niż w pełni połączona sieć i może wykryć kota, niezależnie od tego, czy pojawia się on w lewym górnym, czy prawym dolnym rogu. Warstwy łączenia zmniejszają obraz pomiędzy krokami, dzięki czemu sieć jest szybsza i bardziej tolerancyjna na małe przesunięcia. Przełomowe projekty, takie jak LeNet, AlexNet (2012) i ResNet, przyczyniły się do boomu w zakresie głębokiego uczenia się, a zwycięstwo ImageNet firmy AlexNet zapoczątkowało nowoczesną erę w tej dziedzinie.
Wgląd techniczny
Podstawową operacją jest splot: filtr (powiedzmy 3x3 wagi) jest nakładany na obszar pikseli, każda waga jest mnożona przez jej piksel, a wyniki są sumowane w jedną liczbę wyjściową. Przesuwanie filtra tworzy mapę obiektów. Dwa pomysły czynią to skutecznym: podział wagi (jeden filtr używany wszędzie) i łączność lokalna (każdy neuron widzi tylko mały obszar). Splot układania, nieliniowość taka jak ReLU i łączenie pozwalają sieci budować hierarchię coraz bardziej abstrakcyjnych cech wizualnych.
Wpływ strategiczny
Jaśniejsze decyzje
Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.
Koszt i budżet
Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.
Zespół i przepływ pracy
Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.
Przyszłość konwolucyjnych sieci neuronowych
Sieci CNN nadal dominują w zakresie widzenia w czasie rzeczywistym i przy ograniczonych zasobach, takich jak kamery telefoniczne i percepcja autonomiczna, ponieważ są szybkie i wydajne w przetwarzaniu danych. Transformatory wizyjne obecnie konkurują z nimi lub je pokonują w przypadku dużych zbiorów danych, zatem cała dziedzina skupia się na projektach hybrydowych, które łączą wydajność splotu z globalnym rozumowaniem uwagi. Można się spodziewać, że CNN pozostaną w urządzeniach wbudowanych i brzegowych, w obrazowaniu medycznym, gdzie jest mało danych, oraz jako wydajne ekstraktory cech zasilające większe systemy multimodalne przez wiele lat.
Implementacja w świecie rzeczywistym
Wykrywanie guzów, złamań i retinopatii cukrzycowej na zdjęciach rentgenowskich, tomografii komputerowej i zdjęciach siatkówki
Obsługa rozpoznawania twarzy w celu odblokowywania telefonu i oznaczania zdjęć w aplikacjach takich jak Google Zdjęcia
Odczytywanie znaków drogowych, oznaczeń pasów ruchu i pieszych w systemach percepcji samochodów autonomicznych
Automatyczne oznaczanie wadliwych produktów na fabrycznych liniach montażowych poprzez kontrolę kamer
Zagrożenia i poręcze
Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.
Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.
Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.
Plan wdrożenia
Zacznij od jasnej definicji potrzebnego wyniku.
Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.
Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.
Dokument, w którym pomocne są konwolucyjne sieci neuronowe i gdzie lepsze są prostsze metody.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Convolutional Neural Networks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Wykres sieci neuronowych
Często zadawane pytania
Czym są sieci neuronowe splotowe?
Konwolucyjne sieci neuronowe (CNN) są architekturą niezbędną do zrozumienia obrazów. Uczą się wzorców wizualnych, przesuwając małe filtry po obrazie, dlatego wspierają wszystko, od rozpoznawania twarzy po analizę skanów medycznych.
Jakie jest główne zadanie filtra (jądra) w CNN?
Filtr to mała siatka ciężarków, która przesuwa się po obrazie i aktywuje się, gdy znajdzie wyuczony wzór, taki jak krawędź lub tekstura.
Dlaczego CNN potrzebuje znacznie mniej parametrów do obrazów niż w pełni połączona sieć?
Dzielenie wag oznacza, że w każdym miejscu obrazu stosowany jest jeden mały filtr, dzięki czemu sieć ponownie wykorzystuje te same wagi, zamiast uczyć się oddzielnych dla każdej lokalizacji piksela.
Do czego zazwyczaj służy warstwa łącząca?
Łączenie (takie jak maksymalne łączenie) zmniejsza próbkowanie mapy obiektów, ograniczając obliczenia i czyniąc sieć mniej wrażliwą na dokładne miejsce pojawienia się obiektu.
Jak w głębokim CNN ogólnie zmieniają się funkcje z wczesnych warstw na późniejsze?
Wczesne warstwy wykrywają cechy niskiego poziomu, takie jak krawędzie i kolory; głębsze warstwy łączą je w koncepcje wyższego poziomu, takie jak twarze lub części obiektów.
Któremu wydarzeniu powszechnie przypisuje się zapoczątkowanie współczesnego boomu na głębokie uczenie się w zakresie wizji?
Dramatyczne zwycięstwo AlexNet w ImageNet w 2012 r., w którym wykorzystano głębokie CNN na procesorach graficznych, przekonało badaczy, że głębokie uczenie się może przewyższać starsze metody, powodując szybki rozwój tej dziedziny.