基礎知識指南

卷積神經網絡

卷積神經網路 (CNN) 是理解影像的主力架構。

閱讀時間約2分鐘最後更新

概述

他們透過在圖片上滑動小濾鏡來學習視覺模式,這就是為什麼他們為從臉部解鎖到醫學掃描分析的一切提供支援。

深入探討

CNN 透過在像素上滑動小權重網格(稱為濾波器或內核)來處理影像。每個濾鏡掃描一種模式,例如邊緣、顏色斑點或角落。早期層檢測簡單特徵;更深的層將它們組合成眼睛、輪子或文字。由於在每個位置都重複使用相同的過濾器(權重共享),因此 CNN 需要的參數比全連接網絡少得多,並且無論貓出現在左上角還是右下角,都可以發現它。池化層在步驟之間縮小影像,使網路更快並且更能容忍小變化。 LeNet、AlexNet(2012)和 ResNet 等具有里程碑意義的設計推動了深度學習的熱潮,而 AlexNet 在 ImageNet 上的勝利則點燃了該領域的現代時代。

技術洞察

核心運算是卷積:將一個濾波器(例如 3x3 權重)疊加在一塊像素上,每個權重與其像素相乘,並將結果求和為一個輸出數。滑動過濾器會產生特徵圖。有兩個想法可以提高效率:權重共享(在任何地方重複使用一個過濾器)和局部連接(每個神經元只看到一小部分區域)。堆疊卷積、ReLU 等非線性和池化讓網路建構越來越抽象的視覺特徵的層次結構。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

卷積神經網路的未來

CNN 在即時和資源有限的視覺領域(例如手機相機和自動駕駛感知)仍然佔據主導地位,因為它們速度快且數據高效。視覺變形金剛現在在大型資料集上可以與它們競爭或擊敗它們,因此該領域正在融合混合設計,將卷積的效率與注意力的全局推理結合起來。預計 CNN 將在嵌入式和邊緣設備、數據稀缺的醫學成像中持續存在,並在未來幾年作為高效的特徵提取器為更大的多模態系統提供支援。

現實世界的實施

透過 X 光、CT 掃描和視網膜照片檢測腫瘤、骨折和糖尿病視網膜病變

在 Google Photos 等應用程式中為手機解鎖和照片標記提供人臉辨識功能

在自動駕駛汽車感知系統中讀取街道標誌、車道標記和行人

透過攝影機檢查自動標記工廠裝配線上的缺陷產品

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄卷積神經網路在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Convolutional Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

圖神經網路

常見問題

什麼是卷積神經網路?

卷積神經網路 (CNN) 是理解影像的主力架構。他們透過在圖片上滑動小濾鏡來學習視覺模式,這就是為什麼他們為從臉部解鎖到醫學掃描分析的一切提供支援。

CNN 中過濾器(內核)的主要工作是什麼?

濾鏡是一個在影像上滑動的小權重網格,當它發現所學的模式(例如邊緣或紋理)時會啟動。

為什麼 CNN 需要的參數比影像全連接網路少很多?

權重共享意味著在影像中的各處應用一個小濾波器,因此網路重複使用相同的權重,而不是為每個像素位置學習單獨的權重。

池化層通常做什麼?

池化(例如最大池化)對特徵圖進行下採樣,減少計算量並使網路對特徵出現的確切位置不太敏感。

在深度 CNN 中,從早期層到後期層的特徵通常如何變化?

早期層檢測邊緣和顏色等低階特徵;更深的層將這些組合成更高層次的概念,例如臉部或物體部分。

哪一事件被廣泛認為開啟了現代視覺深度學習熱潮?

AlexNet 在 2012 年使用 GPU 上的深度 CNN 在 ImageNet 上取得了戲劇性的勝利,讓研究人員相信深度學習可以超越舊方法,從而引發該領域的快速發展。