帶動量的隨機梯度下降
動量是梯度下降的一種調整,它累積過去梯度的運行平均值,讓優化更快地穿過山谷並抑制振盪。
概述
It is one of the most widely used training tricks in deep learning.
深入探討
普通隨機梯度下降 (SGD) 透過與當前小批量梯度相反的方向步進來更新參數。在形狀像狹長峽谷的風景中,河流蜿蜒穿過陡峭的牆壁,同時沿著平緩的地板爬行。由 Polyak 和後來的 Rumelhart 及其同事推廣的動量透過維持速度向量來解決這個問題:每一步都將新的梯度與先前速度的一小部分(動量係數,通常為 0.9)混合。一致的梯度方向會增強和加速,而振盪分量會部分抵消。物理上的類比是一個滾下坡的重球:它會在穩定的方向上增加速度,並且較少因嘈雜的顛簸而偏轉,從而比普通 SGD 提供更快、更平滑的收斂。
技術洞察
更新保持速度 v,更新為 v = beta * v + 梯度,然後參數移動負學習率乘以 v。使用動量係數 beta,一致方向的有效步長大致放大 1/(1 - beta) 倍;當 beta = 0.9 時,大約是十倍。從數學上講,這是梯度的指數加權移動平均值,可以平滑小批量噪聲,同時保留主要下降方向。
戰略影響
更明確的決策
它可以幫助您將清晰的技術聲明與行銷語言分開。
成本與預算
在花費金錢或時間之前,您可以提出更好的實施問題。
團隊與工作流程
具有共同理解的團隊可以做出更好的產品、政策和學習決策。
動量隨機梯度下降的未來
動量仍然是基礎:像 Adam 及其變體這樣的自適應優化器嵌入了動量式一階矩估計,而帶有動量的 SGD 仍然是一個強大的基線,通常比大型視覺模型上的自適應方法具有更好的泛化能力。關於動量調度、解耦權重衰減及其與超大規模訓練的相互作用的研究仍在繼續。隨著優化器針對更大的模型不斷發展,預計動力仍將是核心組成部分。
現實世界的實施
訓練像 ResNet 這樣的深度卷積網絡,其中動量為 0.9 的 SGD 是標準配方。
使用小批量時平滑雜訊梯度估計。
透過攜帶速度穿過平坦區域來逃離淺層局部高原。
用作自適應優化器(例如 Adam 和 RMSprop 變體)中的動量項。
風險與防護欄
不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。
基準測試可能看起來很強大,但實際效能卻參差不齊。
忽視數據品質和評估計劃通常會產生脆弱的結果。
實施路線圖
從您需要的結果的簡單語言定義開始。
在測試之前選擇一種成功指標和一種失敗條件。
使用代表性資料運行小型試點,而不是完善的演示集。
記錄動量隨機梯度下降在哪些方面有幫助,以及哪些更簡單的方法更好。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stochastic Gradient Descent with Momentum quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Stochastic Gradient Descent with Momentum?
動量是梯度下降的一種調整,它累積過去梯度的運行平均值,讓優化更快地穿過山谷並抑制振盪。它是深度學習中使用最廣泛的訓練技巧之一。
訓練過程中動量項累積了什麼?
Momentum 維護一個速度向量,該向量是最近梯度的指數加權移動平均值,從而平滑更新方向。
在又長又窄的峽谷中,普通 SGD 會遇到什麼問題而動量可以幫助解決?
如果沒有動量,SGD 就會在峽谷的陡峭方向上振盪。動量抵消了這些振盪並沿著平緩的谷底加速。
哪一種物理類比最常用來描述動量?
動量被比作一個重球,它可以在一致的方向上增加速度,並抵抗噪音碰撞帶來的偏轉。
當 beta = 0.9 時,動量將沿著一致方向的有效步驟放大約多少?
放大係數約為 1/(1 - beta),且 1/(1 - 0.9) = 10,因此一致的方向速度大約加快十倍。
哪一種現代優化器包含動量式一階矩估計?
Adam 將梯度的類似動量的一階矩(平均值)估計值與二階矩(變異數)估計值相結合以實現自適應縮放。