權重衰減和 L2 正則化
權重衰減是一種簡單而強大的技術,可以在訓練過程中將模型的權重推向零,防止模型過度依賴任何單一特徵。
概述
It reduces overfitting and is one of the most widely used regularizers in deep learning.
深入探討
當模型訓練時,它可以透過增加大的、經過微調的權重來捕捉資料中的噪聲,這些權重完美地適合訓練集,但泛化能力很差。 L2 正則化透過將損失函數加上與權重平方和成比例的懲罰來解決這個問題。優化器現在有兩個目標:擬合資料並保持較小的權重,因此它會選擇更平滑、更穩健的解決方案。權重衰減是與每個更新步驟將每個權重縮小一小部分密切相關的想法。對於普通梯度下降,兩者在數學上是等效的,但對於像 Adam 這樣的自適應優化器,它們是不同的,這就是為什麼引入 AdamW 來將衰減與基於梯度的更新解耦並使其表現正確。
技術洞察
L2 正則化將 lambda 乘以權重平方和添加到損失中,因此其梯度添加了與每個權重成比例的項,將其拉向零。相反,解耦權重衰減直接將每個權重乘以一個因子,例如(1減去learning_rate乘以lambda)。在自適應方法中,將 L2 耦合到損失中會使每個參數的縮放扭曲懲罰,因此 AdamW 單獨施加收縮,恢復預期的均勻拉向較小的權重。
戰略影響
更明確的決策
它可以幫助您將清晰的技術聲明與行銷語言分開。
成本與預算
在花費金錢或時間之前,您可以提出更好的實施問題。
團隊與工作流程
具有共同理解的團隊可以做出更好的產品、政策和學習決策。
權重衰減和 L2 正則化的未來
權重衰減仍然是大型語言模型和視覺轉換器訓練配方中的預設成分,而 AdamW 現在是它們的標準優化器。研究仍在繼續研究衰減如何與學習率計劃、標準化層和模型規模相互作用,因為它的有效強度隨著模型的增長而變化。隨著自動超參數搜尋和縮放定律研究的成熟,預計會有更多原則性的、可能是每層或調度感知的衰減調整。
現實世界的實施
在訓練影像分類器時在 PyTorch 的 AdamW 或 SGD 優化器中加入weight_decay以抑制過度擬合
調整嶺迴歸(經典的 L2 懲罰線性模型)中的 lambda 係數,以穩定相關特徵的預測
大型語言模型預訓練方案,在學習率計畫的同時設定較小的權重衰減(通常約為 0.1)
將權重衰減與資料增強和丟棄相結合,以防止小型醫學成像模型記住有限的訓練掃描
風險與防護欄
不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。
基準測試可能看起來很強大,但實際效能卻參差不齊。
忽視數據品質和評估計劃通常會產生脆弱的結果。
實施路線圖
從您需要的結果的簡單語言定義開始。
在測試之前選擇一種成功指標和一種失敗條件。
使用代表性資料運行小型試點,而不是完善的演示集。
記錄權重衰減和 L2 正則化在哪些方面有幫助以及在哪些方面更簡單的方法更好。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Weight Decay and L2 Regularization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Weight Decay and L2 Regularization?
權重衰減是一種簡單而強大的技術,可以在訓練過程中將模型的權重推向零,防止模型過度依賴任何單一特徵。它減少了過度擬合,是深度學習中使用最廣泛的正則化器之一。
L2 正規化為損失函數增加了什麼?
L2 正則化增加了 lambda 乘以權重平方和,懲罰大權重並鼓勵更小、更平滑的解決方案。
重量衰減有助於防止的主要問題是什麼?
透過保持較小的權重,權重衰減會阻止模型擬合噪聲,從而提高對新資料的泛化能力。
權重衰減將模型的權重推向哪個方向?
權重衰減在每次更新時將權重縮小到零,這就是為什麼它有時被描述為「衰減」權重。
為什麼要引進 AdamW?
在 Adam 中,將 L2 折疊到損失中會與每個參數縮放產生嚴重的相互作用; AdamW 單獨應用衰減以恢復預期的均勻收縮。
對於普通隨機梯度下降,L2 正則化和權重衰減有何關係?
使用普通 SGD,在損失中加入 L2 懲罰會產生與直接縮小權重相同的更新,因此兩者是等效的。