基礎知識指南

正規化

正則化是一組故意約束模型的技術,以便它可以推廣到新資料而不是記住訓練集。

閱讀時間約2分鐘最後更新

概述

It is the main toolkit for fighting overfitting.

深入探討

如果不加以控制,靈活的模型將自行扭曲以適應訓練資料中的每個點,包括雜訊。正則化透過添加有利於更簡單解決方案的懲罰或約束來進行反擊。最常見的形式是根據模型權重的大小向損失函數添加一項。 L2 正則化(權重衰減)平滑地懲罰大權重,將其縮小到零並產生更平滑的模型。 L1 正規化會懲罰權重的絕對值,並且可以將權重的絕對值一直驅至零,從而有效地選擇特徵子集。除了權重懲罰之外,dropout 在訓練期間隨機關閉神經元,提前停止在過度擬合之前停止訓練,資料增強擴展了有效訓練集。每個都犧牲一點訓練準確度來換取更好的現實世界表現。

技術洞察

大多數正則化都會重塑優化器最小化的目標。您不是僅僅最小化預測誤差,而是最小化誤差加上 lambda 乘以權重懲罰,其中 lambda 控制強度。 L2加上權重的平方和,鼓勵很多小的權重; L1 增加絕對權重的總和,鼓勵精確零的稀疏性。 Dropout 的工作方式有所不同:透過將每一步的活化值隨機歸零,它可以防止神經元共同適應並近似訓練子網路的集合。所有這些都以稍微增加偏差為代價來減少變異數。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

正規化的未來

像 L2 和 dropout 這樣的明確懲罰仍然是標準的,但注意力正在轉向隱式正則化,即隨機梯度下降等優化器悄悄地將巨大的模型偏向通用解決方案,即使沒有額外的懲罰。標籤平滑、混合和更強的資料增強等技術對於訓練大型視覺和語言模型越來越重要。期待更多的研究來了解為什麼過度參數化網路能夠抵抗​​過度擬合,以及在訓練期間自動調整正則化強度而不是依賴手動搜尋的自適應方法。

現實世界的實施

將 L2 權重衰減添加到深度影像分類器中,使其能夠從數千張訓練照片泛化到看不見的照片。

在基因組學模型中使用 L1 正規化可以自動從數千個基因中選擇少數能夠實際預測結果的基因。

在推薦網路中套用 dropout,使其不會過度依賴任何單一使用者訊號。

一旦驗證損失停止改善,即使訓練損失可能繼續下降,也要儘早停止訓練。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄正則化在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

權重衰減和 L2 正則化

常見問題

What is Regularization?

正則化是一組故意約束模型的技術,以便它可以推廣到新資料而不是記住訓練集。它是對抗過度擬合的主要工具包。

正規化的首要目標是什麼?

正則化有意限制模型,以阻止記憶訓練數據,從而提高未見過的示例的性能。

哪一種正則化技術最有可能將某些權重精確為零,從而有效地選擇特徵?

L1 懲罰權重的絕對值,這往往會將不太有用的權重推至恰好為零,從而執行自動特徵選擇。 L2 平滑地縮小權重,但很少精確到零。

Dropout 如何在訓練過程中規範神經網路?

Dropout 在每個訓練步驟中隨機將一小部分活化歸零,防止神經元過度依賴彼此並近似子網路的集合。

在正則化損失「誤差+ lambda × 懲罰」中,增加 lambda 有什麼作用?

Lambda 控制正規化強度。更大的 lambda 會為懲罰帶來更大的影響,更積極地將權重縮小到更簡單的模式。

為什麼早期停止可以被視為正規化的一種形式?

當驗證表現停止改善時停止,可以防止模型繼續進入記憶雜訊的狀態,就像其他正則化器限制複雜性一樣。