基礎知識指南

雙下降現象

雙重下降是一個令人驚訝的觀察結果,即隨著模型變大,測試誤差首先在「插值閾值」附近變得更糟,但隨後又變得更好——這違背了經典教科書的權衡。

閱讀時間約2分鐘最後更新

概述

It matters because it helps explain why enormous, overparameterized neural networks generalize well instead of overfitting.

深入探討

經典統計學告訴我們一條 U 形曲線:隨著模型複雜度的增加,測試誤差下降,觸底,然後隨著模型過度擬合而上升。雙重下降法由 Belkin、Hsu、Ma 和 Mandal 在 2019 年推廣,並由 OpenAI 進行了大規模研究,顯示曲線有第二次下降。測試誤差在插值閾值處達到峰值,即模型具有足夠參數來準確擬合每個訓練點(零訓練誤差)的點。如果將其推入過度參數化的狀態,測試誤差會再次下降,通常低於經典的最佳點。同樣的效果出現在模型大小、訓練時間(「epoch-wise」雙重下降)和資料集大小。它重新建構了「更多參數總是意味著過度擬合」這一古老的擔憂。

技術洞察

在插值閾值處,本質上存在一種完全適合數據的解決方案,並且它被迫呈鋸齒狀和高範數,因此泛化能力很差。在過度參數化的情況下,存在無限多個零誤差解,且梯度下降的隱式偏差趨向最平滑、最低範數的解。對低複雜度插值器的偏好(而不是參數計數本身)是推動第二次下降以降低測試誤差的原因。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

雙下降現象的未來

研究人員正在使用雙重下降來完善縮放法則並選擇何時停止訓練,因為「訓練時間更長,變得更糟,然後更好」具有真正的成本影響。期望有更嚴格的理論將其與隱式正則化、神經正切核和 grokking 連接起來。實際上,這個教訓——更大、更長可以幫助越過危險區域——已經支持了訓練更大的基礎模型而不是精心設計的模型的決定。

現實世界的實施

解釋為什麼 1750 億參數的語言模型儘管容量大得多,但比精心調整的中型語言模型具有更好的泛化能力

選擇訓練超過驗證損失暫時惡化的點,因為曆元雙下降預測稍後的恢復

診斷視覺模型,當參數數量與訓練集大小相符時,模型的準確性會下降,然後引導其更深入地過度參數化

在 AutoML 中告知模型大小決策,以便從業者避免脆弱的內插閾值區域

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄雙下降現像在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Double Descent Phenomenon quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Double Descent Phenomenon?

雙重下降是一個令人驚訝的觀察結果,即隨著模型變大,測試誤差首先在「插值閾值」附近變得更糟,但隨後又變得更好——這違背了經典教科書的權衡。這很重要,因為它有助於解釋為什麼巨大的、過度參數化的神經網路能夠很好地泛化而不是過度擬合。

測試誤差通常在雙下降曲線的何處達到高峰?

誤差峰值發生在插值閾值處,此時模型具有足夠的能力透過基本上一種剛性解決方案將訓練誤差驅動至零。

當模型嚴重過度參數化時,測試錯誤會發生什麼情況?

在過度參數化的情況下,測試誤差第二次下降,這是賦予雙重下降名稱的定義特徵。

為什麼梯度下降在過度參數化的情況下有幫助?

由於有許多可用的零誤差解決方案,梯度下降的隱式偏差會轉向最平滑、範數最低的解決方案,從而具有更好的泛化能力。

「時代明智」的雙重血統是指作為什麼函數出現的效應?

沿著訓練時間軸可能會發生雙重下降:隨著訓練持續更多的時期,測試誤差可能會惡化然後改善。

雙血統挑戰了哪一個經典觀念?

它與教科書 U 形曲線相矛盾,即超過某一點的複雜性總是會因過度擬合而增加測試誤差。