技術指南

超參數調優

超參數是您在訓練前選擇的設置,例如學習率或模型大小,模型不會自行學習。

閱讀時間約2分鐘最後更新

概述

Tuning them well is often the difference between a mediocre model and a great one.

深入探討

模型參數(權重)是在訓練期間從資料中學習的。超參數則不同:它們是您預先設定的控制學習如何發生的旋鈕,例如學習率、批量大小、層數、正則化強度以及訓練時間。它們無法直接透過梯度下降進行最佳化,因此您可以透過訓練許多候選模型並在驗證集上進行比較來搜尋良好的值。最簡單的方法是網格搜索,在預先定義的網格上嘗試每種組合,但它的擴展性非常差。隨機搜尋通常透過採樣組合更快找到好的設定。更高級的貝葉斯優化建立了一個機率模型,其中的設定看起來很有希望,並將搜尋集中在那裡。學習率通常是最有影響力的超參數。

技術洞察

由於超參數控制訓練過程而不是由訓練過程進行調整,因此您將調整視為圍繞訓練的外部最佳化循環。每次試驗都使用一種配置訓練模型,並根據保留的驗證資料對其進行評分。貝葉斯方法,例如使用高斯過程或樹結構 Parzen 估計器的方法,對配置和驗證分數之間的關係進行建模,然後選擇下一個試驗來平衡探索不確定區域與利用已知良好區域。像 Hyperband 這樣的早期停止方案會儘早終止表現不佳的試驗,以便將計算花在重要的地方。至關重要的是,最終的測試集在調整過程中必須保持不變,以避免洩漏資訊。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

超參數調優的未來

手動和基於網格的調整正在讓位於自動化機器學習 (AutoML) 和更聰明的搜索,例如貝葉斯優化和 Hyperband,它們使用計算的效率要高得多。隨著基礎模型的發展,每次試驗的完全再訓練變得異常昂貴,因此註意力正在轉向更便宜的代理、從小規模運行中預測良好設置的縮放法則,以及調整輕量級適配器而不是整個模型。預計調整將變得越來越自動化和預算意識,透過工具明確地權衡搜尋成本和預期收益。

現實世界的實施

將學習率掃描幾個數量級,以找到網路快速訓練而不發散的值。

使用隨機搜尋來調整表格資料上梯度提升模型的樹深度、樹數和學習率。

運行貝葉斯優化,在有限的 GPU 預算上聯合調整深度網路的正則化強度和批量大小。

應用 Hyperband 來短暫訓練數十種配置,然後只為最有希望的倖存者提供更多的時期。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Hyperparameter Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Hyperparameter Tuning?

超參數是您在訓練前選擇的設置,例如學習率或模型大小,模型不會自行學習。調整好它們通常是平庸模型和優秀模型之間的差異。

超參數與常規模型參數有何不同?

權重(參數)是在訓練期間從資料中學習的。預先選擇超參數(例如學習率或層數)並控制訓練的進行方式。

哪一個通常被認為是深度學習中最有影響力的超參數調整?

學習率強烈影響模型是否收斂以及收斂的速度。太高,訓練出現偏差;太低了,它會爬行或被卡住。

為什麼隨機搜尋在超參數調整方面通常優於網格搜尋?

網格搜尋浪費了對不重要維度的嘗試。隨機搜尋可以更有效地探索空間,並且通常可以透過更少的試驗達到良好的配置。

貝葉斯優化如何選擇下一步要嘗試的超參數配置?

貝葉斯最佳化對配置和驗證分數之間的關係進行建模,然後選擇下一個試驗來平衡對不確定區域的探索與對有希望區域的利用。

為什麼最終測試集在超參數調整期間必須保持不變?

調整會選擇最適合您評估的任何數據的設定。如果這是測試集,那麼您報告的效能就會被誇大。調優使用單獨的驗證集。