標籤平滑
標籤平滑是一種簡單的正規化技巧,可以軟化困難的單熱訓練目標,告訴模型正確的答案很有可能,但不是 100% 確定。
概述
It improves calibration and generalization across image and language models with almost no extra cost.
深入探討
通常,分類器是在 one-hot 標籤上進行訓練的:真實類別的目標為 1.0,其他所有類別均為 0.0。與交叉熵和 softmax 結合,這會推動模型使正確的 logit 無限大於其餘的 logit,從而鼓勵過度自信和過度擬合。標籤平滑將真實類別的目標替換為 (1 - epsilon),並將 epsilon/(K-1) 分佈到其他 K 類別,其中 epsilon 較小(通常為 0.1)。該模型現在的目標是有信心但不是絕對的分佈。它在 2016 年的 Inception-v3 工作中引入,後來由 Hinton 小組進行了分析,它提高了 ImageNet 的準確性,並且是 Transformers 中的標準,其中最初的 Attention Is All You Need 論文使用了 0.1 的 epsilon。
技術洞察
使用硬標籤,最小化交叉熵可以使正確的 logit 相對於其他 logit 趨向正無窮大,這是無法實現的,並且會將權重推向極端。平滑設定了正確 logit 和其餘 logit 之間的有限最佳差距,因此 logit 保持有界,並且模型不再具有最大置信度。研究表明,這會收緊同類集群並產生更好的校準機率,預測的置信度與實際的準確性相符。權衡:它可以消除細粒度的類間相似性訊息,這有時會損害那些軟關係很重要的知識蒸餾。
戰略影響
更明確的決策
它可以幫助您將清晰的技術聲明與行銷語言分開。
成本與預算
在花費金錢或時間之前,您可以提出更好的實施問題。
團隊與工作流程
具有共同理解的團隊可以做出更好的產品、政策和學習決策。
標籤平滑的未來
標籤平滑仍然是大規模訓練中的預設設置,但研究正在轉向自適應和學習平滑,即根據範例或類別調整 epsilon,而不是使用單一值。通常會權衡焦損失和溫度縮放等以校準為重點的方法或與之結合。隨著模型的發展和可靠的不確定性估計變得對安全至關重要,預計平滑將成為產生值得信賴的置信度評分的眾多工具之一,並仔細注意其與蒸餾的已知衝突。
現實世界的實施
ImageNet 分類:Inception-v3 使用標籤平滑 (epsilon 0.1) 來提高 top-1 準確率並減少過度自信。
機器翻譯:原始 Transformer 應用了 0.1 的標籤平滑,用一點困惑換取了更高的 BLEU 分數。
語音識別:平滑的目標可減少過度自信的誤識別,並改善噪音音訊的校準。
醫學影像模型:平滑可以產生更好校準的機率,這在置信度分數為臨床決策提供資訊時很重要。
風險與防護欄
不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。
基準測試可能看起來很強大,但實際效能卻參差不齊。
忽視數據品質和評估計劃通常會產生脆弱的結果。
實施路線圖
從您需要的結果的簡單語言定義開始。
在測試之前選擇一種成功指標和一種失敗條件。
使用代表性資料運行小型試點,而不是完善的演示集。
記錄標籤平滑在哪些方面有幫助以及在哪些方面更簡單的方法更好。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Label Smoothing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Label Smoothing?
標籤平滑是一種簡單的正規化技巧,可以軟化困難的單熱訓練目標,告訴模型正確的答案很有可能,但不是 100% 確定。它改進了影像和語言模型的校準和泛化,幾乎沒有額外的成本。
標籤平滑對訓練目標有何影響?
標籤平滑不是硬性的 1.0/0.0 目標,而是將 (1 - epsilon) 指派給真實類別,並將 epsilon 分散到其他類別。
平滑可以解決硬單熱標籤的什麼問題?
最小化單一熱點目標的交叉熵會導致正確的 logit 相對於其他目標趨於無窮大,從而鼓勵過度自信和過度擬合。
哪些標誌性架構有助於普及標籤平滑?
標籤平滑在 2016 年的 Inception-v3 論文中引入,並被 Transformer 採用(Attention Is All You Need),epsilon 0.1。
除了準確性之外,標籤平滑還有什麼好處?
平滑改進了校準,預測的置信度與正確的真實可能性更加一致。
標籤平滑的有記錄的缺點是什麼?
透過收緊集群並展平類之間的軟關係,平滑可以消除知識蒸餾所依賴的資訊。