預定採樣和曝光偏差
暴露偏差是指僅在完美前綴上訓練的模型在推理時必須以其自身的不完美輸出為條件時出現的差距。
概述
計劃抽樣是逐漸縮小這一差距的課程。
深入探討
經過教師強制訓練的模型只會將真實標記視為上下文,但在生成時它們會回饋自己的預測。當早期的錯誤使模型處於訓練期間從未遇到過的狀態時,錯誤就會像滾雪球一樣越滾越大,這種失敗模式稱為「暴露偏差」。 Bengio 及其同事於 2015 年引入的計劃採樣通過在訓練期間的每個解碼步驟中擲硬幣來解決這個問題:它以一定的概率提供真實的令牌(教師強制),否則它提供模型自己的採樣預測。使用真實事實的機率一開始接近 1,並透過計劃(線性、指數或反 S 形)進行訓練時衰減,因此模型逐漸暴露於自己的輸出並學會從錯誤中恢復。
技術洞察
在步驟 t,模型以選擇黃金代幣的機率 epsilon_i 對伯努利變數進行採樣;epsilon_i 隨著訓練的進行而衰減。一個微妙之處在於,饋送採樣令牌使目標有偏差且離散採樣不可微分,因此梯度不會乾淨地流過反饋令牌。變異體使用直通式 Gumbel-softmax 或可微鬆弛來緩解這種情況,序列級方法直接優化 BLEU 等度量。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
預定採樣和曝光偏差的未來
對於大型 Transformer 語言模型,暴露偏差的實際影響存在爭議,因為巨大的數據和規模會抑制它,而 RLHF 等方法會直接重塑生成行為。儘管如此,計劃採樣及其後代仍然與較小的模型、結構化生成和具有嚴格精度需求的任務相關。未來的工作將課程暴露、強化式序列目標和最小風險培訓相結合,以使模型的訓練方式與實際解碼方式保持一致。
現實世界的實施
使用計劃採樣訓練圖像字幕模型,使其能夠在預測不完美的單字後優雅地繼續
在神經機器翻譯系統中使用反 sigmoid 調度來衰減教師強制機率
將陷入不連貫循環的聊天機器人診斷為純粹教師強迫的暴露偏差症狀
比較經過全面教師強制訓練的摘要器與經過預定採樣訓練的摘要器的 BLEU 分數
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Scheduled Sampling and Exposure Bias quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是預定採樣和曝光偏差?
暴露偏差是指僅在完美前綴上訓練的模型在推理時必須以其自身的不完美輸出為條件時出現的差距。計劃抽樣是逐漸縮小這一差距的課程。
訓練期間計畫採樣有什麼作用?
計劃採樣隨機混合真實值和模型產生的標記作為解碼器輸入,由衰減機率控制。
在計畫採樣的訓練過程中,使用真實標記的機率如何改變?
該計劃開始時幾乎完全由教師強制進行,然後逐漸衰減,因此隨著模型的改進,模型會越來越多地暴露於自己的預測中。
誰引入了計劃採樣?大概是什麼時候引進的?
Samy Bengio 及其同事於 2015 年提出了計劃採樣,用於循環網路的序列預測。
哪一種時間表形狀通常被認為可以降低教師強制機率?
最初的工作提出了線性、指數和反 sigmoid 衰減方案來降低真實採樣機率。