語言人工智慧指南

拒絕採樣微調

拒絕採樣微調 (RFT) 會產生許多候選答案,僅保留得分最高的答案,並根據這些獲勝者重新訓練模型。

閱讀時間約2分鐘最後更新

概述

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

深入探討

拒絕採樣微調(有時稱為 N 最佳微調)是 Meta 的 Llama 2 和 Llama 3 等模型如何對齊的關鍵要素。方法很簡單:對於每個提示,從當前模型中採樣多個響應(例如 4 到 64),使用獎勵模型或自動檢查器對每個響應進行評分,然後丟棄(「拒絕」)除排名最高的輸出之外的所有輸出。倖存的高品質樣本成為新的監督微調資料集,並使用普通的下一個令牌損失對模型進行訓練。迭代地重複此循環會推動模型自行產生更好的答案。由於模型從自己過濾的輸出中學習,RFT 避免了策略梯度 RL 的不穩定和調整難題,同時仍利用獎勵訊號。

技術洞察

RFT 利用了這樣一個事實:多次採樣並保持最大獎勵響應近似於從銳化的、更高品質的分佈中進行挑選。透過標準交叉熵對這些獲勝者進行訓練,可以有效地將 N 中最佳行為提煉回模型的單樣本輸出中。對於數學或程式碼等可驗證領域,「獎勵」可以簡單地是最終答案或單元測試是否通過,從而完全不需要學習獎勵模型。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

拒絕採樣微調的未來

RFT 是現代後訓練的核心,通常在 PPO 和 DPO 等 RL 方法之前或與它一起使用。它的吸引力隨著廉價的推理和強大的自動驗證器而增長:隨著模型在自我生成和自我檢查方面變得更好,迭代拒絕採樣支持合成數據和自我改進循環。期望與推理模型更緊密地集成,產生可驗證的思想鏈,並持續研究如何在對模型自己的輸出進行重複訓練時避免獎勵黑客和多樣性崩潰。

現實世界的實施

透過對每個提示採樣多個答案來調整 Llama 風格的模型,保持最高的獎勵模型分數,然後對這些答案進行 SFT

透過產生許多解決方案並僅保留那些達到正確、可檢查答案的解決方案來改進數學求解器

程式碼生成,僅當候選人通過單元測試時才保留候選人,然後用作訓練數據

透過過濾模型本身的最佳自生成響應來建立合成指令資料集以用於下一輪訓練

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

QLoRA 和 4 位元微調

常見問題

What is Rejection Sampling Fine-Tuning?

拒絕採樣微調 (RFT) 會產生許多候選答案,僅保留得分最高的答案,並根據這些獲勝者重新訓練模型。這很重要,因為它使用簡單的監督學習而不是複雜的強化學習來提供 RLHF 的大部分好處。

拒絕採樣微調的核心思想是什麼?

RFT 對多個回應進行取樣,篩選出得分最高的反應,並對這些獲勝者的模型進行微調。

在數學或程式碼等可驗證領域,什麼可以作為獎勵?

對於可檢查的任務,RFT 可以使用精確的正確性或通過單元測試,從而避免學習獎勵模型。

哪個模型系列在對齊過程中使用拒絕取樣而聞名?

Meta 描述了使用拒絕採樣作為 Llama 2 和 Llama 3 模型的後訓練方法的一部分。

為什麼團隊喜歡 RFT 而不是像 PPO 這樣的策略梯度強化學習?

RFT 在過濾樣本上使用標準的下一個令牌損失進行重新訓練,避免了策略梯度方法的調整困難和不穩定性。

對最大獎勵樣本進行有效訓練有什麼作用?

透過從最過濾的回應中學習,該模型在一代中內化了更高品質的行為。