N 次最佳採樣和重新排序
Best-of-N 取樣從模型中產生多個候選答案,然後使用單獨的評分步驟選擇最佳答案。
概述
It is one of the simplest, most reliable ways to trade extra compute at inference time for higher answer quality.
深入探討
每次運行時,帶有採樣的語言模型都會產生不同的輸出。 Best-of-N 利用了這一點:您繪製 N 個候選響應,然後對它們重新排序並返回頂部的響應。重新排名器可以是學習獎勵模型(常見於根據人類回饋進行強化學習)、檢查正確性的驗證器或簡單的啟發式方法,例如透過多數投票達成答案協議。由於模型只需要多次嘗試中的一次,因此品質通常會隨著 N 的增長而急劇上升,特別是在存在正確路徑但並不總是第一個樣本的推理和程式碼任務上。成本與 N 成線性關係,如果評分者不完美,收益最終會趨於穩定甚至逆轉,這種失敗模式稱為獎勵黑客或獎勵過度優化。
技術洞察
N 局最佳的品質完全取決於得分手。有了完美的驗證器,準確率就接近 N 個樣本中至少有一個是正確的,並且隨著 N 的增加而迅速上升。使用嘈雜的獎勵模型,選擇可能會被愚弄:將 N 推得很高會放大得分高但實際上是錯誤的輸出,因為你正在針對評分者的盲點進行優化。這就是為什麼經過校準、穩健的獎勵模型對於保持回報的技術至關重要。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
Best-of-N 取樣與重新排序的未來
Best-of-N 正成為推理時間擴展的核心構建塊,與思維鍊和樹搜尋並列。期待更聰明的變體:加權多數投票、對每個推理步驟進行評分的過程獎勵模型,以及一旦置信度較高就停止採樣的自適應 N。隨著驗證者的改進,特別是對於可檢查正確性的程式碼和數學,對許多樣本進行重新排序將成為將備用計算轉換為可靠性而無需重新訓練基本模型的標準方法。
現實世界的實施
對數學問題的 64 個解決方案進行抽樣,並選擇大多數樣本都同意的答案(自我一致性/多數投票)。
產生多個程式碼完成並保留通過最多單元測試的程式碼作為自動驗證器。
在 RLHF 管道中繪製多個回應,並選擇獎勵模型得分最高的回應來為使用者提供服務。
產生幾份摘要草稿,並使用品質模型對它們進行重新排序,以傳回最忠實、簡潔的摘要。
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Best-of-N Sampling and Reranking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Best-of-N Sampling and Reranking?
Best-of-N 取樣從模型中產生多個候選答案,然後使用單獨的評分步驟選擇最佳答案。這是在推理時用額外計算換取更高答案品質的最簡單、最可靠的方法之一。
best-of-N取樣的核心思想是什麼?
Best-of-N 抽取多個候選響應,然後對它們重新排名,以返回得分最高的響應。
best-of-N 對哪些類型的任務最有幫助?
當模型有時只能找到可驗證的正確答案時,對更多候選人進行抽樣會增加正確答案的機會。
是什麼在很大程度上決定了「N 中最佳」是否能夠真正改善結果?
選擇的好壞取決於重新排序的好壞;弱者或有偏見的評分者可能會選擇錯誤的答案。
當 N 在不完美的獎勵模型下被推得很高時,會出現什麼失敗模式?
針對有缺陷的記分員進行大力優化會放大利用其盲點的輸出,因此準確性可能會趨於穩定或下降。
哪一種簡單的重新排名策略也稱為自我一致性?
自洽性對許多推理鏈進行取樣,並選擇大多數推理鏈都同意的最終答案。