語言人工智慧指南

推測性抽樣驗證

推測採樣透過讓小型「草稿」模型提前猜測多個標記,然後讓大型模型一次驗證它們,從而加速大型語言模型的生成。

閱讀時間約2分鐘最後更新

概述

The clever verification step guarantees the output matches what the big model would have produced on its own.

深入探討

自迴歸產生速度很慢,因為每個代幣都需要一個巨大模型的完整前向傳遞。推測抽樣透過將廉價的草稿模型與昂貴的目標模型配對來解決這個問題。該草案提議短期發行代幣(例如 4-8 個);然後目標通過一次平行向前傳球將所有球得分。修改後的拒絕採樣規則接受與目標自身分佈一致的最長前綴,並在第一個拒絕位置重新採樣。因為接受是機率性的並且是經過校正的,所以最終的令牌流可以證明完全像目標單獨生成一樣分佈,沒有質量損失。當草稿快速且對齊良好時,典型的加速是 2-3 倍,因為每個昂貴的調用都會確認多個令牌。

技術洞察

對於每個起草的令牌,您可以比較目標機率 q 和起草機率 p。以機率 min(1, q/p) 接受;如果被拒絕,則從歸一化殘差分佈 max(0, q-p) 中取樣。此拒絕規則使邊際分佈與純目標採樣相同。目標的並行傳遞還會在最後接受的令牌之後「免費」產生下一個令牌分配,因此進度永遠不會停止。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

推測性抽樣驗證的未來

推測性解碼正成為推理堆疊的標準。較新的變體放棄了單獨的草稿模型:自我推測使用提前退出或額外的預測頭(Medusa、EAGLE),基於樹的草稿一次驗證許多候選延續,前瞻解碼並行化 n-gram 猜測。預計與批次和 KV 快取管理、硬體感知草稿大小的更緊密整合,以及在對延遲敏感的產品(如聊天助理和編碼工具)中更廣泛的使用,其中每一毫秒都很重要。

現實世界的實施

使用 7B 草稿模型提供 70B 聊天模型,可將回應延遲大約減少一半,同時輸出品質相同。

美杜莎風格的頭是用一個模型預測幾個未來的代幣,然後在沒有單獨的草案網絡的情況下驗證它們。

基於樹的推測解碼,提出多個分支延續並在一次目標傳遞中驗證它們。

加速程式碼完成助手,其中草稿模型處理大型模型快速確認的可預測樣板檔案。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Sampling Verification quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

拒絕採樣微調

常見問題

What is Speculative Sampling Verification?

推測採樣透過讓小型「草稿」模型提前猜測多個標記,然後讓大型模型一次驗證它們,從而加速大型語言模型的生成。巧妙的驗證步驟保證了輸出與大模型自己產生的結果相符。

推測性抽樣背後的核心思想是什麼?

廉價的草稿模型會提前猜測幾個標記,而昂貴的目標模型會在一次並行前向傳遞中檢查所有標記。

為什麼推測抽樣不會降低輸出品質?

修改後的拒絕採樣校正保證了接受的令牌的分佈與目標模型單獨產生的完全一樣。

為什麼即使令牌在序列中被拒絕,推測採樣也能取得進展?

單一目標前向傳遞在最後一個接受的令牌之後產生下一個令牌分佈,因此至少有一個令牌總是前進。

哪一種是避免單獨草案模型的「自我推測」方法?

Medusa 和 EAGLE 添加額外的頭或使用提前退出,因此相同的模型提出未來的代幣,從而消除了對不同草稿模型的需求。