技術指南

推測流和多令牌預測

推測流和多令牌預測通過一次猜測多個未來令牌並在一次傳遞中驗證它們而不是一次生成一個令牌來加速語言模型的生成。

閱讀時間約2分鐘最後更新

概述

They cut latency without changing the text the model would have written.

深入探討

正常的自回歸解碼速度很慢,因為每個令牌都需要完整的前向傳遞,而令牌嚴格地一個接一個地生成,導致 GPU 未充分利用。推測性解碼透過一個廉價的起草者解決了這個問題,該起草者提出了一大塊候選標記,然後大型目標模型並行驗證這些候選標記;與目標生成的內容相匹配的任何前綴都會被免費接受,並且第一個不匹配會被糾正。推測流和美杜莎式多令牌預測將起草者折疊到模型本身:額外的輕量級預測頭(或推測令牌流)讓一個模型既起草又驗證,避免了單獨的草案模型。由於驗證是精確的,因此輸出分佈與標準解碼相同,因此您只需減少 2 到 3 倍的連續步驟。

技術洞察

關鍵在於,變換器可以在一次前向傳遞中對多個位置進行得分,成本與對一個位置的得分一樣便宜,因為在解碼過程中它是記憶體頻寬限制,而不是計算限制。多個預測頭髮出接下來幾個位置的候選標記;候選樹或序列被一起驗證,並且接受使用拒絕採樣(或貪婪匹配),因此接受的令牌遵循確切的目標分佈。每步可接受的長度決定了加速比。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

推測流和多令牌預測的未來

不需要單獨草稿模型的自我推測方法正在成為推理引擎的預設方法,研究正在透過更好的草稿頭、樹結構候選以及聯合訓練基礎模型以進行多標記預測(這也可以提高品質)來提高接受率。希望這些技術能夠與量化和批次相結合,以便即使模型不斷增長,互動式助理也會感覺即時。

現實世界的實施

使用美杜莎式額外預測頭將聊天助理的回應延遲縮短 2 到 3 倍

將自推測解碼添加到推理伺服器,因此不需要託管單獨的草稿模型

加速程式碼完成,其中長的、可預測的令牌運行被大塊地接受

透過從每個記憶體綁定的前向傳遞中提取更多令牌來降低每個請求的 GPU 成本

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Streaming and Multi-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

多令牌預測訓練

常見問題

What is Speculative Streaming and Multi-Token Prediction?

推測流和多令牌預測通過一次猜測多個未來令牌並在一次傳遞中驗證它們而不是一次生成一個令牌來加速語言模型的生成。他們在不更改模型編寫文字的情況下縮短了延遲。

為什麼標準自回歸解碼在 GPU 上通常很慢?

每個令牌都需要自己的前向傳遞,而且它們是嚴格順序的,因此 GPU 受記憶體頻寬限制,並且在解碼過程中未充分利用。

「起草者」在推測解碼中做什麼?

廉價的起草者提出了一大塊候選標記,然後大型目標模型並行驗證這些標記。

推測解碼中如何維持輸出品質?

驗證(貪婪匹配或拒絕採樣)確保接受的令牌遵循目標模型將產生的精確分佈,因此輸出不變。

美杜莎式多令牌預測與經典推測解碼有何不同?

美杜莎式的方法將草稿折疊到具有額外預測頭的模型中,從而避免了託管單獨的草稿模型的需要。

為什麼變壓器在解碼過程中驗證多個候選位置的成本幾乎與驗證一個候選位置的成本一樣低?

在解碼過程中,瓶頸是從記憶體中移動權重,因此在同一遍中對額外位置進行評分幾乎不會增加計算成本。