技術指南

推測性解碼

推測性解碼透過使用小型、快速的「草稿」模型提前猜測多個標記,然後讓大型模型立即驗證它們,從而使大型語言模型更快地生成文本。

閱讀時間約2分鐘最後更新

概述

It speeds up inference 2-3x with identical output quality.

深入探討

通常,LLM 會一次產生一個標記的文字:每個標記都需要透過巨型模型進行完整的前向傳遞,並且在當前標記完成之前您無法開始下一個標記。這很慢,因為它受記憶體限制,而不是計算限制——GPU 大部分時間都花在載入權重上,而不是做數學運算。推測性解碼打破了瓶頸。一個小型、廉價的草稿模型提出了一大塊,例如五個候選令牌。然後,大型“目標”模型在一次並行前向傳遞中處理所有五個並檢查它們。與其產生的代幣相符的代幣被接受;當出現第一個分歧時,它會糾正並丟棄其餘的。由於驗證許多代幣的成本與產生一個代幣的成本大致相同,因此接受的猜測幾乎是免費的。

技術洞察

巧妙的部分是拒絕採樣規則,它保證輸出分佈在數學上與單獨運行目標模型相同 - 因此質量不是近似的,而是精確的。接受率推動加速:小模型對大模型的預測越好,每個驗證步驟中保留的代幣就越多。 Medusa 等變體為目標模型本身添加了額外的預測頭,而 EAGLE 在特徵空間中草稿,因此無需單獨的草稿模型。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

推測解碼的未來

推測性解碼正在成為 vLLM 和 TensorRT-LLM 等服務堆疊中的預設設定。預計自起草方法(Medusa、EAGLE、Lookahead)將占主導地位,因為它們避免維護第二個模型,加上基於樹的推測,每一步驗證多個候選分支。隨著模型的增長,記憶體限制的瓶頸變得更加嚴重,這使得猜測變得更加有價值,並且具有硬體意識的繪圖人員將推動現實世界的加速。

現實世界的實施

7B 草案模型提出 70B 聊天模型的代幣,以減少生產助理中的回應延遲

Medusa 頭固定在 LLM 上,因此無需單獨的草稿模型即可同時預測多個未來代幣

vLLM 支援推測性解碼,以提高服務叢集上的每秒令牌吞吐量

在模型的隱藏特徵空間中進行 EAGLE 繪圖,以提高接受率和整體速度

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

使用 EAGLE 進行推測解碼

常見問題

What is Speculative Decoding?

推測性解碼透過使用小型、快速的「草稿」模型提前猜測多個標記,然後讓大型模型立即驗證它們,從而使大型語言模型更快地生成文本。它以相同的輸出品質將推理速度提高 2-3 倍。

推測解碼的核心思想是什麼?

快速草稿模型提出多個令牌,大型目標模型在一次並行傳遞中檢查所有令牌。

為什麼正常的一次產生一個令牌的 LLM 產生速度很慢?

每個步驟主要從記憶體載入巨大的權重矩陣,而不是進行大量計算,因此 GPU 沒有充分利用。

當草案和目標模型不一致的第一個標記時會發生什麼?

接受不超過分歧的代幣;從不匹配開始,它們將被拒絕,並保留目標模型的正確標記。

推測解碼如何影響輸出品質?

拒絕抽樣規則保證最終分佈與目標模型完全匹配,因此品質不變。

最直接決定推測解碼加速的因素是什麼?

目標模型每個驗證步驟接受的起草令牌越多,加速越大。