技術指南

使用 EAGLE 進行推測解碼

推測性解碼透過讓一個小草稿模型提前猜測幾個標記,然後由大模型一次驗證,從而加速大型語言模型推理。

閱讀時間約2分鐘最後更新

概述

EAGLE is a state-of-the-art version that drafts at the feature level rather than the token level, delivering 2-4x speedups with zero loss in output quality.

深入探討

正常的 LLM 生成是自回歸的:模型產生一個令牌,將其反饋並重複,因此每個令牌都需要對數十億個參數進行完整的前向傳遞。推測性解碼打破了這個瓶頸。廉價的起草者提出了一大塊候選令牌,而昂貴的目標模型在一次並行傳遞中驗證所有這些令牌,接受最長的正確前綴。 EAGLE(提高語言模型效率的外推演算法)透過在模型的隱藏特徵空間中起草並回饋先前標記的真實嵌入來減少不確定性,從而改進了早期方法。 EAGLE-2 添加了動態草圖樹,而 EAGLE-3 則刪除了特徵預測約束以更好地擴展。至關重要的是,驗證可確保輸出與目標模型單獨產生的輸出相同。

技術洞察

EAGLE 訓練一個小型自回歸頭來預測目標模型的下一個隱藏狀態特徵,然後重複使用目標自己的 LM 頭將特徵轉換為候選標記。透過對移動的標記序列加上先前的特徵進行調節,它消除了困擾僅特徵起草的歧義性。立即驗證候選樹;目標模型的分佈被精確保留,因為接受的標記必須與其採樣或 argmax 選擇相匹配,從而使加速無損。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

EAGLE 推測解碼的未來

推測性解碼正在成為 vLLM 和 TensorRT-LLM 等服務堆疊中的預設基礎設施。期望與批次和 KV 快取共享、不需要單獨起草者的自起草模型以及假設並行驗證的硬體協同設計進行更緊密的整合。 EAGLE 風格的特徵起草正在擴展到多模式和推理模型,在這些模型中,長的思想鏈使得每個令牌的成本尤其痛苦,並且擴展到延遲最重要的設備上推理。

現實世界的實施

縮短聊天助理的延遲,使反應速度提高 2-3 倍,而無需更改模型的答案

透過每次前向傳遞產生更多令牌,降低大容量 API 提供者的 GPU 服務成本

加速長鏈思維推理模型,其中每個查詢產生數千個令牌

加快程式碼完成工具的速度,其中可預測的、重複的標記序列可產生較高的草稿接受率

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding with EAGLE quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

推測性解碼

常見問題

What is Speculative Decoding with EAGLE?

推測性解碼透過讓一個小草稿模型提前猜測幾個標記,然後由大模型一次驗證,從而加速大型語言模型推理。 EAGLE 是最先進的版本,它在功能層級而不是令牌層級進行起草,可提供 2-4 倍的加速,並且輸出品質損失為零。

推測解碼背後的核心思想是什麼?

小型起草者猜測前面的幾個標記,大型目標模型將它們一起驗證,接受最長的正確前綴。

EAGLE 與早期的推測解碼方法有何不同?

EAGLE 預測目標模型的隱藏特徵並重複使用其 LM 頭,這比僅使用 token 的方法產生更準確的草稿。

為什麼推測解碼被認為是「無損」?

因為目標模型根據其自己的分佈檢查每個起草的令牌,所以接受的輸出正是目標單獨產生的輸出。

回饋前一個 token 的嵌入有助於解決 EAGLE 特徵起草中的什麼問題?

以實際的前一個標記為條件可以減少預測下一個隱藏特徵的模糊性,從而提高草稿準確性。

EAGLE-2 在原來的 EAGLE 基礎上添加了什麼?

EAGLE-2引入了上下文感知的動態草案樹,擴展了有希望的分支以提高接受率。