語言人工智慧指南

推測性解碼草案模型

推測性解碼使用小型、快速的「草稿」模型來猜測幾個即將出現的標記,然後大型模型一次驗證這些標記。

閱讀時間約2分鐘最後更新

概述

它可以在不改變輸出的情況下將文字產生速度提高 2-3 倍。

深入探討

大型語言模型一次產生一個標記的文本,每一步都需要完全前向傳遞數十億個參數——速度慢且受記憶體限制。推測性解碼透過將大的「目標」模型與廉價的「草稿」模型配對來解決這個問題。模型草案快速提出了一大塊,例如 4-8 個候選令牌。然後,大模型在一次並行前向傳遞中處理所有這些,並檢查每一個。接受與大模型產生的代幣相符的代幣;第一個不匹配被修正,其餘的被丟棄。由於一次驗證多個代幣的成本與產生一個代幣的成本大致相同,因此接受的運行幾乎是免費的。至關重要的是,拒絕採樣步驟可確保最終分佈與單獨運行大模型相同 - 速度快且品質沒有損失。

技術洞察

關鍵技巧是改進的拒絕抽樣測試。對於每個起草的令牌,目標模型的機率與草案模型的機率進行比較。如果目標分配相同或更高的機率,則令牌被接受;否則,它以等於該比率的機率被接受,並且在拒絕時,從調整後的殘差分佈中採樣校正的令牌。這種數學計算使得輸出可證明相當於直接從大型模型中取樣。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

推測性解碼草案模型的未來

預計草案模型將成為 vLLM 和 TensorRT-LLM 等推理伺服器的標準基礎設施。自我推測變體(Medusa、EAGLE)透過添加輕量級預測頭完全放棄了單獨的草稿模型,並且基於樹的草稿同時驗證了許多候選延續。隨著上下文視窗的成長和服務成本的主導,更智慧、模型匹配的繪圖員和硬體感知驗證將提高接受率和吞吐量。

現實世界的實施

Anthropic、OpenAI 和 Google 使用推測解碼來減少為數百萬用戶提供服務的聊天助理的延遲和服務成本。

vLLM 和 NVIDIA TensorRT-LLM 附帶內建推測解碼,因此自架程式可以加速 Llama 或 Mistral 部署。

將 7B 草稿模型與 70B 目標(例如 Llama-3 系列)配對,可在單一 GPU 上將每秒令牌數約增加一倍。

程式碼完成工具使用一個微小的草稿模型來提出由較大模型驗證的樣板,從而使建議在編輯器中保持敏捷。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

程式碼模型的推測性編輯

常見問題

什麼是推測解碼草稿模型?

推測性解碼使用小型、快速的「草稿」模型來猜測幾個即將出現的標記,然後大型模型一次驗證這些標記。它可以在不改變輸出的情況下將文字產生速度提高 2-3 倍。

「草案」模型在推測解碼中的主要作用是什麼?

小草稿模型可以廉價地猜測即將到來的令牌,然後大型目標模型在單一平行傳遞中檢查這些令牌。

為什麼一次驗證多個起草的令牌可以節省時間?

世代是受記憶限制的;在一次批量傳遞中檢查多個令牌幾乎與一步一樣便宜,因此接受的運行幾乎是免費的。

在目標模型拒絕第一個令牌之後,起草的令牌會發生什麼?

接受一直持續到第一次出現分歧為止;該令牌被更正,並且所有後續起草的令牌都被丟棄。

推測解碼如何確保輸出品質不會降低?

修改後的拒絕採樣測試保證最終的令牌分佈與直接從目標模型採樣相符。

其中哪一個是避免單獨草案模型的「自我推測」方法?

Medusa 和 EAGLE 在主模型中添加了輕量級的額外預測頭,以便它可以起草自己的未來代幣。