語言人工智慧指南

多令牌預測訓練

該模型不是僅預測下一個標記,而是經過訓練可以同時預測多個未來標記。

閱讀時間約2分鐘最後更新

概述

This sharpens learning signals and unlocks faster inference through self-speculative decoding.

深入探討

標準語言模型透過下一個標記預測進行訓練:給定上下文,預測單一下一個標記。多令牌預測 (MTP) 由 2024 年 Meta 論文普及並在 DeepSeek-V3 中採用,它添加了額外的輕量級輸出頭,因此模型可以同時預測下一個令牌以及來自同一隱藏狀態的第二個、第三個和第四個令牌。這迫使網路進一步規劃未來並密集化訓練訊號——每個位置現在都會貢獻多個損失項。 Meta 報告在編碼和產生推理方面取得了特別大的進步,較大的模型受益更多。至關重要的是,額外的頭部可以在訓練後丟棄,因此部署時的模型大小不需要增加。

技術洞察

MTP 在共享變壓器主幹的頂部附加了 n 個獨立的預測頭; head k 根據位置 t 處的表示來預測位置 t+k 處的標記。損失在訓練期間求和。在推理時,輔助頭啟用自推測解碼:模型在一次傳遞中提出多個標記,然後驗證它們,在不改變輸出分佈的情況下實現大約 3 倍的生成速度。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

多令牌預測訓練的未來

MTP 正在成為前緣訓練配方中的預設成分,因為它以很少的成本提高了品質和推理速度。期望與推測解碼更緊密地整合、更深入的預測範圍,並用作改進長期規劃的輔助目標。與推理模型結合,預測未來的多個步驟可能有助於模型在給出答案之前在內部模擬結果。

現實世界的實施

DeepSeek-V3 在預訓練期間使用 MTP 目標來提高資料效率並實現推測解碼

Meta 的程式碼產生模型顯示 HumanEval 和 MBPP 透過預測多個標記而獲得的準確度提升

自推測解碼:每次前向傳遞起草 3-4 個令牌,然後驗證更快、保持分佈的輸出

編碼助手中的自動完成速度更快,一步即可提出並檢查多個看似合理的標記

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Token Prediction Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

推測流和多令牌預測

常見問題

What is Multi-Token Prediction Training?

該模型不是僅預測下一個標記,而是經過訓練可以同時預測多個未來標記。這增強了學習訊號並透過自推測解碼解鎖更快的推理。

與標準的下一個令牌訓練相比,多令牌預測增加了什麼?

MTP 增加了額外的輸出頭,因此模型可以預測下一個標記以及距離一個隱藏狀態更遠的幾個標記。

哪一個模型在預訓練中特別使用了多標記預測目標?

DeepSeek-V3 採用 MTP 訓練目標來提高資料效率並實現推測解碼。

為什麼MTP要緻密訓練訊號?

預測多個未來令牌意味著每個令牌位置都會產生多個預測損失,從而為每個令牌提供更多學習訊號。

額外的預測頭能帶來什麼推理好處?

輔助頭可以在每次傳遞中起草多個令牌,然後進行驗證,從而在不改變輸出分佈的情況下加快生成速度。

如果不需要加速,訓練後輔助頭會怎樣?

額外的頭在部署時是可選的;丟棄它們可以使模型的大小與標準的下一個令牌模型相同。