多令牌预测训练
该模型不是仅预测下一个标记,而是经过训练可以同时预测多个未来标记。
概述
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
深入探讨
标准语言模型通过下一个标记预测进行训练:给定上下文,预测单个下一个标记。多令牌预测 (MTP) 由 2024 年 Meta 论文普及并在 DeepSeek-V3 中采用,它添加了额外的轻量级输出头,因此模型可以同时预测下一个令牌以及来自同一隐藏状态的第二个、第三个和第四个令牌。这迫使网络进一步规划未来并密集化训练信号——每个位置现在都会贡献多个损失项。 Meta 报告在编码和生成推理方面取得了特别大的进步,较大的模型受益更多。至关重要的是,额外的头可以在训练后丢弃,因此部署时的模型大小不需要增加。
技术洞察
MTP 在共享变压器主干的顶部附加了 n 个独立的预测头; head k 根据位置 t 处的表示来预测位置 t+k 处的标记。损失在训练期间求和。在推理时,辅助头启用自推测解码:模型在一次传递中提出多个标记,然后验证它们,在不改变输出分布的情况下实现大约 3 倍的生成速度。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
多令牌预测训练的未来
MTP 正在成为前沿训练配方中的默认成分,因为它以很少的成本提高了质量和推理速度。期望与推测解码更紧密地集成、更深入的预测范围,并用作改进长期规划的辅助目标。与推理模型相结合,预测未来的多个步骤可能有助于模型在给出答案之前在内部模拟结果。
现实世界的实施
DeepSeek-V3 在预训练期间使用 MTP 目标来提高数据效率并实现推测解码
Meta 的代码生成模型显示 HumanEval 和 MBPP 通过预测多个标记而获得的准确度提升
自推测解码:每次前向传递起草 3-4 个令牌,然后验证更快、保持分布的输出
编码助手中的自动完成速度更快,一步即可提出并检查多个看似合理的标记
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Multi-Token Prediction Training?
该模型不是仅预测下一个标记,而是经过训练可以同时预测多个未来标记。这增强了学习信号并通过自推测解码解锁更快的推理。
与标准的下一个令牌训练相比,多令牌预测增加了什么?
MTP 添加了额外的输出头,因此模型可以预测下一个标记以及距离一个隐藏状态更远的几个标记。
哪个模型在预训练中特别使用了多标记预测目标?
DeepSeek-V3 采用 MTP 训练目标来提高数据效率并实现推测解码。
为什么MTP要致密训练信号?
预测多个未来令牌意味着每个令牌位置都会产生多个预测损失,从而为每个令牌提供更多学习信号。
额外的预测头能带来什么推理好处?
辅助头可以在每次传递中起草多个令牌,然后进行验证,从而在不改变输出分布的情况下加快生成速度。
如果不需要加速,训练后辅助头会怎样?
额外的头在部署时是可选的;丢弃它们可以使模型的大小与标准的下一个令牌模型相同。