Nucleus 和 Top-k 采样
Nucleus (top-p) 和 top-k 采样是通过限制可以选择的标记来为文本生成添加受控随机性的解码方法。
概述
They matter because they make AI writing feel natural and varied instead of repetitive or robotic.
深入探讨
语言模型在每一步输出整个词汇的概率分布。直接从中采样可以挑选出奇怪的、低概率的标记;总是获取顶部令牌(贪婪)会产生枯燥、重复的循环。 Top-k 采样通过仅保留 k 个最高概率标记(例如 k=40)、重新规范化并在其中采样来解决此问题。细胞核采样,由 Holtzman 等人提出。在 2019 年,而是保留累积概率超过阈值 p(例如 0.9)的最小标记集——“核心”。关键的优点是,当模型有信心时,该集合会缩小,而当模型不确定时,该集合会扩展,从而动态适应。两者通常与温度参数相结合,在采样前使分布尖锐或平坦。
技术洞察
关键的区别在于固定截断与自适应截断。 Top-k 始终保留恰好 k 个令牌,当许多选项都是合理时,这些令牌可能太少,或者当只有几个选项合理时,这些令牌可能会包含垃圾。 Top-p 保留一个可变数量——刚好足以覆盖概率质量 p 的标记——因此它会截断不可靠的长尾,同时考虑分布的峰值或平坦程度。温度(通常为 0.7-1.0)会在任一方法之前重新调整 logits:较低的值集中概率,较高的值分散概率。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
Nucleus 和 Top-k 采样的未来
基于采样的解码现在是聊天机器人和创意工具的默认设置,并且研究不断对其进行改进:典型采样、min-p 和 eta/epsilon 采样等方法旨在比固定 p 或 k 更智能地截断尾部。预计解码参数将变得更加具有上下文感知能力,甚至可以学习,自动收紧事实答案并放松头脑风暴。随着模型的改进,仔细的采样控制对于平衡可靠性、多样性和减少幻觉仍然至关重要。
现实世界的实施
聊天机器人使用 0.9 左右的 top-p 来保持对话中回复的多样性和连贯性
创意写作助理提高温度和压力,集思广益不同的故事想法
代码生成工具可降低温度和 k,以获得更具确定性、更正确的代码片段
API 用户调整 top_p 和 top_k 参数来控制模型输出的冒险程度
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Nucleus and Top-k Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Nucleus and Top-k Sampling?
Nucleus (top-p) 和 top-k 采样是通过限制可以选择的标记来为文本生成添加受控随机性的解码方法。它们很重要,因为它们让人工智能写作感觉自然且多样,而不是重复或机械化。
top-k 采样如何限制 token 选择?
Top-k 将分布截断为固定数量 k 个最可能的标记,重新规范化,并从中进行采样。
什么定义了核(top-p)采样中的“核”?
Top-p保留累积概率达到阈值p的最小的top token组,然后在其中进行采样。
top-p 相对于 top-k 的主要优势是什么?
与 top-k 的固定计数不同,Top-p 的候选集在模型有信心时会缩小,在不确定时会增加。
采样前温度参数有什么作用?
较低的温度将概率集中在顶级令牌上(更具确定性);较高的温度使其变平(更加多样化)。
为什么对于开放式文本来说,纯粹的贪婪解码(始终是顶部标记)通常是不可取的?
贪婪解码经常陷入重复,并且缺乏受控采样所提供的自然多样性。