温度和采样
温度和采样是控制语言模型措辞“随机”或“安全”程度的旋钮。
概述
They decide whether you get the same predictable answer every time or fresh, varied phrasing.
深入探讨
在每一步中,语言模型不会直接输出单词 - 它会为其词汇表中的每个标记生成一个分数(“logit”),softmax 将其转换为概率分布。采样是从该分布中选择下一个令牌的方式。温度重塑选择前的分布:低温使首选选择占主导地位,因此输出集中且可重复;高温会使它变平,让不太可能的代币溜进去,产生更多的变化(和更多的错误)。两种流行的过滤器首先缩小池的范围。 Top-k 仅保留 k 个最高概率的标记。 Top-p(或核心采样)保留概率总计为 p(例如 0.9)的最小令牌集,因此当模型不确定时池会增长,而当模型有信心时池会缩小。这些设置共同权衡了可靠性和创造力。
技术洞察
温度的工作原理是在 softmax 之前将每个 logit 除以 T:概率与 exp(logit / T) 成正比。 T 低于 1 会加剧差距,因此顶部令牌占主导地位; T 大于 1 会缩小间隙并使分布变得平坦。当 T 接近 0 时,模型实际上变得贪婪,总是采用单个最可能的标记。 Top-k 将候选计数限制为固定数量,而 top-p 设置累积概率截止值,因此其候选计数会适应模型在该步骤的置信度。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
温度和采样的未来
这些控件稳定且易于理解,因此操作具有更智能的默认值和更新的变体。预计会有更多的自适应方案,例如 min-p(将截止值缩放到顶部令牌的概率)和在生成中期发生变化的动态温度。工具将越来越多地自动选择每个任务的设置——代码和提取的设置较低,头脑风暴的设置较高——因此用户不会手动调整。核心理念经久不衰:采样是确定性精度和创造性多样性之间简单而强大的旋钮。
现实世界的实施
将温度设置为接近 0 以便代码生成或数据提取,您每次都希望得到相同的正确答案
将温度升高至 0.8-1.0 左右,集思广益,提出名称、口号或故事创意,以获得多种选择
使用 0.9 左右的 top-p,因此模型仅从最合理的单词中进行采样,并避免出现奇怪的标记
应用 top-k 来限制候选人并防止罕见的、偏离主题的单词出现在面向客户的回复中
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Temperature and Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Temperature and Sampling?
温度和采样是控制语言模型措辞“随机”或“安全”程度的旋钮。他们决定你是否每次都会得到相同的可预测的答案,或者新鲜的、不同的措辞。
升高温度对模型的输出有何影响?
较高的温度会使概率分布变得平坦,因此不太可能的代币会更频繁地被选中,从而产生更多样(且风险更高)的输出。
top-p(核)采样与 top-k 采样有何不同?
Top-p 通过累积概率来调整候选集,而 top-k 始终保持固定数量的顶部标记。
从力学上来说,温度实际上对逻辑有什么影响?
在softmax之前,温度将每个logit除以T; T 低于 1 会使分布变得尖锐,T 高于 1 会使分布变得平坦。
对于生成代码或提取结构化数据,哪种设置通常最好?
需要正确性和可重复性的任务使用非常低的温度,因此模型可靠地选择最有可能的正确标记。
当温度实际上为 0 时会发生什么?
接近零温度时,分布非常尖锐,以至于总是选择概率最高的标记——贪婪解码。