语言人工智能指南

下一个令牌预测

下一个标记预测是 GPT 风格模型背后看似简单的目标:给定到目前为止的所有内容,猜测下一个文本块。

阅读时间:2分钟最后更新

概述

Repeated billions of times, this single task produces models that write, reason, and converse.

深入探讨

下一个标记预测训练模型在给定所有先前标记的情况下为下一个标记分配概率。文本首先被标记器(如字节对编码)分解为标记(子字片段)。仅解码器的 Transformer 从左到右读取序列,并输出下一个位置的整个词汇表的概率分布。在训练过程中,模型会显示大量文本语料库,并且每当它为实际的下一个标记分配低概率时就会受到惩罚。在生成时,模型采样或贪婪地选择一个标记,将其附加,并自回归地重复此循环。这一目标的规模非常大:GPT-2、GPT-3 和后继者都纯粹通过非常擅长预测下一个标记来学习语法、事实、翻译和推理。

技术洞察

关键机制是因果(屏蔽)自注意力:在预测位置 N 时,模型可能只关注位置 1 到 N-1,而不会关注未来。输出层将最终的隐藏状态投影到词汇表上,并应用 softmax 来获取概率。训练最小化交叉熵,相当于最大化观察到的文本的可能性。温度和 top-p 等采样控制重塑了推理时的分布,以权衡创造力和可靠性。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

下一个代币预测的未来

下一个令牌预测基本上支撑着所有现代大型语言模型,并将仍然是生成人工智能的支柱。研究正在通过更长的上下文窗口、推测性和并行解码以提高速度以及同时猜测多个未来令牌的多令牌预测目标来扩展它。从顶部的人类反馈层进行强化学习以调整输出。前沿技术正在使同样简单的目标变得更便宜、更快,并且在更大的范围内更容易控制。

现实世界的实施

为 ChatGPT 和类似助手提供动力,一次生成一个令牌的对话响应。

当您键入时,GitHub Copilot 等工具中的自动补全和代码建议。

根据简短的提示起草电子邮件、文章和营销文案。

写作助手中的实时文本生成可以完成您的句子。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Next-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

多令牌预测训练

常见问题

What is Next-Token Prediction?

下一个标记预测是 GPT 风格模型背后看似简单的目标:给定到目前为止的所有内容,猜测下一个文本块。重复数十亿次,这个单一任务会产生能够书写、推理和交谈的模型。

下一个令牌预测模型在每一步输出什么?

该模型为每个可能的下一个标记生成概率,然后通过采样或贪婪选择来选择一个。

GPT 风格的解码器使用哪种类型的注意力?

因果屏蔽确保位置 N 只能看到它之前的位置,从而保留从左到右的预测设置。

这里的“自回归”一代是什么意思?

自回归生成生成一个标记,将其添加到上下文中,然后重复循环。

在训练过程中通常最小化什么损失函数?

交叉熵惩罚为真正的下一个标记分配低概率的模型,相当于最大化可能性。

采样时升高温度有什么作用?

较高的温度使概率分布平坦,增加随机性;较低的温度使选择更加保守。