语言建模
语言建模是一项看似简单的任务,即在给定当前文本的情况下预测接下来会出现什么单词或标记。
概述
This single objective, scaled up massively, is what produces today's powerful chatbots and writing assistants.
深入探讨
语言模型的核心是将概率分配给文本序列。给出提示“法国的首都是”,它会估计下一个标记的可能性,“巴黎”应该得分很高。早期的语言模型是统计 n 元语法,仅计算单词序列出现的频率,但它们在处理长上下文和看不见的短语时遇到了困难。神经语言模型用学习的表示取代了计数,2017 年的 Transformer 架构让模型能够有效地处理长文本。像 GPT 系列这样的现代大型语言模型是在巨大的文本语料库上进行训练的,其目标只有一个:预测下一个标记。值得注意的是,做得好会迫使模型吸收语法、事实、推理模式和风格,因为准确预测文本需要理解它。生成的工作原理是反复预测下一个标记并将其反馈回来。
技术洞察
大多数现代语言模型都是自回归的:它们将句子的概率分解为下一个标记概率的乘积,从左到右一次预测一个标记。训练最大限度地减少交叉熵损失,这会奖励将高概率分配给训练文本中的实际下一个标记。这是自我监督的,标签不受文本本身的影响,因此不需要人工注释。在生成时,温度、top-k 和 top-p(核)等采样策略控制着可预测输出和创造性输出之间的权衡。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
语言建模的未来
事实证明,下一个代币的预测具有惊人的强大功能,并且缩放定律表明,更大的模型和更多的数据不断提高能力,尽管收益正在放缓,高质量的数据变得稀缺。前沿正在转向推理、更长的上下文窗口和训练后方法,例如根据人类反馈进行强化学习,在基本模型构建后塑造行为。预计语言建模与工具、检索和多模式输入将继续混合,而预测下一个标记的基本目标仍然是其他一切的基础。
现实世界的实施
在您键入时,手机键盘或电子邮件会自动完成建议下一个单词
像 ChatGPT 这样的聊天机器人通过重复预测下一个标记来生成流畅的答案
代码编辑器(例如 GitHub Copilot)可根据周围上下文预测下一行代码
语音识别系统使用语言模型在相似的选项中选择最合理的转录
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Language Modeling?
语言建模是一项看似简单的任务,即在给定当前文本的情况下预测接下来会出现什么单词或标记。这一单一目标的大规模扩展,造就了当今强大的聊天机器人和写作助手。
语言模型执行的核心任务是什么?
语言模型估计序列中接下来发生的事情的概率,并且生成通过重复预测和附加下一个标记来工作。
早期 n-gram 语言模型的主要限制是什么?
N-gram 模型依赖于对短单词序列进行计数,因此它们无法很好地处理长范围上下文,并且无法处理从未见过的短语。
为什么语言模型训练被称为“自监督”?
正确的下一个标记已存在于文本中,因此模型无需手动注释即可创建自己的目标。
“自回归”对于语言模型意味着什么?
自回归模型逐个生成文本标记,根据迄今为止生成的所有内容调整每个新预测。
哪种损失函数通常用于训练语言模型?
训练最小化交叉熵,奖励模型为训练文本中观察到的实际下一个标记分配高概率。