代币化
标记化是将文本切成更小的片段(称为标记)的步骤,标记是语言模型实际读取和预测的单位。
概述
It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.
深入探讨
在模型看到您的文本之前,分词器会将其拆分为标记,这些标记通常是子词块,而不是整个单词或单个字母。 “unhappiness”这个词可能会变成“un”,“happiness”,或者“tokenization”可能会分裂成“token”和“ization”。常见的单词通常映射到单个标记,而罕见的单词、名称或代码则分为多个。然后,每个标记都会映射到一个 ID 号,模型会将其转换为向量。这实际上很重要,因为模型具有以令牌衡量的固定上下文窗口,并且 API 按令牌计费,因此粗略的英语经验法则是每个令牌大约 4 个字符或 0.75 个单词。标记化还解释了经典模型的怪癖:计算字母或进行精确拼写很困难,因为模型看到的是块,而不是单个字符。
技术洞察
大多数现代法学硕士都使用子字标记化,例如字节对编码(BPE)或其字节级变体。 BPE 从字符开始,反复合并最频繁的相邻对以构建固定词汇表(通常有 30,000 到 100,000+ 个标记)。这平衡了两个极端:单词级标记化无法处理看不见的单词,而字符级使序列非常长。子词让模型通过组合已知的片段来表示任何字符串,包括拼写错误和新词,同时保持序列相当短。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
代币化的未来
代币化是一个活跃的研究领域,正是因为它限制了效率和公平性。标记为更多部分的语言成本更高,并且更快地耗尽上下文,因此多语言公平性是一个真正值得关注的问题,需要通过更好、更平衡的词汇来解决。研究人员还在探索无令牌或字节级模型(如 ByT5),并学习了可以完全消除脆弱的手动调整步骤的令牌化。目前,预计会有更大的词汇量、更智能的多语言标记器,以及用户对基于标记的定价和上下文预算的意识不断增强。
现实世界的实施
GPT 和 Claude 等模型的 API 定价按输入和输出令牌计费,因此令牌计数直接影响成本。
上下文窗口限制(例如 128K 或 200K 令牌)以令牌为单位进行衡量,限制了您可以包含的文本或代码的数量。
开发人员在发送请求之前使用分词器(例如 tiktoken)来估计提示大小并修剪内容。
标记化解释了为什么模型难以计算单词中的字母或反转字符串,因为它们看到的是子词块,而不是字符。
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录标记化在哪些方面有帮助以及在哪些方面更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Tokenization?
标记化是将文本切成更小的片段(称为标记)的步骤,标记是语言模型实际读取和预测的单位。它悄悄地决定了成本、上下文限制,甚至模型处理拼写和罕见单词的能力。
语言模型上下文中的“令牌”是什么?
标记是模型处理的单位,通常是子词块,有时是整个单词或单个字符。
大多数现代法学硕士使用哪种标记化方法?
BPE 等子词方法合并了频繁的字符对,平衡了纯单词级和字符级方法的弱点。
为什么标记化使得诸如计算单词中的字母之类的任务对于法学硕士来说变得困难?
由于文本被分组为子词标记,因此模型无法直接感知每个字符,从而使得字母级任务容易出错。
为什么标记化对于 API 成本和上下文限制很重要?
提供商按令牌计费,上下文窗口的大小以令牌为单位,因此令牌数量决定了价格和您可以包含的数量。
为什么同一个句子在某些语言中比在英语中花费更多的标记?
主要针对英语训练的词汇将其他语言分割成更多的标记,从而提高了成本并更快地消耗上下文。