语言人工智能指南

无分词器的字节级模型

无分词器的模型放弃了单词片段的固定词汇,直接对原始字节进行操作,让一个模型可以处理任何语言、代码甚至嘈杂的文本,而无需脆弱的预处理步骤。

阅读时间:2分钟最后更新

概述

This matters because the tokenizer is one of the last hand-built, English-biased components in an otherwise learned pipeline.

深入探讨

大多数语言模型首先使用由字节对编码 (BPE) 等算法构建的固定词汇表将文本切割为子词标记。这个分词器在训练之前就决定了一次,并且永远不会学习。它抬高了其代表性不足的语言的成本,破坏了数字和稀有单词,并破坏了拼写错误。字节级模型直接读取原始 UTF-8 字节(256 个可能的值)。像 ByT5 这样的早期尝试虽然有效,但速度很慢,因为字节序列比令牌序列长得多。字节潜在转换器 (BLT) 等较新的设计根据每个字节的可预测性将字节分组为动态“补丁”,在文本困难的地方进行计算,在文本容易的地方进行略读。结果是完全没有词汇的竞争质量。

技术洞察

核心挑战是序列长度:20 个 token 的句子可能有 100 多个字节,并且注意力成本随着长度的增加而增加。 BLT solves this with entropy-based patching.小型字节级网络预测每个下一个字节;在其不确定性(熵)较高的地方,放置补丁边界。硬的、信息密集的区域会得到更短的补丁和更多的计算,同时合并可预测的运行。然后,大型变压器对补丁而不是字节进行操作,从而恢复效率。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

无分词器字节级模型的未来

预计字节级方法在多语言、代码和嘈杂的输入环境中传播得最快,在这些环境中,分词器最容易失败,并且在混合文本、结构化数据和异常符号的代理中。随着动态修补的成熟,灵活性和速度之间长期存在的权衡不断缩小,使得“无标记器”成为现实的默认设置,而不是研究的好奇心。无标记化设计还简化了部署,因为一个模型可以为每个脚本提供服务,而无需重新训练词汇表。

现实世界的实施

处理阿姆哈拉语或高棉语等低资源语言,这些语言的标准 BPE 词汇会分成低效的单字节片段。

处理源代码,其中精确的空格、缩进和罕见标识符很重要,并且标记边界经常不一致。

读取嘈杂的现实世界文本,例如 OCR 输出、社交媒体拼写错误和表情符号,而模型不会将拼写错误视为未知标记。

跨数百个脚本和编写系统提供一个全局模型,无需维护或重新训练每个区域的单独分词器。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenizer-Free Byte-Level Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

TF-IDF 和词袋模型

常见问题

What is Tokenizer-Free Byte-Level Models?

无分词器的模型放弃了单词片段的固定词汇,直接对原始字节进行操作,让一个模型可以处理任何语言、代码甚至嘈杂的文本,而无需脆弱的预处理步骤。这很重要,因为分词器是在其他学习管道中最后手工构建的、偏英语的组件之一。

无分词器的字节级模型读取什么作为其输入单元?

字节级模型直接对文本的原始字节进行操作,其中只有 256 个可能的值,无需任何固定的标记词汇表。

将原始字节馈送到标准变压器的主要实际缺点是什么?

几十个标记的段落可能会超过一百个字节,并且注意力成本随着序列长度的增加而增加,因此简单的字节模型很慢。

字节潜在转换器 (BLT) 如何决定将字节分组到补丁中的位置?

BLT 将补丁边界放置在小模型的下一个字节不确定性较高的位置,从而为硬区域提供更多计算并合并可预测的运行。

为什么传统的 BPE 分词器被认为是偏英语的?

由于词汇是根据以英语为主的语料库构建的,代表性不足的语言会被分割成许多标记,从而增加了它们的成本。

完全删除分词器的主要优点是什么?

由于没有固定的词汇表,单个字节级模型可以处理每个书写系统和符号集,而无需维护每种语言的分词器。