语言人工智能指南

TF-IDF 和词袋模型

词袋将文本转换为忽略顺序的字数统计,而 TF-IDF 对这些字数进行加权,因此罕见的、独特的单词比常见的单词更重要。

阅读时间:2分钟最后更新

概述

Together they were the workhorses of search and text classification before deep learning.

深入探讨

词袋 (BoW) 模型将文档表示为字数向量,丢弃语法和词序:“狗咬了人”和“人咬了狗”看起来相同。这种简单性对于许多任务来说出奇地有效。 TF-IDF 通过重新加权项来改进 BoW。词频 (TF) 衡量单词在文档中出现的频率,而逆文档频率 (IDF) 则降低在许多文档中出现的单词的权重。将它们相乘会为在一份文档中频繁出现但在整个集合中很少出现的单词(例如独特的主题关键字)提供高分,而诸如“the”之类的常见单词的权重接近于零。 TF-IDF 向量支持关键字搜索排名并提供朴素贝叶斯和 SVM 等经典分类器。

技术洞察

IDF 通常计算为 log(N / df),其中 N 是文档总数,df 是包含该术语的文档数量,因此每个文档中的单词产生的 IDF 接近于零。最终的 TF-IDF 分数是 TF 乘以 IDF。文档向量通常进行 L2 归一化,并与余弦相似度进行比较,余弦相似度测量向量之间的角度并忽略文档长度差异。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

TF-IDF 和词袋模型的未来

密集神经嵌入和 Transformer 模型现在可以捕获 BoW 和 TF-IDF 无法捕获的词序和含义,因此深度模型主导了尖端 NLP。然而,TF-IDF 仍然是一个快速、可解释、低资源的基线,在关键字搜索方面很难被击败,并且它仍然支持混合检索系统,其中稀疏的 TF-IDF/BM25 分数与密集的嵌入相结合,以改进搜索和检索增强的生成。

现实世界的实施

搜索引擎根据 TF-IDF 或其后继者 BM25 针对查询对文档进行排名

使用输入朴素贝叶斯分类器的词袋特征进行垃圾邮件过滤器

通过选择最高 TF-IDF 术语从文章中提取关键字或标签

通过比较 TF-IDF 向量与余弦相似度来推荐相似的新闻文章

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TF-IDF and Bag-of-Words Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is TF-IDF and Bag-of-Words Models?

词袋将文本转换为忽略顺序的字数统计,而 TF-IDF 对这些字数进行加权,因此罕见的、独特的单词比常见的单词更重要。在深度学习之前,它们一起成为搜索和文本分类的主力。

词袋模型会丢弃哪些关键信息?

词袋保留字数,但丢弃词序和语法结构。

TF-IDF 的 IDF 部分有什么作用?

逆文档频率降低了许多文档中出现的术语的权重,因此像“the”这样的常见单词贡献很少。

出现在集合中每个文档中的单词的 IDF 值接近于多少?

对于 IDF = log(N/df),如果 df 等于 N,则比率为 1,log(1) 为 0,从而使该术语几乎没有权重。

术语的 TF-IDF 分数是如何计算的?

TF-IDF 权重是词频乘以逆文档频率。

哪种相似性度量通常用于比较 TF-IDF 文档向量?

余弦相似度测量向量之间的角度,是比较 TF-IDF 表示的标准,无论文档长度如何。