語言人工智慧指南

TF-IDF 和詞袋模型

詞袋將文字轉換為忽略順序的字數統計,而 TF-IDF 對這些字數進行加權,因此罕見的、獨特的單字比常見的單字更重要。

閱讀時間約2分鐘最後更新

概述

Together they were the workhorses of search and text classification before deep learning.

深入探討

詞袋 (BoW) 模型將文件表示為字數向量,丟棄語法和詞序:「狗咬了人」和「人咬了狗」看起來相同。這種簡單性對於許多任務來說出奇地有效。 TF-IDF 透過重新加權項來改進 BoW。詞頻 (TF) 衡量單字在文件中出現的頻率,而逆文檔頻率 (IDF) 則降低在許多文件中出現的單字的權重。將它們相乘會為在一份文件中頻繁出現但在整個集合中很少出現的單字(例如獨特的主題關鍵字)提供高分,而諸如“the”之類的常見單字的權重接近於零。 TF-IDF 向量支援關鍵字搜尋排名並提供樸素貝葉斯和 SVM 等經典分類器。

技術洞察

IDF 通常計算為 log(N / df),其中 N 是文檔總數,df 是包含該術語的文檔數量,因此每個文檔中的單字產生的 IDF 接近零。最終的 TF-IDF 分數是 TF 乘以 IDF。文件向量通常進行 L2 歸一化,並與餘弦相似度進行比較,餘弦相似度測量向量之間的角度並忽略文件長度差異。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

TF-IDF 和詞袋模型的未來

密集神經嵌入和 Transformer 模型現在可以捕捉 BoW 和 TF-IDF 無法捕捉的詞序和意義,因此深度模型主導了尖端 NLP。然而,TF-IDF 仍然是一個快速、可解釋、低資源的基線,在關鍵字搜尋方面很難被擊敗,而且它仍然支援混合檢索系統,其中稀疏的 TF-IDF/BM25 分數與密集的嵌入相結合,以改進搜尋和檢索增強的生成。

現實世界的實施

搜尋引擎根據 TF-IDF 或其後繼者 BM25 針對查詢對文件進行排名

使用輸入樸素貝葉斯分類器的詞袋特徵進行垃圾郵件過濾器

透過選擇最高 TF-IDF 術語從文章中提取關鍵字或標籤

透過比較 TF-IDF 向量與餘弦相似度來推薦相似的新聞文章

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TF-IDF and Bag-of-Words Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is TF-IDF and Bag-of-Words Models?

詞袋將文字轉換為忽略順序的字數統計,而 TF-IDF 對這些字數進行加權,因此罕見的、獨特的單字比常見的單字更重要。在深度學習之前,它們一起成為搜尋和文字分類的主力。

詞袋模型會丟棄哪些關鍵資訊?

詞袋保留字數,但丟棄詞序和語法結構。

TF-IDF 的 IDF 部分有什麼作用?

逆文檔頻率降低了許多文檔中出現的術語的權重,因此像“the”這樣的常見單字貢獻很少。

出現在集合中每個文件中的單字的 IDF 值接近多少?

對於 IDF = log(N/df),如果 df 等於 N,則比率為 1,log(1) 為 0,從而使該術語幾乎沒有權重。

術語的 TF-IDF 分數是如何計算的?

TF-IDF 權重是詞頻乘以逆文檔頻率。

哪一種相似性度量通常用於比較 TF-IDF 文件向量?

餘弦相似度測量向量之間的角度,是比較 TF-IDF 表示的標準,無論文件長度為何。