HƯỚNG DẪN AI về ngôn ngữ

Mô hình TF-IDF và Bag-of-Words

Túi từ biến văn bản thành số lượng từ bỏ qua thứ tự và TF-IDF đánh giá cao số lượng đó nên những từ hiếm gặp, đặc biệt quan trọng hơn những từ phổ biến.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Together they were the workhorses of search and text classification before deep learning.

Lặn sâu

Mô hình túi từ (BoW) biểu thị một tài liệu dưới dạng vectơ đếm từ, loại bỏ ngữ pháp và trật tự từ: 'con chó cắn người đàn ông' và 'người đàn ông cắn con chó' trông giống hệt nhau. Sự đơn giản này hoạt động hiệu quả một cách đáng ngạc nhiên đối với nhiều nhiệm vụ. TF-IDF tinh chỉnh BoW bằng cách cân nhắc lại các điều khoản. Tần suất thuật ngữ (TF) đo tần suất một từ xuất hiện trong tài liệu, trong khi Tần suất tài liệu nghịch đảo (IDF) giảm trọng số các từ xuất hiện trong nhiều tài liệu. Việc nhân chúng sẽ mang lại điểm cao cho những từ thường xuyên có trong một tài liệu nhưng hiếm gặp trong toàn bộ bộ sưu tập, chẳng hạn như từ khóa chủ đề đặc biệt, trong khi những từ phổ biến như 'the' có trọng số gần như bằng 0. Các vectơ TF-IDF hỗ trợ xếp hạng tìm kiếm từ khóa và cung cấp các phân loại cổ điển như Naive Bayes và SVM.

Hiểu biết kỹ thuật

IDF thường được tính dưới dạng log(N / df), trong đó N là tổng số tài liệu và df là số tài liệu có chứa thuật ngữ đó, do đó một từ trong mỗi tài liệu sẽ mang lại IDF gần bằng 0. Điểm TF-IDF cuối cùng là TF nhân với IDF. Các vectơ tài liệu thường được chuẩn hóa L2 và được so sánh với độ tương tự cosin, đo góc giữa các vectơ và bỏ qua sự khác biệt về độ dài tài liệu.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của các mô hình TF-IDF và Bag-of-Words

Các mô hình biến áp và nhúng thần kinh dày đặc hiện nắm bắt được trật tự từ và có nghĩa là BoW và TF-IDF không thể làm được, vì vậy các mô hình sâu thống trị NLP tiên tiến. Tuy nhiên, TF-IDF vẫn là đường cơ sở nhanh, có thể giải thích, sử dụng ít tài nguyên, khó có thể đánh bại trong tìm kiếm từ khóa và nó vẫn củng cố các hệ thống truy xuất kết hợp trong đó các điểm TF-IDF/BM25 thưa thớt được kết hợp với các phần nhúng dày đặc để cải thiện việc tạo tìm kiếm và tăng cường truy xuất.

Triển khai trong thế giới thực

Công cụ tìm kiếm xếp hạng tài liệu theo TF-IDF hoặc BM25 kế nhiệm của nó đối với một truy vấn

Bộ lọc thư rác sử dụng các tính năng túi từ được đưa vào bộ phân loại Naive Bayes

Trích xuất từ khóa hoặc thẻ từ một bài viết bằng cách chọn thuật ngữ TF-IDF cao nhất của nó

Đề xuất các bài báo tương tự bằng cách so sánh vectơ TF-IDF với độ tương tự cosine

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TF-IDF and Bag-of-Words Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

What is TF-IDF and Bag-of-Words Models?

Túi từ biến văn bản thành số lượng từ bỏ qua thứ tự và TF-IDF đánh giá cao số lượng đó nên những từ hiếm gặp, đặc biệt quan trọng hơn những từ phổ biến. Chúng cùng nhau đóng vai trò chủ chốt trong việc tìm kiếm và phân loại văn bản trước khi học sâu.

Mô hình túi từ loại bỏ những thông tin quan trọng nào?

Túi từ giữ số lượng từ nhưng loại bỏ trật tự từ và cấu trúc ngữ pháp.

Phần IDF của TF-IDF làm nhiệm vụ gì?

Tần suất tài liệu nghịch đảo làm giảm tầm quan trọng của các thuật ngữ xuất hiện trong nhiều tài liệu, vì vậy những từ phổ biến như 'the' đóng góp rất ít.

Một từ xuất hiện trong mọi tài liệu trong bộ sưu tập sẽ có giá trị IDF gần bằng giá trị nào?

Với IDF = log(N/df), nếu df bằng N thì tỷ lệ là 1 và log(1) là 0, khiến thuật ngữ gần như không có trọng số.

Điểm TF-IDF cho một học kỳ được tính như thế nào?

Trọng số TF-IDF là tần số thuật ngữ nhân với tần số nghịch đảo của tài liệu.

Biện pháp tương tự nào thường được sử dụng để so sánh các vectơ tài liệu TF-IDF?

Độ tương tự cosine đo góc giữa các vectơ và là tiêu chuẩn để so sánh các biểu diễn TF-IDF bất kể độ dài tài liệu.