HƯỚNG DẪN cơ bản

Bộ phân loại Naive Bayes

Naive Bayes là một bộ phân loại xác suất nhanh, được xây dựng dựa trên định lý Bayes, giả định mọi đặc điểm đều độc lập với lớp.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Despite that unrealistic assumption, it works remarkably well for text tasks like spam filtering.

Lặn sâu

Naive Bayes biến việc phân loại thành một phép tính xác suất. Sử dụng định lý Bayes, nó ước tính xác suất của một lớp dựa trên các đặc điểm đầu vào, sau đó chọn lớp có điểm cao nhất. Phần 'ngây thơ' là giả định rằng tất cả các tính năng đều độc lập có điều kiện đối với lớp, do đó nó có thể nhân các xác suất của tính năng riêng lẻ thay vì mô hình hóa các tương tác của chúng. Điều này làm giảm đáng kể dữ liệu và tính toán cần thiết. Các biến thể phổ biến bao gồm Multinomial Naive Bayes (số từ trong tài liệu), Bernoulli Naive Bayes (từ hiện tại/vắng mặt) và Gaussian Naive Bayes (các tính năng liên tục được mô hình hóa với phân phối chuẩn). Nó huấn luyện dữ liệu trong một lần duy nhất, cần ít điều chỉnh và xử lý hàng nghìn tính năng một cách tinh tế, khiến nó trở thành cơ sở cổ điển để phát hiện thư rác và phân loại tài liệu.

Hiểu biết kỹ thuật

Đối với lớp c và các tính năng x1..xn, nó tính P(c) nhân với tích của P(xi|c), sau đó chuẩn hóa. Bởi vì việc nhân nhiều xác suất nhỏ sẽ gây ra tình trạng tràn số, thay vào đó, việc triển khai tính tổng các xác suất ghi nhật ký. Việc làm mịn Laplace (thêm một) sẽ ngăn không cho một từ vô hình nào loại bỏ toàn bộ sản phẩm. Xác suất P(xi|c) và P(c) trước đó được ước tính bằng cách đếm đơn giản từ tập huấn luyện, đó là lý do tại sao việc huấn luyện về cơ bản chỉ là đếm tần số.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của máy phân loại Naive Bayes

Mạng lưới thần kinh sâu và máy biến áp hiện đang thống trị việc phân loại văn bản, vì vậy Naive Bayes hiếm khi được xếp hạng cao nhất. Nhưng nó vẫn tồn tại như một đường cơ sở mạnh mẽ, gần như tức thời, một công cụ giảng dạy có thể hiểu được và là một lựa chọn thiết thực khi dữ liệu khan hiếm, độ trễ phải rất nhỏ hoặc khả năng tính toán bị hạn chế. Hy vọng nó sẽ vẫn được nhúng trong các bộ lọc nhẹ trên thiết bị, quy trình tạo mẫu nhanh và hệ thống kết hợp trong đó bộ phân loại đầu tiên giá rẻ định tuyến đầu vào trước khi mô hình nặng hơn được gọi.

Triển khai trong thế giới thực

Lọc thư rác qua email chấm điểm thư theo từ chứa trong đó

Phân tích tình cảm gắn thẻ đánh giá sản phẩm là tích cực hoặc tiêu cực

Định tuyến phiếu hỗ trợ hoặc bài viết tin tức vào các danh mục chủ đề

Phát hiện ngôn ngữ và phân loại tài liệu đơn giản trong quy trình tìm kiếm

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Tài liệu nơi Bộ phân loại Naive Bayes giúp ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Naive Bayes Classifiers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Giải mã rủi ro Bayes tối thiểu

Câu hỏi thường gặp

What is Naive Bayes Classifiers?

Naive Bayes là một bộ phân loại xác suất nhanh, được xây dựng dựa trên định lý Bayes, giả định mọi đặc điểm đều độc lập với lớp. Bất chấp giả định phi thực tế đó, nó hoạt động rất tốt đối với các tác vụ văn bản như lọc thư rác.

Giả định 'ngây thơ' cốt lõi trong bộ phân loại Naive Bayes là gì?

Mô hình giả định mỗi tính năng đóng góp độc lập vào kết quả của lớp, cho phép nó nhân lên xác suất của mỗi tính năng.

Naive Bayes được xây dựng dựa trên định lý nào?

Nó sử dụng định lý Bayes để chuyển đổi xác suất của lớp trước và khả năng đặc trưng thành xác suất sau cho mỗi lớp.

Tại sao việc triển khai thường tính tổng xác suất nhật ký thay vì nhân xác suất thô?

Nhân nhiều xác suất dưới 1 có thể tràn về 0, vì vậy việc lấy nhật ký và tính tổng sẽ giúp phép toán ổn định.

Làm mịn Laplace (thêm một) giải quyết vấn đề gì?

Nếu không làm mịn, một từ chưa từng thấy trong một lớp sẽ cho xác suất của lớp đó bằng 0; số lượng bổ sung tránh điều này.

Biến thể Naive Bayes nào là tự nhiên nhất đối với tính năng đếm từ trong tài liệu?

Multinomial Naive Bayes mô hình các số đếm rời rạc chẳng hạn như số lần mỗi từ xuất hiện, làm cho nó trở thành tiêu chuẩn cho văn bản.