Phân loại văn bản
Phân loại văn bản tự động sắp xếp các đoạn văn bản thành các danh mục, chẳng hạn như gắn thẻ email là thư rác hoặc đánh giá là tích cực.
Tổng quan
It is one of the most widely deployed NLP tasks because it turns messy free text into structured labels a system can act on.
Lặn sâu
Phân loại bao gồm nhiều hình dạng. Phân loại nhị phân chọn một trong hai nhãn (thư rác hoặc không thư rác). Nhiều lớp chỉ định chính xác một nhãn từ một số tùy chọn (định tuyến yêu cầu đến thanh toán, bán hàng hoặc hỗ trợ). Nhiều nhãn cho phép nhiều nhãn cùng một lúc (một bài viết được gắn thẻ cả 'chính trị' và 'kinh tế'). Phân tích tình cảm, ghi nhãn chủ đề, phát hiện ý định và lọc độc tính đều là các nhiệm vụ phân loại. Các hệ thống hiện đại chuyển đổi văn bản thành các phần nhúng số để nắm bắt ý nghĩa, sau đó bộ phân loại sẽ ánh xạ các đặc điểm đó thành các xác suất gắn nhãn. Hiệu suất được đánh giá bằng các số liệu vượt quá độ chính xác đơn giản vì dữ liệu thực thường mất cân bằng; độ chính xác (có bao nhiêu mục được gắn cờ là đúng) và thu hồi (có bao nhiêu trường hợp thực tế đã được phát hiện) đều quan trọng và điểm F1 cân bằng cả hai. Sự mất cân bằng giai cấp, trong đó một nhóm chiếm ưu thế, là một cạm bẫy phổ biến.
Hiểu biết kỹ thuật
Một quy trình điển hình mã hóa văn bản có mô hình như BERT thành một vectơ dày đặc, sau đó chuyển nó qua lớp cuối cùng để đưa ra điểm cho mỗi lớp. Softmax biến điểm số thành xác suất cho các nhiệm vụ một nhãn, trong khi sigmoid trên mỗi nhãn xử lý các nhiệm vụ nhiều nhãn trong đó các danh mục độc lập. Với các mô hình ngôn ngữ lớn, nhiệm vụ tương tự có thể được thực hiện dễ dàng bằng cách mô tả các danh mục một cách đơn giản, không cần tập huấn luyện được gắn nhãn, đánh đổi một số độ chính xác và nhất quán để có được tính linh hoạt và tốc độ thiết lập.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của phân loại văn bản
Phân loại không cần nhiều lần và ít lần với các mô hình ngôn ngữ lớn đang giảm nhu cầu gắn nhãn thủ công cho hàng nghìn ví dụ, cho phép các nhóm tạo ra các bộ phân loại mới từ một mô tả ngắn. Mong đợi nhiều thiết lập kết hợp hơn trong đó nhãn khởi động LLM đào tạo mô hình chuyên môn nhỏ hơn, rẻ hơn, nhanh hơn để sản xuất. Khả năng giải thích ngày càng trở nên quan trọng, đặc biệt đối với các mục đích sử dụng nhạy cảm như kiểm duyệt nội dung và sàng lọc sơ yếu lý lịch, trong đó việc biết lý do tại sao nhãn được chỉ định lại quan trọng. Tính mạnh mẽ chống lại ngôn ngữ đối nghịch hoặc thay đổi, chẳng hạn như những kẻ gửi thư rác diễn đạt lại để né tránh các bộ lọc, vẫn là một trọng tâm tích cực.
Triển khai trong thế giới thực
Nhà cung cấp dịch vụ email lọc thư rác và thư lừa đảo ra khỏi hộp thư đến của bạn.
Các thương hiệu chạy phân tích cảm xúc về đánh giá sản phẩm và bài đăng trên mạng xã hội để đánh giá tâm trạng của khách hàng.
Bộ phận hỗ trợ tự động định tuyến các phiếu yêu cầu đến đúng nhóm dựa trên nội dung tin nhắn.
Các nền tảng xã hội gắn cờ lời nói căm thù hoặc bình luận độc hại để xem xét kiểm duyệt.
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Text Classification quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Nhúng văn bản
Câu hỏi thường gặp
What is Text Classification?
Phân loại văn bản tự động sắp xếp các đoạn văn bản thành các danh mục, chẳng hạn như gắn thẻ email là thư rác hoặc đánh giá là tích cực. Đây là một trong những nhiệm vụ NLP được triển khai rộng rãi nhất vì nó biến văn bản tự do lộn xộn thành các nhãn có cấu trúc mà hệ thống có thể hoạt động.
Mục đích của việc phân loại văn bản là gì?
Phân loại văn bản gán một hoặc nhiều nhãn danh mục cho một đoạn văn bản, biến văn bản tự do thành đầu ra có cấu trúc.
Kịch bản nào là ví dụ về phân loại nhiều nhãn?
Phân loại nhiều nhãn cho phép áp dụng đồng thời nhiều danh mục cho cùng một mặt hàng.
Tại sao độ chính xác đơn giản thường là thước đo gây hiểu lầm cho việc phân loại văn bản?
Khi một lớp chiếm ưu thế, luôn dự đoán rằng lớp đó mang lại độ chính xác cao trong khi không thu được gì hữu ích, vì vậy cần có độ chính xác, thu hồi và F1.
Biện pháp thu hồi trong một nhiệm vụ phân loại là gì?
Thu hồi là tỷ lệ các trường hợp dương tính thực sự mà hệ thống đã xác định chính xác, ghi lại số lượng trường hợp đã bỏ sót.
Phân loại văn bản 'zero-shot' có nghĩa là gì?
Phân loại không cần thực hiện cho phép một mô hình ngôn ngữ lớn chỉ định các danh mục chỉ từ một dấu nhắc mô tả chúng mà không cần có tập huấn luyện được gắn nhãn.