HƯỚNG DẪN KỸ THUẬT

Mất cân bằng lớp và lấy mẫu lại

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Resampling rebalances the training data so the model actually learns to spot the minority.

Lặn sâu

Khi các lớp bị sai lệch, một mô hình có thể đạt độ chính xác 99,9% bằng cách luôn dự đoán đa số và không bao giờ phát hiện được một gian lận nào, điều này là vô ích. Lấy mẫu lại sửa lỗi phân phối đào tạo theo hai cách rộng rãi. Lấy mẫu quá mức trùng lặp hoặc tổng hợp các ví dụ thiểu số - SMOTE cổ điển (Kỹ thuật lấy mẫu quá mức cho thiểu số tổng hợp) tạo ra các điểm mới bằng cách nội suy giữa một mẫu thiểu số và các mẫu thiểu số lân cận gần nhất thay vì sao chép chúng. Thay vào đó, việc lấy mẫu dưới sẽ loại bỏ phần lớn các ví dụ (ngẫu nhiên hoặc thông minh thông qua các phương pháp như liên kết Tomek hoặc NearMiss) để làm đều mọi thứ, với cái giá phải trả là loại bỏ dữ liệu. Các giải pháp thay thế tránh chạm vào dữ liệu bao gồm tính trọng số lớp (phạt các lỗi thiểu số nhiều hơn trong hàm mất mát) và điều chỉnh ngưỡng quyết định sau khi đào tạo.

Hiểu biết kỹ thuật

Một quy tắc quan trọng: chỉ lấy mẫu lại tập huấn luyện, không bao giờ lấy mẫu lại tập xác thực hoặc tập kiểm tra và luôn lấy mẫu lại trong các phần xác thực chéo. Lấy mẫu quá mức trước khi tách làm rò rỉ các điểm gần trùng lặp vào tập kiểm tra và làm tăng điểm. Vì ở đây độ chính xác là vô nghĩa nên việc đánh giá phải dựa vào độ chính xác, mức thu hồi, F1, AUC thu hồi chính xác hoặc Hệ số tương quan Matthews — các số liệu luôn trung thực khi hiếm có loại tích cực.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của sự mất cân bằng lớp và lấy mẫu lại

Việc lấy mẫu lại ngày càng được tự động hóa bên trong các đường ống ML, với các thư viện như mất cân bằng học tích hợp trực tiếp vào xác thực chéo. Nghiên cứu đang chuyển sang hướng học tập nhạy cảm với chi phí và các chức năng mất mát được điều chỉnh - chẳng hạn như mất tiêu điểm, làm giảm trọng số của các ví dụ đa số dễ dàng - thường hoạt động tốt hơn so với việc lấy mẫu thô trên mạng sâu. Đối với dữ liệu dạng bảng và hình ảnh, các mô hình tổng hợp tổng hợp các mẫu thiểu số thực tế đang nổi lên như một sự kế thừa phức tạp hơn cho phép nội suy kiểu SMOTE.

Triển khai trong thế giới thực

Đào tạo người phát hiện gian lận thẻ tín dụng trong đó gian lận thực sự chiếm dưới 1% giao dịch, sử dụng SMOTE để khuếch đại các trường hợp gian lận hiếm gặp

Xây dựng mô hình y tế cho căn bệnh hiếm gặp chỉ ở vài phần trăm bệnh nhân, áp dụng trọng số lớp nên trường hợp bỏ sót sẽ bị phạt nặng

Phát hiện các mặt hàng bị lỗi trên dây chuyền sản xuất nơi hầu hết tất cả các sản phẩm đều vượt qua quá trình kiểm tra, lấy mẫu dưới các mặt hàng 'tốt' để cân bằng việc đào tạo

Gắn cờ các hành vi xâm nhập mạng hiếm gặp trong nhật ký an ninh mạng có lưu lượng truy cập thông thường chiếm ưu thế, được đánh giá bằng AUC Precision-Recall thay vì độ chính xác

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mạng lưới Xiêm và mất ba lần

Câu hỏi thường gặp

What is Class Imbalance and Resampling?

Mất cân bằng giai cấp là khi một kết quả vượt xa kết quả khác — chẳng hạn như 99,9% giao dịch hợp pháp so với 0,1% gian lận — điều này khiến các mô hình bỏ qua loại hiếm nhưng quan trọng. Việc lấy mẫu lại sẽ cân bằng lại dữ liệu huấn luyện để mô hình thực sự học cách phát hiện ra thiểu số.

Tại sao độ chính xác đơn giản lại là thước đo kém đối với vấn đề phân loại mất cân bằng cao?

Nếu 99,9% trường hợp là âm tính, thì một mô hình luôn dự đoán âm tính sẽ có độ chính xác 99,9% trong khi không phát hiện được trường hợp dương tính nào, do đó, độ chính xác sẽ che giấu hoàn toàn thất bại ở loại hiếm.

SMOT làm gì?

SMOTE (Kỹ thuật lấy mẫu quá mức thiểu số tổng hợp) tạo ra các ví dụ thiểu số mới bằng cách nội suy giữa một điểm thiểu số và các lân cận thiểu số gần nhất của nó, thay vì chỉ đơn giản là sao chép chúng.

Cách tiếp cận nào xử lý sự mất cân bằng mà KHÔNG thay đổi số lượng mẫu huấn luyện?

Trọng số lớp không ảnh hưởng đến dữ liệu và thay vào đó làm cho hàm mất sẽ xử phạt các lỗi đối với lớp thiểu số nặng nề hơn.

Rủi ro chính của việc áp dụng lấy mẫu quá mức trước khi chia dữ liệu của bạn thành tập huấn luyện và tập kiểm tra là gì?

Việc lấy mẫu lại trước khi phân chia cho phép các điểm thiểu số gần giống nhau xuất hiện trong cả tập huấn luyện và tập kiểm tra, làm rò rỉ thông tin và tạo ra hiệu suất quá lạc quan, phi thực tế.

Nhược điểm chính của việc lấy mẫu ngẫu nhiên là gì?

Việc lấy mẫu dưới sẽ cân bằng các lớp bằng cách loại bỏ các ví dụ đa số, điều này có thể loại bỏ dữ liệu thông tin và làm tổn hại đến khả năng học lớp đa số của mô hình.