HƯỚNG DẪN cơ bản

Phân cụm K-Means

K-Means là một thuật toán không giám sát, tự động sắp xếp dữ liệu thành K nhóm bằng cách tìm trung tâm cụm.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it reveals hidden structure in unlabeled data, from customer segments to image colors.

Lặn sâu

K-Means phân vùng dữ liệu thành một số cụm đã chọn, K, không có bất kỳ nhãn nào. Nó bắt đầu bằng cách đặt K điểm gọi là centroid, thường là ngẫu nhiên. Sau đó, nó lặp lại hai bước: gán mọi điểm dữ liệu cho tâm gần nhất của nó và di chuyển từng tâm đến vị trí trung bình của các điểm được gán cho nó. Các bước này lặp lại cho đến khi phép gán ngừng thay đổi, nghĩa là thuật toán đã hội tụ. Mục tiêu là giảm thiểu phương sai trong cụm, tổng khoảng cách bình phương giữa các điểm và tâm của chúng. Bởi vì kết quả phụ thuộc vào vị trí bắt đầu, nên việc khởi tạo thông minh như K-Means++ sẽ phân tán các trọng tâm ban đầu ra xa nhau. Bạn phải chọn K trước, thường được hướng dẫn bởi 'phương pháp khuỷu tay' trên đường cong lỗi.

Hiểu biết kỹ thuật

K-Means giảm thiểu quán tính, tổng bình phương khoảng cách từ mỗi điểm đến trọng tâm được chỉ định của nó. Vòng lặp gán-sau-cập nhật là một quy trình kiểu tối đa hóa kỳ vọng luôn làm giảm quán tính, đảm bảo độ hội tụ ở mức tối thiểu cục bộ, mặc dù không nhất thiết phải là tốt nhất toàn cầu. Nó giả định các cụm có dạng gần như hình cầu và có kích thước tương tự nhau, vì nó dựa vào khoảng cách Euclide, do đó các nhóm kéo dài hoặc có kích thước không đồng đều có thể đánh lừa nó.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của phân cụm K-Means

K-Means vẫn là một công cụ hữu hiệu vì nó nhanh và có khả năng mở rộng quy mô thành các tập dữ liệu khổng lồ thông qua các phiên bản lô nhỏ cập nhật trọng tâm trên các mẫu nhỏ. Nghiên cứu tiếp tục về việc lựa chọn K tự động, khởi tạo thông minh hơn và các biến thể hạt nhân hoặc học sâu để xử lý các cụm không hình cầu. Nó ngày càng được sử dụng như một bước tiền xử lý, nén dữ liệu hoặc tạo các tính năng trước khi cung cấp các mô hình phức tạp hơn và bên trong cơ sở dữ liệu vectơ để tăng tốc độ tìm kiếm tương tự qua các phần nhúng.

Triển khai trong thế giới thực

Phân khúc khách hàng: phân nhóm người mua sắm theo mức chi tiêu và tần suất ghé thăm để nhắm mục tiêu các chiến dịch tiếp thị.

Nén màu hình ảnh: giảm hàng triệu màu pixel thành K sắc thái đại diện để thu nhỏ kích thước tệp.

Tổ chức tài liệu: phân cụm các bài báo hoặc phiếu hỗ trợ theo chủ đề mà không cần danh mục được xác định trước.

Phát hiện bất thường: gắn cờ các điểm ở xa bất kỳ trung tâm cụm nào vì có thể có lỗi cảm biến hoặc gian lận.

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Tài liệu giúp phân cụm K-Means và các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the K-Means Clustering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Đánh giá điểm ý kiến trung bình

Câu hỏi thường gặp

What is K-Means Clustering?

K-Means là một thuật toán không giám sát, tự động sắp xếp dữ liệu thành K nhóm bằng cách tìm trung tâm cụm. Nó quan trọng vì nó tiết lộ cấu trúc ẩn trong dữ liệu chưa được gắn nhãn, từ phân khúc khách hàng đến màu sắc hình ảnh.

Chữ 'K' trong K-Means đề cập đến điều gì?

K là số cụm do người dùng chỉ định trước khi chạy thuật toán; phương pháp sau đó tìm thấy nhiều centroid.

Hai bước lặp lại trong vòng lặp K-Means là gì?

K-Means luân phiên giữa việc gán từng điểm cho trọng tâm gần nhất của nó và tính toán lại từng trọng tâm làm giá trị trung bình của các điểm được chỉ định.

K-Means cố gắng giảm thiểu số lượng nào?

K-Means giảm thiểu quán tính, bình phương tổng khoảng cách giữa các điểm và tâm được chỉ định của chúng, làm cho các cụm trở nên chặt chẽ.

Tại sao K-Means được gọi là thuật toán 'không giám sát'?

Không được giám sát có nghĩa là dữ liệu không có nhãn; K-Means tự tìm ra cấu trúc mà không cần chỉ dẫn chính xác các nhóm.

'Phương pháp khuỷu tay' thường được sử dụng để làm gì?

Phương pháp khuỷu tay vẽ biểu đồ lỗi so với K và tìm kiếm điểm uốn cong nơi việc thêm nhiều cụm sẽ không giúp ích nhiều nữa.