HƯỚNG DẪN cơ bản

K-Hàng xóm gần nhất

K-Nearest Neighbors (KNN) phân loại một điểm dữ liệu mới bằng cách xem xét K ví dụ gần nhất và lấy đa số phiếu bầu.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters as one of the simplest, most intuitive algorithms in machine learning, requiring almost no training.

Lặn sâu

KNN là một 'người học lười biếng': nó không được đào tạo thực sự mà thay vào đó chỉ lưu trữ toàn bộ tập dữ liệu. Để phân loại một điểm mới, nó đo khoảng cách, thường là Euclide, đến mọi ví dụ được lưu trữ, tìm K lân cận gần nhất và gán lớp chung nhất trong số đó. Đối với hồi quy, thay vào đó, nó lấy trung bình các giá trị của hàng xóm. Việc lựa chọn K rất quan trọng: K nhỏ nhạy cảm với nhiễu và có thể quá khớp, trong khi K lớn làm trơn tru các quyết định nhưng có thể làm mờ ranh giới thực. Bởi vì tất cả các tính năng đều đóng góp vào khoảng cách, KNN yêu cầu chia tỷ lệ tính năng để các biến phạm vi lớn không chiếm ưu thế. Điểm yếu chính của nó là tốc độ dự đoán, vì mỗi truy vấn sẽ so sánh với toàn bộ tập dữ liệu.

Hiểu biết kỹ thuật

KNN không dựa trên tham số và dựa trên cá thể: nó không đưa ra giả định về hình dạng của dữ liệu và lưu trữ các ví dụ thay vì học các trọng số. Các số liệu khoảng cách, Euclide, Manhattan hoặc cosine, xác định 'sự gần gũi' và ranh giới quyết định mà nó hình thành có thể rất bất thường. Bởi vì nó so sánh từng truy vấn với tất cả các điểm, nên việc tra cứu đơn giản diễn ra chậm, do đó các thư viện sử dụng cây KD, cây bóng hoặc chỉ mục lân cận gần nhất để tăng tốc độ tìm kiếm ở các chiều thấp hơn.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của hàng xóm gần nhất K

Ý tưởng cốt lõi của KNN là tìm các ví dụ tương tự nhất, hỗ trợ thế hệ tăng cường truy xuất và tìm kiếm vectơ hiện đại, trong đó các hệ thống tìm nạp các vectơ nhúng gần nhất để làm nền tảng cho các mô hình ngôn ngữ lớn. Các thư viện lân cận gần nhất như FAISS và HNSW giúp việc tìm kiếm tương tự ở quy mô hàng tỷ trở nên thực tế. Mặc dù hiếm khi là bộ phân loại cuối cùng trong các quy trình lớn, nhưng nguyên tắc lân cận gần nhất lại phù hợp hơn bao giờ hết với tư cách là xương sống của tìm kiếm và đề xuất ngữ nghĩa.

Triển khai trong thế giới thực

Hệ thống đề xuất: đề xuất phim hoặc sản phẩm tương tự với những sản phẩm mà người dùng đã thích.

Nhận dạng chữ số viết tay: phân loại một chữ số bằng cách so sánh nó với các hình ảnh được gắn nhãn giống nhau nhất.

Hỗ trợ chẩn đoán y tế: dự đoán tình trạng bệnh dựa trên những bệnh nhân có kết quả xét nghiệm giống nhau nhất.

Tìm kiếm ngữ nghĩa: truy xuất các phần nhúng văn bản gần nhất để trả lời truy vấn trong cơ sở dữ liệu vectơ.

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Ghi lại nơi K-Nearest Neighbors trợ giúp và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the K-Nearest Neighbors quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Bộ phân loại Naive Bayes

Câu hỏi thường gặp

What is K-Nearest Neighbors?

K-Nearest Neighbors (KNN) phân loại một điểm dữ liệu mới bằng cách xem xét K ví dụ gần nhất và lấy đa số phiếu bầu. Nó được coi là một trong những thuật toán đơn giản nhất, trực quan nhất trong học máy, hầu như không cần đào tạo.

KNN phân loại điểm dữ liệu mới như thế nào?

KNN tìm K ví dụ được lưu trữ gần nhất và chỉ định lớp phổ biến nhất trong số chúng (đối với hồi quy, nó tính trung bình các giá trị của chúng).

Tại sao KNN bị gọi là 'người học lười'?

KNN hoãn mọi công việc đến thời điểm dự đoán; nó chỉ đơn giản là ghi nhớ tập dữ liệu thay vì xây dựng mô hình trong quá trình đào tạo.

Tại sao việc chia tỷ lệ tính năng lại quan trọng đối với KNN?

Bởi vì KNN phụ thuộc vào khoảng cách, nên một tính năng phạm vi rộng không được chia tỷ lệ có thể lấn át các tính năng khác, vì vậy các tính năng thường được chuẩn hóa.

Điều gì xảy ra nếu bạn chọn một K rất nhỏ, như K=1?

Một K nhỏ cho phép một người hàng xóm ồn ào hoặc bị dán nhãn sai quyết định kết quả, dẫn đến ranh giới lởm chởm, quá phù hợp.

Hạn chế thực tế chính của KNN là gì?

Vì mỗi truy vấn phải đo khoảng cách đến mọi mẫu, nên việc dự đoán có thể chậm trên các tập dữ liệu lớn, khiến cây hoặc tốc độ tìm kiếm gần đúng tăng lên.