K-Tetangga Terdekat
K-Nearest Neighbours (KNN) mengklasifikasikan titik data baru dengan melihat contoh K terdekat dan mengambil suara terbanyak.
Ikhtisar
It matters as one of the simplest, most intuitive algorithms in machine learning, requiring almost no training.
Menyelam Lebih Dalam
KNN adalah 'pelajar yang malas': ia tidak melakukan pelatihan nyata dan hanya menyimpan seluruh kumpulan data. Untuk mengklasifikasikan suatu titik baru, ia mengukur jarak, biasanya Euclidean, ke setiap contoh yang disimpan, mencari K tetangga terdekat, dan menetapkan kelas yang paling umum di antara titik-titik tersebut. Untuk regresi, ini menghitung rata-rata nilai tetangganya. Pilihan K penting: K yang kecil sensitif terhadap kebisingan dan dapat menyebabkan overfit, sedangkan K yang besar memperhalus keputusan namun dapat mengaburkan batasan sebenarnya. Karena semua fitur berkontribusi terhadap jarak, KNN memerlukan penskalaan fitur agar variabel dengan rentang yang besar tidak mendominasi. Kelemahan utamanya adalah kecepatan prediksi, karena setiap kueri dibandingkan dengan keseluruhan kumpulan data.
Wawasan Teknis
KNN bersifat non-parametrik dan berbasis instance: KNN tidak membuat asumsi tentang bentuk data dan menyimpan contoh, melainkan mempelajari bobot. Metrik jarak, Euclidean, Manhattan, atau kosinus, mendefinisikan 'kedekatan', dan batasan keputusan yang dibentuknya bisa sangat tidak teratur. Karena membandingkan setiap kueri dengan semua titik, pencarian naif menjadi lambat, sehingga perpustakaan menggunakan pohon KD, pohon bola, atau perkiraan indeks tetangga terdekat untuk mempercepat pencarian dalam dimensi yang lebih rendah.
Dampak Strategis
Clearer decisions
Ini membantu Anda memisahkan klaim teknis yang jelas dari bahasa pemasaran.
Cost and budget
Anda dapat mengajukan pertanyaan implementasi yang lebih baik sebelum mengeluarkan uang atau waktu.
Team and workflow
Tim dengan pemahaman bersama membuat keputusan produk, kebijakan, dan pembelajaran yang lebih baik.
Masa Depan K-Tetangga Terdekat
Ide inti KNN, temukan contoh yang paling mirip, mendukung penelusuran vektor modern dan pembuatan augmented pengambilan, di mana sistem mengambil vektor penyematan terdekat ke model bahasa besar. Perkiraan perpustakaan tetangga terdekat seperti FAISS dan HNSW membuat pencarian kesamaan berskala miliaran menjadi praktis. Meskipun jarang menjadi pengklasifikasi akhir dalam jaringan pipa besar, prinsip tetangga terdekat menjadi lebih relevan dari sebelumnya sebagai tulang punggung pencarian dan rekomendasi semantik.
Implementasi Dunia Nyata
Sistem rekomendasi: menyarankan film atau produk serupa dengan yang disukai pengguna.
Pengenalan digit tulisan tangan: mengklasifikasikan digit dengan membandingkannya dengan gambar berlabel yang paling mirip.
Dukungan diagnosis medis: memprediksi suatu kondisi berdasarkan pasien dengan hasil tes yang paling mirip.
Pencarian semantik: mengambil penyematan teks terdekat untuk menjawab pertanyaan dalam database vektor.
Risiko & Pagar Pembatas
Tim yang berbeda mungkin menggunakan istilah yang sama secara berbeda, jadi tentukan cakupannya sejak dini.
Tolok ukur dapat terlihat kuat sementara kinerja di dunia nyata tidak merata.
Mengabaikan kualitas data dan rencana evaluasi sering kali menimbulkan hasil yang rapuh.
Peta Jalan Implementasi
Mulailah dengan definisi bahasa sederhana tentang hasil yang Anda butuhkan.
Pilih satu metrik keberhasilan dan satu kondisi kegagalan sebelum pengujian.
Jalankan uji coba kecil dengan data yang representatif, bukan kumpulan demo yang disempurnakan.
Dokumentasikan di mana K-Nearest Neighbors membantu dan di mana metode yang lebih sederhana lebih baik.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the K-Nearest Neighbors quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pengklasifikasi Naive Bayes
Pertanyaan yang sering diajukan
What is K-Nearest Neighbors?
K-Nearest Neighbours (KNN) mengklasifikasikan titik data baru dengan melihat contoh K terdekat dan mengambil suara terbanyak. Ini penting sebagai salah satu algoritme paling sederhana dan intuitif dalam pembelajaran mesin, dan hampir tidak memerlukan pelatihan.
Bagaimana cara KNN mengklasifikasikan titik data baru?
KNN menemukan K contoh terdekat yang disimpan dan menetapkan kelas yang paling umum di antara contoh-contoh tersebut (untuk regresi, KNN membuat rata-rata nilainya).
Mengapa KNN disebut 'malas belajar'?
KNN menunda semua pekerjaan ke waktu prediksi; itu hanya menghafal kumpulan data alih-alih membuat model selama pelatihan.
Mengapa penskalaan fitur penting bagi KNN?
Karena KNN bergantung pada jarak, fitur dengan rentang besar yang tidak berskala dapat membuat fitur lain kewalahan, sehingga fitur biasanya dinormalisasi.
Apa yang terjadi jika Anda memilih K yang sangat kecil, seperti K=1?
Huruf K yang kecil memungkinkan tetangga yang berisik atau salah diberi label menentukan hasilnya, sehingga menghasilkan batas yang tidak rata dan terlalu pas.
Apa kelemahan praktis utama KNN?
Karena setiap kueri harus mengukur jarak ke setiap contoh, prediksi bisa menjadi lambat pada kumpulan data besar, sehingga mendorong pohon atau perkiraan percepatan pencarian.