ΟΔΗΓΟΣ Βασικών Αρχών

Κ-Κοντινότεροι Γείτονες

Το K-Nearest Neighbors (KNN) ταξινομεί ένα νέο σημείο δεδομένων εξετάζοντας τα K πλησιέστερα παραδείγματα και λαμβάνοντας πλειοψηφία.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It matters as one of the simplest, most intuitive algorithms in machine learning, requiring almost no training.

Βαθιά κατάδυση

Το KNN είναι ένας «τεμπέλης μαθητής»: δεν εκπαιδεύει πραγματικά και απλώς αποθηκεύει ολόκληρο το σύνολο δεδομένων. Για να ταξινομήσει ένα νέο σημείο, μετρά την απόσταση, συνήθως Ευκλείδεια, σε κάθε αποθηκευμένο παράδειγμα, βρίσκει τους K πλησιέστερους γείτονες και εκχωρεί την πιο κοινή τάξη μεταξύ τους. Για παλινδρόμηση, υπολογίζει τον μέσο όρο των τιμών των γειτόνων. Η επιλογή του K έχει σημασία: ένα μικρό K είναι ευαίσθητο στο θόρυβο και μπορεί να ταιριάζει υπερβολικά, ενώ ένα μεγάλο K εξομαλύνει τις αποφάσεις αλλά μπορεί να θολώσει τα πραγματικά όρια. Επειδή όλα τα χαρακτηριστικά συμβάλλουν στην απόσταση, το KNN απαιτεί κλιμάκωση χαρακτηριστικών έτσι ώστε οι μεταβλητές μεγάλου εύρους να μην κυριαρχούν. Η κύρια αδυναμία του είναι η ταχύτητα πρόβλεψης, καθώς κάθε ερώτημα συγκρίνεται με ολόκληρο το σύνολο δεδομένων.

Τεχνική διορατικότητα

Το KNN δεν είναι παραμετρικό και βασίζεται σε στιγμιότυπα: δεν κάνει καμία υπόθεση σχετικά με το σχήμα των δεδομένων και αποθηκεύει παραδείγματα αντί να μαθαίνει βάρη. Οι μετρήσεις απόστασης, Ευκλείδειος, Μανχάταν ή συνημίτονο, ορίζουν την «εγγύτητα» και το όριο απόφασης που σχηματίζει μπορεί να είναι πολύ ακανόνιστο. Επειδή συγκρίνει κάθε ερώτημα με όλα τα σημεία, η απλή αναζήτηση είναι αργή, επομένως οι βιβλιοθήκες χρησιμοποιούν δέντρα KD, σφαιρικά δέντρα ή κατά προσέγγιση ευρετήρια πλησιέστερου γείτονα για να επιταχύνουν την αναζήτηση σε χαμηλότερες διαστάσεις.

Στρατηγικός αντίκτυπος

Σαφέστερες αποφάσεις

Σας βοηθά να διαχωρίσετε σαφείς τεχνικούς ισχυρισμούς από τη γλώσσα μάρκετινγκ.

Κόστος και προϋπολογισμός

Μπορείτε να κάνετε καλύτερες ερωτήσεις εφαρμογής προτού ξοδέψετε χρήματα ή χρόνο.

Ομάδα και ροή εργασίας

Οι ομάδες με κοινή κατανόηση λαμβάνουν καλύτερες αποφάσεις για προϊόντα, πολιτικές και μάθηση.

The Future of K-Nearest Neighbors

Η βασική ιδέα του KNN, η εύρεση των πιο όμοιων παραδειγμάτων, εξουσιοδοτεί τη σύγχρονη διανυσματική αναζήτηση και τη δημιουργία επαυξημένης ανάκτησης, όπου τα συστήματα φέρνουν τα πλησιέστερα ενσωματωμένα διανύσματα για να γειώσουν μεγάλα γλωσσικά μοντέλα. Οι κατά προσέγγιση βιβλιοθήκες του πλησιέστερου γείτονα, όπως η FAISS και η HNSW, κάνουν πρακτική αναζήτηση ομοιότητας δισεκατομμυρίων. Αν και σπάνια είναι ο τελικός ταξινομητής σε μεγάλους αγωγούς, η αρχή του πλησιέστερου γείτονα είναι πιο σχετική από ποτέ ως η ραχοκοκαλιά της σημασιολογικής αναζήτησης και σύστασης.

Υλοποίηση σε πραγματικό κόσμο

Συστήματα συστάσεων: προτείνοντας ταινίες ή προϊόντα παρόμοια με αυτά που άρεσαν ήδη ένας χρήστης.

Χειρόγραφη αναγνώριση ψηφίων: ταξινόμηση ενός ψηφίου συγκρίνοντάς το με τις πιο παρόμοιες εικόνες με ετικέτα.

Υποστήριξη ιατρικής διάγνωσης: πρόβλεψη μιας κατάστασης με βάση ασθενείς με τα πιο παρόμοια αποτελέσματα εξετάσεων.

Σημασιολογική αναζήτηση: ανάκτηση των πλησιέστερων ενσωματώσεων κειμένου για απάντηση σε ένα ερώτημα σε μια διανυσματική βάση δεδομένων.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Διαφορετικές ομάδες μπορεί να χρησιμοποιούν τον ίδιο όρο με διαφορετικό τρόπο, επομένως ορίστε το πεδίο εφαρμογής νωρίς.

Τα σημεία αναφοράς μπορεί να φαίνονται ισχυρά ενώ η απόδοση στον πραγματικό κόσμο είναι άνιση.

Η αγνόηση της ποιότητας των δεδομένων και των σχεδίων αξιολόγησης δημιουργεί συχνά εύθραυστα αποτελέσματα.

Οδικός Χάρτης Εφαρμογής

1

Ξεκινήστε με έναν ορισμό σε απλή γλώσσα του αποτελέσματος που χρειάζεστε.

2

Επιλέξτε μία μέτρηση επιτυχίας και μία συνθήκη αποτυχίας πριν από τη δοκιμή.

3

Εκτελέστε ένα μικρό πιλότο με αντιπροσωπευτικά δεδομένα, όχι ένα εκλεπτυσμένο σετ επίδειξης.

4

Τεκμηριώστε πού βοηθά το K-Nearest Neighbors και πού είναι καλύτερες οι απλούστερες μέθοδοι.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the K-Nearest Neighbors quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

What is K-Nearest Neighbors?

Το K-Nearest Neighbors (KNN) ταξινομεί ένα νέο σημείο δεδομένων εξετάζοντας τα K πλησιέστερα παραδείγματα και λαμβάνοντας πλειοψηφία. Σημασία έχει ως ένας από τους απλούστερους, πιο διαισθητικούς αλγόριθμους στη μηχανική εκμάθηση, που δεν απαιτεί σχεδόν καμία εκπαίδευση.

Πώς ταξινομεί το KNN ένα νέο σημείο δεδομένων;

Το KNN βρίσκει τα K πλησιέστερα αποθηκευμένα παραδείγματα και εκχωρεί την πιο κοινή κατηγορία μεταξύ τους (για παλινδρόμηση, υπολογίζει τον μέσο όρο των τιμών τους).

Γιατί το KNN αποκαλείται «τεμπέλης μαθητής»;

Το KNN αναβάλλει όλες τις εργασίες σε χρόνο πρόβλεψης. Απλώς απομνημονεύει το σύνολο δεδομένων αντί να δημιουργεί ένα μοντέλο κατά τη διάρκεια της εκπαίδευσης.

Γιατί είναι σημαντική η κλίμακα χαρακτηριστικών για το KNN;

Επειδή το KNN βασίζεται στην απόσταση, ένα μη κλιμακούμενο χαρακτηριστικό μεγάλου εύρους μπορεί να κατακλύσει άλλα, επομένως τα χαρακτηριστικά συνήθως κανονικοποιούνται.

Τι θα συμβεί αν επιλέξετε ένα πολύ μικρό Κ, όπως το K=1;

Ένα μικροσκοπικό K επιτρέπει σε έναν μόνο θορυβώδες ή εσφαλμένο γείτονα να αποφασίσει το αποτέλεσμα, οδηγώντας σε ένα οδοντωτό, υπερβολικό όριο.

Ποιο είναι το κύριο πρακτικό μειονέκτημα του KNN;

Δεδομένου ότι κάθε ερώτημα πρέπει να μετράει την απόσταση από κάθε παράδειγμα, η πρόβλεψη μπορεί να είναι αργή σε μεγάλα σύνολα δεδομένων, προκαλώντας επιτάχυνση σε δέντρο ή κατά προσέγγιση επιτάχυνση αναζήτησης.