PRŮVODCE Základy

K-Nejbližší sousedé

K-Nearest Neighbors (KNN) klasifikuje nový datový bod tím, že se podívá na K nejbližších příkladů a provede většinové hlasování.

2 minuty čteníNaposledy aktualizováno

Přehled

It matters as one of the simplest, most intuitive algorithms in machine learning, requiring almost no training.

Hluboký ponor

KNN je „líný student“: neprovádí žádné skutečné školení a místo toho pouze ukládá celý soubor dat. Pro klasifikaci nového bodu změří vzdálenost, obvykle euklidovskou, ke každému uloženému příkladu, najde K nejbližších sousedů a přiřadí jim nejběžnější třídu. Pro regresi místo toho zprůměruje hodnoty sousedů. Na volbě K záleží: malé K je citlivé na hluk a může přerůstat, zatímco velké K usnadňuje rozhodování, ale může rozmazávat skutečné hranice. Protože všechny funkce přispívají ke vzdálenosti, KNN požaduje škálování funkcí tak, aby nedominovaly proměnné s velkým dosahem. Jeho hlavní slabinou je rychlost predikce, protože každý dotaz se porovnává s celým souborem dat.

Technický přehled

KNN je neparametrický a založený na instancích: nevytváří žádné předpoklady o tvaru dat a ukládá příklady místo učení vah. Metriky vzdálenosti, euklidovské, manhattanské nebo kosinusové, definují „blízkost“ a hranice rozhodování, které tvoří, může být velmi nepravidelná. Protože porovnává každý dotaz se všemi body, naivní vyhledávání je pomalé, takže knihovny používají KD-stromy, ball-trees nebo přibližné indexy nejbližších sousedů k urychlení vyhledávání v nižších dimenzích.

Strategický dopad

Jasnější rozhodnutí

Pomůže vám oddělit jasná technická tvrzení od marketingového jazyka.

Cena a rozpočet

Než utratíte peníze nebo čas, můžete se zeptat na lepší implementační otázky.

Tým a pracovní postup

Týmy se sdíleným porozuměním dělají lepší rozhodnutí o produktech, zásadách a učení.

Budoucnost K-Nearest Neighbors

Základní myšlenka KNN, najít nejpodobnější příklady, pohání moderní vektorové vyhledávání a generování rozšířené o vyhledávání, kde systémy získávají nejbližší vkládací vektory pro uzemnění velkých jazykových modelů. Přibližné knihovny nejbližších sousedů, jako jsou FAISS a HNSW, umožňují praktické vyhledávání podobnosti v miliardovém měřítku. Princip nejbližšího souseda je sice jen zřídka konečným klasifikátorem ve velkých kanálech, ale jako páteř sémantického vyhledávání a doporučení je důležitější než kdy jindy.

Real-World Implementace

Systémy doporučení: navrhování filmů nebo produktů podobných těm, které se uživateli již líbily.

Rozpoznávání ručně psaných číslic: klasifikace číslic jejím porovnáním s nejpodobnějšími označenými obrázky.

Podpora lékařské diagnózy: předpovídání stavu na základě pacientů s nejpodobnějšími výsledky testů.

Sémantické vyhledávání: získávání nejbližších textových vložení pro zodpovězení dotazu ve vektorové databázi.

Rizika a zábradlí

Různé týmy mohou používat stejný termín odlišně, proto definujte rozsah včas.

Srovnávací testy mohou vypadat dobře, zatímco výkon v reálném světě je nerovnoměrný.

Ignorování kvality dat a plánů hodnocení často vytváří křehké výsledky.

Plán implementace

1

Začněte s jasnou definicí výsledku, který potřebujete.

2

Před testováním vyberte jednu metriku úspěchu a jednu podmínku selhání.

3

Spusťte malý pilotní projekt s reprezentativními údaji, nikoli leštěnou ukázkovou sadu.

4

Dokumentujte, kde K-Nearest Neighbors pomáhá a kde jsou jednodušší metody lepší.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the K-Nearest Neighbors quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Naivní Bayesovy klasifikátory

Často kladené otázky

What is K-Nearest Neighbors?

K-Nearest Neighbors (KNN) klasifikuje nový datový bod tím, že se podívá na K nejbližších příkladů a provede většinové hlasování. Jde o jeden z nejjednodušších a nejintuitivnějších algoritmů ve strojovém učení, který nevyžaduje téměř žádné školení.

Jak KNN klasifikuje nový datový bod?

KNN najde K nejbližších uložených příkladů a přiřadí jim nejběžnější třídu (pro regresi zprůměruje jejich hodnoty).

Proč se KNN nazývá „líný student“?

KNN odkládá veškerou práci na čas předpovědi; jednoduše si zapamatuje datovou sadu namísto vytváření modelu během školení.

Proč je pro KNN důležité škálování funkcí?

Protože KNN spoléhá na vzdálenost, neškálovaná funkce velkého rozsahu může přemoci ostatní, takže funkce jsou obvykle normalizovány.

Co se stane, když zvolíte velmi malé K, například K=1?

Drobné K umožňuje jedinému hlučnému nebo špatně označenému sousedovi rozhodnout o výsledku, což vede k zubaté, přerostlé hranici.

Jaká je hlavní praktická nevýhoda KNN?

Vzhledem k tomu, že každý dotaz musí měřit vzdálenost ke každému příkladu, predikce může být pomalá na velkých souborech dat, což může vést ke zrychlení stromu nebo přibližného vyhledávání.