K-най-близки съседи
K-Nearest Neighbors (KNN) класифицира нова точка от данни, като разглежда K най-близките примери и взема мнозинство от гласовете.
Преглед
It matters as one of the simplest, most intuitive algorithms in machine learning, requiring almost no training.
Дълбоко гмуркане
KNN е „мързелив учащ“: той не извършва истинско обучение и вместо това просто съхранява целия набор от данни. За да класифицира нова точка, измерва разстоянието, обикновено евклидово, до всеки съхранен пример, намира K най-близките съседи и присвоява най-често срещания клас сред тях. За регресия вместо това осреднява стойностите на съседите. Изборът на K е от значение: малкото K е чувствително към шум и може да прекалява, докато голямото K изглажда решенията, но може да размие реалните граници. Тъй като всички функции допринасят за разстоянието, KNN изисква мащабиране на характеристиките, така че променливите с голям обхват да не доминират. Основната му слабост е скоростта на прогнозиране, тъй като всяка заявка се сравнява с целия набор от данни.
Техническа информация
KNN е непараметричен и базиран на екземпляри: той не прави предположения за формата на данните и съхранява примери, вместо да научава тегла. Метриките на разстоянието, евклидови, манхатънски или косинусови, определят „близостта“ и границата на вземане на решения, която формира, може да бъде силно неправилна. Тъй като сравнява всяка заявка с всички точки, простото търсене е бавно, така че библиотеките използват KD-дървета, топкови дървета или приблизителни индекси на най-близките съседи, за да ускорят търсенето в по-ниски измерения.
Стратегическо въздействие
Clearer decisions
Помага ви да отделите ясните технически твърдения от маркетинговия език.
Cost and budget
Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.
Team and workflow
Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.
Бъдещето на K-най-близките съседи
Основната идея на KNN, намиране на най-сходните примери, захранва модерното векторно търсене и генериране с разширено извличане, където системите извличат най-близките вектори за вграждане, за да заземят големи езикови модели. Библиотеките с приблизителни най-близки съседи като FAISS и HNSW правят търсенето на прилики в милиард мащаб практично. Въпреки че рядко е крайният класификатор в големи тръбопроводи, принципът на най-близкия съсед е по-уместен от всякога като гръбнакът на семантичното търсене и препоръки.
Внедряване в реалния свят
Системи за препоръчване: предлагане на филми или продукти, подобни на тези, които потребителят вече е харесал.
Разпознаване на ръкописни цифри: класифициране на цифра чрез сравняването й с най-сходните етикетирани изображения.
Поддръжка на медицинска диагноза: прогнозиране на състояние въз основа на пациенти с най-сходни резултати от теста.
Семантично търсене: извличане на най-близките текстови вграждания, за да се отговори на заявка във векторна база данни.
Рискове и предпазни огради
Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.
Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.
Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.
Пътна карта за изпълнение
Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.
Изберете един показател за успех и едно условие за неуспех преди тестване.
Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.
Документирайте къде K-Nearest Neighbors помага и къде по-простите методи са по-добри.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the K-Nearest Neighbors quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Наивни байесови класификатори
Frequently asked questions
What is K-Nearest Neighbors?
K-Nearest Neighbors (KNN) класифицира нова точка от данни, като разглежда K най-близките примери и взема мнозинство от гласовете. Има значение като един от най-простите, най-интуитивните алгоритми в машинното обучение, който не изисква почти никакво обучение.
Как KNN класифицира нова точка от данни?
KNN намира K най-близките съхранени примери и присвоява най-често срещания клас сред тях (за регресия осреднява техните стойности).
Защо KNN се нарича „мързелив учащ“?
KNN отлага цялата работа за времето за прогнозиране; той просто запомня набора от данни, вместо да изгражда модел по време на обучение.
Защо мащабирането на функции е важно за KNN?
Тъй като KNN разчита на разстоянието, немащабирана функция с голям обхват може да надделее над други, така че характеристиките обикновено се нормализират.
Какво се случва, ако изберете много малко K, като K=1?
Малкото K позволява на единичен шумен или неправилно етикетиран съсед да реши резултата, което води до назъбена граница с прекомерна годност.
Какъв е основният практически недостатък на KNN?
Тъй като всяка заявка трябва да измерва разстоянието до всеки пример, предвиждането може да бъде бавно при големи масиви от данни, което води до ускоряване на търсенето в дърво или приблизително търсене.