K-เพื่อนบ้านที่ใกล้ที่สุด
K-Nearest Neighbors (KNN) จัดประเภทจุดข้อมูลใหม่โดยดูจากตัวอย่าง K ที่ใกล้เคียงที่สุดและรับคะแนนเสียงข้างมาก
ภาพรวม
It matters as one of the simplest, most intuitive algorithms in machine learning, requiring almost no training.
เจาะลึก
KNN เป็น 'ผู้เรียนที่ขี้เกียจ': ไม่มีการฝึกฝนจริง ๆ และจะจัดเก็บชุดข้อมูลทั้งหมดแทน ในการจำแนกจุดใหม่ มันจะวัดระยะทาง (โดยปกติคือแบบยุคลิด) ให้กับทุกตัวอย่างที่เก็บไว้ ค้นหา K เพื่อนบ้านที่ใกล้ที่สุด และกำหนดคลาสที่พบมากที่สุดในหมู่พวกมัน สำหรับการถดถอย จะเฉลี่ยค่าของเพื่อนบ้านแทน การเลือก K มีความสำคัญ: K ตัวเล็กไวต่อเสียงรบกวนและสามารถใส่ได้พอดี ในขณะที่ K ตัวใหญ่ช่วยให้การตัดสินใจราบรื่น แต่อาจทำให้ขอบเขตที่แท้จริงเบลอ เนื่องจากคุณลักษณะทั้งหมดมีส่วนทำให้เกิดระยะทาง KNN จึงต้องการการปรับขนาดคุณลักษณะเพื่อไม่ให้ตัวแปรช่วงใหญ่ครอบงำ จุดอ่อนหลักคือความเร็วในการคาดการณ์ เนื่องจากแต่ละแบบสอบถามจะเปรียบเทียบกับชุดข้อมูลทั้งหมด
ข้อมูลเชิงลึกทางเทคนิค
KNN ไม่ใช่พารามิเตอร์และอิงตามอินสแตนซ์: ไม่มีการคาดเดาเกี่ยวกับรูปร่างของข้อมูลและจัดเก็บตัวอย่างแทนที่จะเรียนรู้น้ำหนัก ตัวชี้วัดระยะทางแบบยุคลิด แมนฮัตตัน หรือโคไซน์ กำหนด 'ความใกล้ชิด' และขอบเขตการตัดสินใจที่เกิดขึ้นอาจมีความไม่สม่ำเสมออย่างมาก เนื่องจากจะเปรียบเทียบแต่ละข้อความค้นหากับทุกจุด การค้นหาแบบไร้เดียงสาจึงช้า ดังนั้นห้องสมุดจึงใช้ KD-trees, Ball-trees หรือดัชนีเพื่อนบ้านที่ใกล้ที่สุดโดยประมาณเพื่อเพิ่มความเร็วในการค้นหาในมิติที่ต่ำกว่า
ผลกระทบเชิงกลยุทธ์
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้
ต้นทุนและงบประมาณ
คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา
ทีมงานและขั้นตอนการทำงาน
ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น
อนาคตของ K-เพื่อนบ้านที่ใกล้ที่สุด
แนวคิดหลักของ KNN ในการค้นหาตัวอย่างที่คล้ายกันมากที่สุด ขับเคลื่อนการค้นหาเวกเตอร์สมัยใหม่และการสร้างการดึงข้อมูลแบบเสริม โดยที่ระบบจะดึงเวกเตอร์ที่ฝังไว้ที่ใกล้ที่สุดมาสู่โมเดลภาษาขนาดใหญ่ ห้องสมุดใกล้เคียงที่ใกล้ที่สุดอย่าง FAISS และ HNSW ทำให้การค้นหาความคล้ายคลึงกันนับพันล้านทำได้จริง แม้ว่าจะไม่ค่อยเป็นตัวแยกประเภทขั้นสุดท้ายในไปป์ไลน์ขนาดใหญ่ แต่หลักการเพื่อนบ้านที่ใกล้ที่สุดมีความเกี่ยวข้องมากกว่าที่เคยในฐานะกระดูกสันหลังของการค้นหาเชิงความหมายและการแนะนำ
การใช้งานจริงในโลกแห่งความเป็นจริง
ระบบแนะนำ: แนะนำภาพยนตร์หรือผลิตภัณฑ์ที่คล้ายกับที่ผู้ใช้ชื่นชอบอยู่แล้ว
การจดจำตัวเลขที่เขียนด้วยลายมือ: การจำแนกตัวเลขโดยการเปรียบเทียบกับรูปภาพที่มีป้ายกำกับคล้ายกันมากที่สุด
การสนับสนุนการวินิจฉัยทางการแพทย์: การทำนายสภาวะโดยอิงจากผู้ป่วยที่มีผลการทดสอบใกล้เคียงกันมากที่สุด
การค้นหาความหมาย: ดึงข้อความที่ฝังไว้ที่ใกล้ที่สุดเพื่อตอบแบบสอบถามในฐานข้อมูลเวกเตอร์
ความเสี่ยงและรั้ว
แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ
เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน
การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง
แผนงานการดำเนินงาน
เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ
เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ
ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม
เอกสารที่ K-Nearest Neighbours ให้ความช่วยเหลือ และวิธีที่ง่ายกว่าจะดีกว่า
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the K-Nearest Neighbors quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ตัวแยกประเภท Naive Bayes
คำถามที่พบบ่อย
What is K-Nearest Neighbors?
K-Nearest Neighbors (KNN) จัดประเภทจุดข้อมูลใหม่โดยดูจากตัวอย่าง K ที่ใกล้เคียงที่สุดและรับคะแนนเสียงข้างมาก สิ่งสำคัญคือเป็นหนึ่งในอัลกอริธึมที่ง่ายที่สุดและใช้งานง่ายที่สุดในการเรียนรู้ของเครื่อง โดยแทบไม่ต้องมีการฝึกอบรมเลย
KNN จำแนกจุดข้อมูลใหม่อย่างไร
KNN ค้นหาตัวอย่าง K ที่เก็บไว้ที่ใกล้ที่สุดและกำหนดคลาสที่พบบ่อยที่สุด (สำหรับการถดถอย จะเป็นการหาค่าเฉลี่ยของค่าเหล่านั้น)
ทำไม KNN ถึงถูกเรียกว่า 'ผู้เรียนขี้เกียจ'
KNN เลื่อนการทำงานทั้งหมดออกไปเป็นเวลาคาดการณ์ เพียงจดจำชุดข้อมูลแทนที่จะสร้างแบบจำลองระหว่างการฝึกอบรม
เหตุใดการปรับขนาดคุณสมบัติจึงมีความสำคัญสำหรับ KNN
เนื่องจาก KNN อาศัยระยะทาง คุณสมบัติช่วงกว้างที่ไม่ได้ปรับขนาดจึงสามารถครอบงำคุณสมบัติอื่นๆ ได้ ดังนั้นคุณสมบัติต่างๆ มักจะถูกทำให้เป็นมาตรฐาน
จะเกิดอะไรขึ้นหากคุณเลือก K ที่น้อยมาก เช่น K=1
K ตัวเล็ก ๆ ปล่อยให้เพื่อนบ้านที่มีเสียงดังหรือติดป้ายกำกับไม่ถูกต้องตัดสินใจผลลัพธ์ ซึ่งนำไปสู่ขอบเขตที่ขรุขระและพอดีเกินไป
ข้อเสียเปรียบหลักในทางปฏิบัติของ KNN คืออะไร?
เนื่องจากการสืบค้นแต่ละครั้งจะต้องวัดระยะทางจากทุกตัวอย่าง การคาดการณ์อาจช้าในชุดข้อมูลขนาดใหญ่ แจ้งแผนผังหรือเร่งความเร็วการค้นหาโดยประมาณ