การจัดกลุ่ม K-Means
K-Means เป็นอัลกอริธึมที่ไม่ได้รับการดูแลซึ่งจะจัดเรียงข้อมูลออกเป็นกลุ่ม K โดยอัตโนมัติโดยการค้นหาศูนย์คลัสเตอร์
ภาพรวม
It matters because it reveals hidden structure in unlabeled data, from customer segments to image colors.
เจาะลึก
K-Means แบ่งพาร์ติชันข้อมูลออกเป็นคลัสเตอร์ตามจำนวนที่เลือก K โดยไม่มีป้ายกำกับใดๆ เริ่มต้นด้วยการวางจุด K ที่เรียกว่าเซนทรอยด์ ซึ่งมักจะเป็นการสุ่ม จากนั้นจะทำซ้ำสองขั้นตอน: กำหนดจุดข้อมูลทุกจุดให้กับเซนทรอยด์ที่ใกล้ที่สุด และย้ายแต่ละเซนทรอยด์ไปยังตำแหน่งเฉลี่ยของจุดที่กำหนด ขั้นตอนเหล่านี้จะวนซ้ำจนกว่าการมอบหมายงานจะหยุดเปลี่ยนแปลง ซึ่งหมายความว่าอัลกอริทึมได้บรรจบกัน เป้าหมายคือการลดความแปรปรวนภายในคลัสเตอร์ให้เหลือน้อยที่สุด ซึ่งก็คือระยะห่างกำลังสองทั้งหมดระหว่างจุดและเซนทรอยด์ เนื่องจากผลลัพธ์ขึ้นอยู่กับตำแหน่งเริ่มต้น การเริ่มต้นอย่างชาญฉลาด เช่น K-Means++ จะกระจายเซนทรอยด์เริ่มต้นออกจากกัน คุณต้องเลือก K ล่วงหน้า ซึ่งมักจะแนะนำโดย 'วิธีข้อศอก' บนเส้นโค้งค่าคลาดเคลื่อน
ข้อมูลเชิงลึกทางเทคนิค
K-Means ช่วยลดความเฉื่อย ซึ่งเป็นผลรวมของระยะทางยกกำลังสองจากแต่ละจุดไปยังจุดเซนทรอยด์ที่กำหนด ลูปมอบหมายแล้วอัปเดตเป็นขั้นตอนรูปแบบการคาดหวังสูงสุดที่จะลดแรงเฉื่อยลงเสมอ รับประกันการบรรจบกันที่ระดับต่ำสุดในท้องถิ่น แม้ว่าจะไม่จำเป็นต้องเป็นระดับโลกที่ดีที่สุดก็ตาม โดยถือว่ากระจุกดาวมีลักษณะเป็นทรงกลมโดยประมาณและมีขนาดใกล้เคียงกัน เนื่องจากต้องใช้ระยะทางแบบยุคลิด ดังนั้นกลุ่มที่ยาวหรือมีขนาดไม่เท่ากันจึงสามารถหลอกได้
ผลกระทบเชิงกลยุทธ์
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้
ต้นทุนและงบประมาณ
คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา
ทีมงานและขั้นตอนการทำงาน
ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น
อนาคตของการจัดกลุ่ม K-Means
K-Means ยังคงเป็นม้าทำงานเพราะมันรวดเร็วและปรับขนาดเป็นชุดข้อมูลขนาดใหญ่ผ่านเวอร์ชันมินิแบทช์ที่อัปเดตเซนทรอยด์ในตัวอย่างขนาดเล็ก การวิจัยยังคงดำเนินต่อไปเกี่ยวกับการเลือก K อัตโนมัติ การเริ่มต้นอย่างชาญฉลาดยิ่งขึ้น และเคอร์เนลหรือตัวแปรการเรียนรู้เชิงลึกที่จัดการกับคลัสเตอร์ที่ไม่ใช่ทรงกลม มีการใช้มากขึ้นเป็นขั้นตอนก่อนการประมวลผล บีบอัดข้อมูลหรือสร้างคุณสมบัติก่อนที่จะป้อนโมเดลที่ซับซ้อนมากขึ้น และภายในฐานข้อมูลเวกเตอร์เพื่อเพิ่มความเร็วในการค้นหาความคล้ายคลึงกันในการฝัง
การใช้งานจริงในโลกแห่งความเป็นจริง
การแบ่งส่วนลูกค้า: การจัดกลุ่มผู้ซื้อตามการใช้จ่ายและความถี่ในการเยี่ยมชมเพื่อกำหนดเป้าหมายแคมเปญการตลาด
การบีบอัดสีของภาพ: ลดสีนับล้านพิกเซลเป็นเฉดสีตัวแทน K เพื่อลดขนาดไฟล์
การจัดระเบียบเอกสาร: การจัดกลุ่มบทความข่าวหรือตั๋วสนับสนุนตามหัวข้อโดยไม่มีหมวดหมู่ที่กำหนดไว้ล่วงหน้า
การตรวจจับความผิดปกติ: ทำเครื่องหมายจุดที่อยู่ห่างจากศูนย์กลางคลัสเตอร์ใดๆ เนื่องจากการฉ้อโกงที่อาจเกิดขึ้นหรือข้อผิดพลาดของเซ็นเซอร์
ความเสี่ยงและรั้ว
แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ
เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน
การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง
แผนงานการดำเนินงาน
เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ
เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ
ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม
เอกสารที่ซึ่งการจัดกลุ่ม K-Means ช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the K-Means Clustering quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การประเมินคะแนนความคิดเห็นเฉลี่ย
คำถามที่พบบ่อย
What is K-Means Clustering?
K-Means เป็นอัลกอริธึมที่ไม่ได้รับการดูแลซึ่งจะจัดเรียงข้อมูลออกเป็นกลุ่ม K โดยอัตโนมัติโดยการค้นหาศูนย์คลัสเตอร์ สิ่งสำคัญเนื่องจากเผยให้เห็นโครงสร้างที่ซ่อนอยู่ในข้อมูลที่ไม่มีป้ายกำกับ ตั้งแต่กลุ่มลูกค้าไปจนถึงสีของภาพ
'K' ใน K-Means หมายถึงอะไร?
K คือจำนวนคลัสเตอร์ที่ผู้ใช้ระบุก่อนรันอัลกอริทึม วิธีการก็พบว่ามีเซนทรอยด์จำนวนมาก
ขั้นตอนการทำซ้ำสองขั้นตอนในลูป K-Means คืออะไร?
K-Means สลับระหว่างการกำหนดแต่ละจุดให้กับเซนทรอยด์ที่ใกล้ที่สุด และคำนวณใหม่แต่ละเซนทรอยด์เป็นค่าเฉลี่ยของคะแนนที่กำหนด
K-Means พยายามลดปริมาณเท่าใด
K-Means ช่วยลดความเฉื่อย ซึ่งเป็นระยะห่างกำลังสองทั้งหมดระหว่างจุดและเซนทรอยด์ที่ได้รับมอบหมาย ทำให้กระจุกแน่น
เหตุใด K-Means จึงถูกเรียกว่าอัลกอริธึม 'unsupervised'
ไม่ได้รับการดูแลหมายความว่าข้อมูลไม่มีป้ายกำกับ K-Means ค้นหาโครงสร้างด้วยตัวเองโดยไม่ต้องบอกกลุ่มที่ถูกต้อง
'วิธีข้อศอก' มักใช้เพื่ออะไร?
วิธีข้อศอกจะพล็อตข้อผิดพลาดเทียบกับ K และมองหาส่วนโค้งที่การเพิ่มกลุ่มมากขึ้นจะหยุดช่วยได้มาก