ความไม่สมดุลของคลาสและการสุ่มตัวอย่างใหม่
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
ภาพรวม
Resampling rebalances the training data so the model actually learns to spot the minority.
เจาะลึก
เมื่อคลาสบิดเบี้ยว โมเดลจะมีความแม่นยำถึง 99.9% โดยการคาดการณ์คนส่วนใหญ่เสมอ และไม่เคยตรวจพบการฉ้อโกงแม้แต่ครั้งเดียว ซึ่งไม่มีประโยชน์ การสุ่มตัวอย่างใหม่จะแก้ไขการกระจายการฝึกอบรมในสองวิธีกว้างๆ การสุ่มตัวอย่างมากเกินไป การทำซ้ำหรือสังเคราะห์ตัวอย่างชนกลุ่มน้อย — SMOTE แบบคลาสสิก (เทคนิคการสุ่มตัวอย่างมากเกินไปของชนกลุ่มน้อยสังเคราะห์) จะสร้างจุดใหม่ๆ โดยการประมาณค่าระหว่างตัวอย่างชนกลุ่มน้อยกับเพื่อนบ้านของชนกลุ่มน้อยที่ใกล้ที่สุด แทนที่จะคัดลอกพวกมัน การสุ่มตัวอย่างน้อยเกินไปแทนที่จะละทิ้งตัวอย่างส่วนใหญ่ (แบบสุ่มหรืออย่างชาญฉลาดผ่านวิธีการเช่นลิงก์ Tomek หรือ NearMiss) เพื่อลดขนาดลง โดยแลกกับการสูญเสียข้อมูล ทางเลือกอื่นที่หลีกเลี่ยงการแตะต้องข้อมูล ได้แก่ การถ่วงน้ำหนักของชั้นเรียน (ลงโทษข้อผิดพลาดส่วนน้อยมากขึ้นในฟังก์ชันการสูญเสีย) และการปรับเกณฑ์การตัดสินใจหลังการฝึกอบรม
ข้อมูลเชิงลึกทางเทคนิค
กฎที่สำคัญ: สุ่มตัวอย่างใหม่เฉพาะชุดการฝึก ห้ามใช้การตรวจสอบหรือชุดการทดสอบ และสุ่มตัวอย่างใหม่ภายในพับการตรวจสอบข้ามเสมอ การสุ่มตัวอย่างมากเกินไปก่อนที่จะแยกจุดรั่วจะทำให้จุดที่เกือบจะซ้ำกันลงในชุดทดสอบ และทำให้คะแนนเพิ่มขึ้น เนื่องจากความถูกต้องไม่มีความหมายที่นี่ การประเมินจึงควรอาศัยความแม่นยำ การเรียกคืน F1, Precision-Recall AUC หรือค่าสัมประสิทธิ์สหสัมพันธ์ของ Matthews ซึ่งเป็นตัวชี้วัดที่ยังคงความเที่ยงตรงเมื่อระดับเชิงบวกนั้นหาได้ยาก
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของความไม่สมดุลของคลาสและการสุ่มตัวอย่างใหม่
การสุ่มตัวอย่างซ้ำจะเป็นไปโดยอัตโนมัติมากขึ้นภายในไปป์ไลน์ ML โดยที่ไลบรารี เช่น imbalanced-learn จะผสานรวมเข้ากับการตรวจสอบข้ามโดยตรง การวิจัยกำลังเปลี่ยนไปสู่การเรียนรู้ที่คำนึงถึงต้นทุนและฟังก์ชันการสูญเสียที่ได้รับการปรับแต่ง เช่น การสูญเสียโฟกัส ซึ่งลดน้ำหนักลงในตัวอย่างส่วนใหญ่ที่ง่ายดาย ซึ่งมักจะมีประสิทธิภาพดีกว่าการสุ่มตัวอย่างแบบหยาบบนเครือข่ายระดับลึก สำหรับข้อมูลแบบตารางและรูปภาพ แบบจำลองกำเนิดที่สังเคราะห์ตัวอย่างชนกลุ่มน้อยที่สมจริงกำลังกลายเป็นตัวตายตัวแทนที่ซับซ้อนมากขึ้นในการแก้ไขแบบ SMOTE
การใช้งานจริงในโลกแห่งความเป็นจริง
ฝึกอบรมเครื่องมือตรวจจับการฉ้อโกงบัตรเครดิตที่มีการฉ้อโกงที่แท้จริงน้อยกว่า 1% ของธุรกรรม โดยใช้ SMOTE เพื่อขยายกรณีการฉ้อโกงที่เกิดขึ้นได้ยาก
สร้างแบบจำลองทางการแพทย์สำหรับโรคหายากที่มีผู้ป่วยเพียงไม่กี่เปอร์เซ็นต์ ใช้น้ำหนักชั้นเรียนเพื่อให้กรณีพลาดถูกลงโทษอย่างหนัก
การตรวจจับสินค้าที่มีข้อบกพร่องในสายการผลิตที่ผลิตภัณฑ์เกือบทั้งหมดผ่านการตรวจสอบ โดยสุ่มตัวอย่างสินค้าที่ 'ดี' ต่ำกว่าเพื่อสร้างความสมดุลในการฝึกอบรม
แจ้งการบุกรุกเครือข่ายที่เกิดขึ้นได้ยากในบันทึกความปลอดภัยทางไซเบอร์ที่ถูกครอบงำโดยการรับส่งข้อมูลปกติ ประเมินด้วย Precision-Recall AUC แทนที่จะเป็นความแม่นยำ
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
เครือข่ายสยามและการสูญเสียแฝดสาม
คำถามที่พบบ่อย
What is Class Imbalance and Resampling?
ความไม่สมดุลของคลาสคือเมื่อผลลัพธ์หนึ่งมีจำนวนมากกว่าผลลัพธ์อื่นอย่างมาก เช่น ธุรกรรมที่ถูกต้องตามกฎหมาย 99.9% กับการฉ้อโกง 0.1% ซึ่งหลอกให้โมเดลละเลยคลาสที่หายากแต่สำคัญ การสุ่มตัวอย่างใหม่จะปรับสมดุลข้อมูลการฝึก เพื่อให้โมเดลเรียนรู้ที่จะมองเห็นส่วนน้อยได้จริง
เหตุใดความแม่นยำธรรมดาจึงเป็นตัวชี้วัดที่ไม่ดีสำหรับปัญหาการจำแนกประเภทที่ไม่สมดุลสูง
หากกรณี 99.9% เป็นลบ แบบจำลองที่คาดการณ์เชิงลบเสมอจะได้รับความแม่นยำ 99.9% ในขณะที่ตรวจพบผลบวกเป็นศูนย์ ดังนั้นความแม่นยำจึงซ่อนความล้มเหลวทั้งหมดไว้ในคลาสที่หายาก
SMOT ทำอะไร?
SMOTE (เทคนิคการสุ่มตัวอย่างมากเกินไปของชนกลุ่มน้อยสังเคราะห์) สร้างตัวอย่างชนกลุ่มน้อยใหม่โดยการประมาณค่าระหว่างจุดชนกลุ่มน้อยกับเพื่อนบ้านของชนกลุ่มน้อยที่ใกล้ที่สุด แทนที่จะทำซ้ำพวกมันเพียงอย่างเดียว
วิธีใดจัดการกับความไม่สมดุลโดยไม่ต้องเปลี่ยนจำนวนตัวอย่างการฝึกอบรม
การถ่วงน้ำหนักของชั้นเรียนทำให้ข้อมูลไม่เปลี่ยนแปลง และทำให้ฟังก์ชันการสูญเสียลดความผิดพลาดในคลาสส่วนน้อยลงอย่างมากแทน
อะไรคือความเสี่ยงหลักของการใช้การสุ่มตัวอย่างเกินก่อนที่จะแยกข้อมูลของคุณออกเป็นชุดฝึกและชุดทดสอบ
การสุ่มตัวอย่างใหม่ก่อนการแยกจะทำให้จุดส่วนน้อยที่ใกล้เคียงกันปรากฏขึ้นทั้งในชุดฝึกและชุดทดสอบ ทำให้ข้อมูลรั่วไหล และสร้างประสิทธิภาพในแง่ดีมากเกินไปและไม่สมจริง
ข้อเสียหลักของการสุ่มตัวอย่างน้อยเกินไปคืออะไร
การสุ่มตัวอย่างต่ำเกินไปจะทำให้คลาสต่างๆ สมดุลโดยการละทิ้งตัวอย่างส่วนใหญ่ ซึ่งสามารถละทิ้งข้อมูลที่เป็นประโยชน์ และส่งผลเสียต่อความสามารถของโมเดลในการเรียนรู้คลาสส่วนใหญ่