اختلال التوازن وإعادة التشكيل
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
نظرة عامة
Resampling rebalances the training data so the model actually learns to spot the minority.
الغوص العميق
عندما تكون الفئات منحرفة، يمكن أن يصل النموذج إلى دقة تصل إلى 99.9٪ من خلال التنبؤ دائمًا بالأغلبية وعدم اكتشاف عملية احتيال واحدة أبدًا، وهو أمر عديم الفائدة. تعمل عملية إعادة التشكيل على إصلاح توزيع التدريب بطريقتين واسعتين. يؤدي الإفراط في أخذ العينات إلى تكرار أو تجميع أمثلة الأقليات - تعمل تقنية SMOTE الكلاسيكية (تقنية الإفراط في أخذ العينات للأقليات الاصطناعية) على إنشاء نقاط جديدة عن طريق الاستيفاء بين عينة الأقلية وأقرب جيرانها من الأقليات بدلاً من نسخهم. بدلاً من ذلك، يتجاهل أسلوب Undersampling أمثلة الأغلبية (عشوائيًا، أو بذكاء عبر طرق مثل روابط Tomek أو NearMiss) لتسوية الأمور، على حساب التخلص من البيانات. تشمل البدائل التي تتجنب لمس البيانات ترجيح الفئة (معاقبة أخطاء الأقلية بشكل أكبر في وظيفة الخسارة) وضبط عتبة القرار بعد التدريب.
البصيرة الفنية
قاعدة مهمة: قم بإعادة تشكيل مجموعة التدريب فقط، وليس مجموعة التحقق أو الاختبار مطلقًا، ودائمًا ما يتم إعادة التشكيل داخل طيات التحقق المتبادل. يؤدي الإفراط في أخذ العينات قبل التقسيم إلى تسريب نقاط شبه مكررة في مجموعة الاختبار وتضخيم النتائج. نظرًا لأن الدقة لا معنى لها هنا، يجب أن يعتمد التقييم على الدقة، أو الاستدعاء، أو F1، أو AUC للاستدعاء الدقيق، أو معامل ارتباط ماثيوز - وهي مقاييس تظل صادقة عندما تكون الفئة الإيجابية نادرة.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل عدم التوازن الطبقي وإعادة التشكيل
تتم إعادة أخذ العينات بشكل آلي بشكل متزايد داخل خطوط تعلم الآلة، مع دمج المكتبات مثل التعلم غير المتوازن مباشرة في التحقق المتبادل. تتحول الأبحاث نحو التعلم الحساس من حيث التكلفة ووظائف الخسارة المصممة خصيصًا - مثل فقدان التركيز، الذي يقلل من وزن أمثلة الأغلبية السهلة - والتي غالبًا ما تتفوق على إعادة التشكيل الأولية على الشبكات العميقة. بالنسبة للبيانات الجدولية وبيانات الصور، تظهر النماذج التوليدية التي تقوم بتجميع عينات أقلية واقعية كخليفة أكثر تطورًا للاستيفاء على نمط SMOTE.
التنفيذ في العالم الحقيقي
تدريب كاشف الاحتيال في بطاقات الائتمان حيث يكون الاحتيال الحقيقي أقل بكثير من 1% من المعاملات، وذلك باستخدام SMOTE لتضخيم حالات الاحتيال النادرة
بناء نموذج طبي لمرض نادر موجود في نسبة قليلة فقط من المرضى، مع تطبيق أوزان الفئات بحيث تتم معاقبة الحالات التي لم يتم تجاهلها بشدة
اكتشاف العناصر المعيبة في خط التصنيع حيث تجتاز جميع المنتجات تقريبًا الفحص، مع أخذ عينات أقل من العناصر "الجيدة" لتحقيق التوازن في التدريب
الإبلاغ عن عمليات اقتحام الشبكة النادرة في سجلات الأمن السيبراني التي تهيمن عليها حركة المرور العادية، ويتم تقييمها باستخدام Precision-Recall AUC بدلاً من الدقة
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
الشبكات السيامية والخسارة الثلاثية
الأسئلة المتداولة
What is Class Imbalance and Resampling?
يحدث اختلال التوازن الطبقي عندما تفوق إحدى النتائج عددًا كبيرًا من النتائج الأخرى - مثل 99.9% من المعاملات المشروعة مقابل 0.1% من الاحتيال - مما يخدع النماذج لتجاهل الفئة النادرة ولكن المهمة. تؤدي إعادة التشكيل إلى إعادة توازن بيانات التدريب بحيث يتعلم النموذج فعليًا اكتشاف الأقلية.
لماذا تعتبر الدقة البسيطة مقياسًا سيئًا لمشكلة التصنيف غير المتوازنة إلى حد كبير؟
إذا كانت 99.9% من الحالات سلبية، فإن النموذج الذي يتنبأ دائمًا بالسلبية يحصل على دقة بنسبة 99.9% بينما يلتقط صفرًا إيجابيًا، وبالتالي فإن الدقة تخفي الفشل التام في الفئة النادرة.
ماذا تفعل SMOTE؟
تعمل تقنية SMOTE (تقنية الإفراط في أخذ العينات للأقليات الاصطناعية) على إنشاء أمثلة جديدة للأقليات من خلال الاستيفاء بين نقطة الأقلية وأقرب جيرانها من الأقليات، بدلاً من تكرارها ببساطة.
ما هو النهج الذي يعالج عدم التوازن دون تغيير عدد أمثلة التدريب؟
يترك ترجيح الفئة البيانات دون تغيير، وبدلاً من ذلك يجعل وظيفة الخسارة تعاقب الأخطاء في فئة الأقلية بشكل أكبر.
ما هو الخطر الرئيسي لتطبيق المعاينة قبل تقسيم بياناتك إلى مجموعات تدريب واختبار؟
تتيح إعادة أخذ العينات قبل الانقسام ظهور نقاط أقلية شبه متطابقة في كل من مجموعات التدريب والاختبار، مما يؤدي إلى تسرب المعلومات وإنتاج أداء مفرط في التفاؤل وغير واقعي.
ما هو الجانب السلبي الرئيسي لأخذ العينات العشوائية؟
يوازن الاختزال بين الفئات عن طريق التخلص من أمثلة الأغلبية، مما قد يؤدي إلى تجاهل البيانات الإعلامية والإضرار بقدرة النموذج على تعلم فئة الأغلبية.