तकनीकी गाइड

कक्षा असंतुलन और पुन: नमूनाकरण

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

Resampling rebalances the training data so the model actually learns to spot the minority.

गहरा गोता

जब कक्षाएं तिरछी हो जाती हैं, तो एक मॉडल हमेशा बहुमत की भविष्यवाणी करके और एक भी धोखाधड़ी नहीं पकड़ कर 99.9% सटीकता प्राप्त कर सकता है, जो बेकार है। पुन: नमूनाकरण प्रशिक्षण वितरण को दो व्यापक तरीकों से ठीक करता है। ओवरसैंपलिंग अल्पसंख्यक उदाहरणों को डुप्लिकेट या संश्लेषित करता है - क्लासिक एसएमओटीई (सिंथेटिक माइनॉरिटी ओवर-सैंपलिंग तकनीक) अल्पसंख्यक नमूने और उसके निकटतम अल्पसंख्यक पड़ोसियों को कॉपी करने के बजाय उनके बीच अंतरण करके नए बिंदु बनाता है। इसके बजाय डेटा को फेंकने की कीमत पर, अंडरसैंपलिंग अधिकांश उदाहरणों (बेतरतीब ढंग से, या टोमेक लिंक या नियरमिस जैसे तरीकों के माध्यम से स्मार्ट तरीके से) को खारिज कर देती है। डेटा को छूने से बचने वाले विकल्पों में क्लास वेटेज (नुकसान फ़ंक्शन में अल्पसंख्यक त्रुटियों को अधिक दंडित करना) और प्रशिक्षण के बाद निर्णय सीमा को समायोजित करना शामिल है।

तकनीकी अंतर्दृष्टि

एक महत्वपूर्ण नियम: केवल प्रशिक्षण सेट को फिर से नमूना लें, सत्यापन या परीक्षण सेट को कभी नहीं, और हमेशा क्रॉस-सत्यापन फोल्ड के अंदर फिर से नमूना लें। विभाजन से पहले ओवरसैंपलिंग से परीक्षण सेट में लगभग डुप्लिकेट अंक लीक हो जाते हैं और स्कोर बढ़ जाते हैं। क्योंकि यहां सटीकता निरर्थक है, मूल्यांकन को सटीकता, रिकॉल, एफ1, प्रिसिजन-रिकॉल एयूसी, या मैथ्यूज सहसंबंध गुणांक पर निर्भर होना चाहिए - मेट्रिक्स जो सकारात्मक वर्ग दुर्लभ होने पर ईमानदार रहते हैं।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

वर्ग असंतुलन और पुन: नमूनाकरण का भविष्य

एमएल पाइपलाइनों के अंदर पुन: नमूनाकरण तेजी से स्वचालित हो रहा है, असंतुलित-सीखने जैसे पुस्तकालय सीधे क्रॉस-सत्यापन में एकीकृत होते हैं। अनुसंधान लागत-संवेदनशील शिक्षण और अनुरूप हानि कार्यों की ओर बढ़ रहा है - जैसे कि फोकल हानि, जो आसान बहुमत उदाहरणों को कम करता है - जो अक्सर गहरे नेटवर्क पर क्रूड रेज़मैपलिंग से बेहतर प्रदर्शन करते हैं। सारणीबद्ध और छवि डेटा के लिए, यथार्थवादी अल्पसंख्यक नमूनों को संश्लेषित करने वाले जेनरेटिव मॉडल एसएमओटीई-शैली इंटरपोलेशन के अधिक परिष्कृत उत्तराधिकारी के रूप में उभर रहे हैं।

वास्तविक विश्व कार्यान्वयन

क्रेडिट-कार्ड धोखाधड़ी डिटेक्टर का प्रशिक्षण जहां वास्तविक धोखाधड़ी 1% से भी कम लेनदेन में होती है, दुर्लभ धोखाधड़ी के मामलों को बढ़ाने के लिए SMOTE का उपयोग किया जाता है

केवल कुछ प्रतिशत रोगियों में मौजूद एक दुर्लभ बीमारी के लिए एक चिकित्सा मॉडल बनाना, वर्ग भार लागू करना ताकि छूटे हुए मामलों पर भारी जुर्माना लगाया जा सके

विनिर्माण लाइन पर दोषपूर्ण वस्तुओं का पता लगाना जहां लगभग सभी उत्पाद निरीक्षण पास करते हैं, प्रशिक्षण को संतुलित करने के लिए 'अच्छी' वस्तुओं का कम नमूना लेना

सामान्य ट्रैफ़िक के प्रभुत्व वाले साइबर सुरक्षा लॉग में दुर्लभ नेटवर्क घुसपैठ को चिह्नित करना, सटीकता के बजाय प्रिसिजन-रिकॉल एयूसी के साथ मूल्यांकन किया गया

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

स्याम देश नेटवर्क और ट्रिपल लॉस

अक्सर पूछे जाने वाले प्रश्नों

What is Class Imbalance and Resampling?

वर्ग असंतुलन तब होता है जब एक परिणाम की संख्या दूसरे से बहुत अधिक हो जाती है - जैसे 99.9% वैध लेनदेन बनाम 0.1% धोखाधड़ी - जो मॉडलों को दुर्लभ लेकिन महत्वपूर्ण वर्ग की अनदेखी करने के लिए प्रेरित करता है। पुन: नमूनाकरण प्रशिक्षण डेटा को पुनर्संतुलित करता है ताकि मॉडल वास्तव में अल्पसंख्यक को पहचानना सीख सके।

अत्यधिक असंतुलित वर्गीकरण समस्या के लिए सामान्य सटीकता एक खराब मीट्रिक क्यों है?

यदि 99.9% मामले नकारात्मक हैं, तो एक मॉडल जो हमेशा नकारात्मक की भविष्यवाणी करता है उसे शून्य सकारात्मकता को पकड़ते हुए 99.9% सटीकता मिलती है, इसलिए सटीकता दुर्लभ वर्ग पर कुल विफलता को छुपाती है।

SMOTE क्या करता है?

एसएमओटीई (सिंथेटिक माइनॉरिटी ओवर-सैंपलिंग तकनीक) किसी अल्पसंख्यक बिंदु और उसके निकटतम अल्पसंख्यक पड़ोसियों की केवल नकल करने के बजाय उनके बीच अंतरण करके नए अल्पसंख्यक उदाहरण बनाता है।

कौन सा दृष्टिकोण प्रशिक्षण उदाहरणों की संख्या को बदले बिना असंतुलन को संभालता है?

वर्ग भारांकन डेटा को अछूता छोड़ देता है और इसके बजाय हानि फ़ंक्शन अल्पसंख्यक वर्ग पर त्रुटियों को अधिक भारी रूप से दंडित करता है।

अपने डेटा को ट्रेन और परीक्षण सेट में विभाजित करने से पहले ओवरसैंपलिंग लागू करने का मुख्य जोखिम क्या है?

विभाजन से पहले पुन: नमूनाकरण से ट्रेन और परीक्षण सेट दोनों में लगभग समान अल्पसंख्यक बिंदु दिखाई देते हैं, जानकारी लीक हो जाती है और अत्यधिक आशावादी, अवास्तविक प्रदर्शन उत्पन्न होता है।

रैंडम अंडरसैंपलिंग का मुख्य नकारात्मक पक्ष क्या है?

अंडरसैंपलिंग बहुसंख्यक उदाहरणों को हटाकर कक्षाओं को संतुलित करती है, जो सूचनात्मक डेटा को त्याग सकती है और बहुसंख्यक वर्ग को सीखने की मॉडल की क्षमता को नुकसान पहुंचा सकती है।