Техническо РЪКОВОДСТВО

Класов дисбаланс и повторна семплиране

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

2 min readПоследна актуализация

Преглед

Resampling rebalances the training data so the model actually learns to spot the minority.

Дълбоко гмуркане

Когато класовете са изкривени, моделът може да постигне 99,9% точност, като винаги предвижда мнозинството и никога не хваща нито една измама, което е безполезно. Повторното вземане на проби коригира разпределението на обучението по два основни начина. Свръхсемплирането дублира или синтезира малцинствени примери — класическата SMOTE (синтетична техника за свръхсемплиране на малцинствата) създава нови точки чрез интерполиране между малцинствена извадка и нейните най-близки малцинствени съседи, вместо да ги копира. Недостатъчното вземане на проби вместо това отхвърля повечето примери (на случаен принцип или интелигентно чрез методи като Tomek links или NearMiss), за да изравни нещата, с цената на изхвърляне на данни. Алтернативите, които избягват докосването на данните, включват класово претегляне (наказване на малцинствени грешки в по-голяма степен във функцията за загуба) и коригиране на прага на решение след обучение.

Техническа информация

Критично правило: повторно вземане на проби само от тренировъчния набор, никога от валидиращия или тестовия набор и винаги повторно вземане на проби вътре в гънките за кръстосано валидиране. Свръхсемплирането преди разделянето изпуска почти дублирани точки в тестовия набор и увеличава резултатите. Тъй като точността тук е безсмислена, оценката трябва да разчита на прецизност, припомняне, F1, AUC за прецизно припомняне или коефициент на корелация на Матюс - показатели, които остават честни, когато положителният клас е рядък.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на класовия дисбаланс и повторното вземане на проби

Повторното вземане на проби е все по-автоматизирано в конвейерите на ML, като библиотеки като imbalanced-learn се интегрират директно в кръстосано валидиране. Изследванията се насочват към чувствително към разходите обучение и функции за персонализирани загуби - като фокусна загуба, която намалява теглото на лесните мнозинствени примери - които често превъзхождат грубото повторно семплиране в дълбоки мрежи. За таблични и графични данни генеративните модели, които синтезират реалистични малцинствени проби, се появяват като по-сложен наследник на интерполацията в стил SMOTE.

Внедряване в реалния свят

Обучение на детектор на измами с кредитни карти, където истинската измама е доста под 1% от транзакциите, използвайки SMOTE за увеличаване на редките случаи на измами

Изграждане на медицински модел за рядко заболяване, присъстващо само при няколко процента от пациентите, прилагане на класови тегла, така че пропуснатите случаи да се санкционират тежко

Откриване на дефектни артикули на производствена линия, където почти всички продукти преминават проверка, вземане на по-малки проби от „добрите“ артикули, за да се балансира обучението

Маркиране на редки мрежови прониквания в регистрационни файлове за киберсигурност, доминирани от нормален трафик, оценени с AUC за прецизно извикване вместо с точност

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Сиамски мрежи и триплетна загуба

Frequently asked questions

What is Class Imbalance and Resampling?

Дисбалансът на класа е, когато един резултат значително превъзхожда друг – като 99,9% законни транзакции срещу 0,1% измама – което подвежда моделите да игнорират редкия, но важен клас. Повторното вземане на проби балансира данните за обучение, така че моделът действително да се научи да открива малцинството.

Защо обикновената точност е лоша метрика за силно небалансиран проблем с класификацията?

Ако 99,9% от случаите са отрицателни, модел, който винаги прогнозира отрицателни резултати, получава 99,9% точност, докато улавя нула положителни резултати, така че точността скрива пълния провал на редкия клас.

Какво прави SMOTE?

SMOTE (Synthetic Minority Over-sampling Technique) създава нови малцинствени примери чрез интерполация между малцинствена точка и нейните най-близки малцинствени съседи, вместо просто да ги дублира.

Кой подход се справя с дисбаланса, БЕЗ да променя броя на примерите за обучение?

Претеглянето на класа оставя данните недокоснати и вместо това кара функцията за загуба да санкционира по-сериозно грешките в малцинствения клас.

Какъв е основният риск от прилагане на свръхсемплиране, преди да разделите данните си на обучаващи и тестови набори?

Повторното вземане на проби преди разделянето позволява почти идентични малцинствени точки да се появят както в тренировъчните, така и в тестовите комплекти, изтичайки информация и произвеждайки прекалено оптимистично, нереалистично представяне.

Какъв е основният недостатък на случайното вземане на недостатъчна извадка?

Недостатъчната извадка балансира класовете чрез изхвърляне на мнозинствени примери, което може да отхвърли информативни данни и да навреди на способността на модела да научи мажоритарния клас.