Дисбаланс класів і повторна вибірка
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
Огляд
Resampling rebalances the training data so the model actually learns to spot the minority.
Глибоке занурення
Коли класи спотворені, модель може досягти 99,9% точності, завжди передбачаючи більшість і ніколи не вловлюючи жодного шахрайства, що марно. Повторна вибірка виправляє розподіл навчання двома широкими способами. Передискретизація дублює або синтезує приклади меншості — класична техніка SMOTE (Synthetic Minority Over-sampling Technique) створює нові точки шляхом інтерполяції між вибіркою меншості та її найближчими сусідами меншини, а не копіює їх. Натомість недостатня вибірка відкидає більшість прикладів (випадковим чином або розумно за допомогою таких методів, як Tomek links або NearMiss), щоб вирівняти речі, ціною викидання даних. Альтернативи, які уникають торкання даних, включають зважування класу (більше штрафує помилки меншості у функції втрат) і коригування порогу прийняття рішення після навчання.
Технічне розуміння
Важливе правило: повторюйте вибірку лише навчального набору, ніколи перевіряльного або тестового набору, і завжди повторюйте вибірку всередині згорток перехресної перевірки. Надмірна вибірка перед поділом призводить до витоку майже повторюваних точок у тестовому наборі та завищує оцінки. Оскільки точність тут не має сенсу, оцінювання має спиратися на точність, запам’ятовування, F1, AUC точності запам’ятовування або коефіцієнт кореляції Метьюза — показники, які залишаються чесними, коли позитивний клас є рідкісним.
Стратегічний вплив
Вартість і бюджет
Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.
Чіткіші рішення
Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.
Контроль якості
Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.
Майбутнє дисбалансу класів і повторної вибірки
Повторна вибірка дедалі більше автоматизується в конвеєрах ML, а бібліотеки, такі як imbalanced-learn, інтегруються безпосередньо в перехресну перевірку. Дослідження зміщуються в бік економічного навчання та спеціально розроблених функцій втрат, таких як фокусні втрати, які зменшують вагу простих більшості прикладів, які часто перевершують грубу повторну вибірку в глибоких мережах. Для табличних даних і даних зображень генеративні моделі, які синтезують реалістичні зразки меншості, з’являються як більш досконалий наступник інтерполяції в стилі SMOTE.
Реалізація в реальному світі
Навчання детектору шахрайства з кредитними картками, де справжнє шахрайство становить менше 1% транзакцій, використовуючи SMOTE для збільшення кількості рідкісних випадків шахрайства
Побудова медичної моделі рідкісного захворювання, присутнього лише у кількох відсотків пацієнтів, із застосуванням вагових класів, щоб пропущені випадки суворо каралися
Виявлення дефектних виробів на виробничій лінії, де майже вся продукція проходить перевірку, недобірка «хороших» товарів для збалансованого навчання
Позначення рідкісних мережевих вторгнень у журналах кібербезпеки, де переважає звичайний трафік, оцінюється за допомогою Precision-Recall AUC замість точності
Ризики та огорожі
Оптимізація одного тесту може приховати ширші слабкі сторони системи.
Витрати на інфраструктуру та обслуговування часто недооцінюються.
Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.
Дорожня карта впровадження
Визначте цільові показники затримки, якості та вартості перед впровадженням.
Тест за реалістичних умов навантаження та даних.
Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.
Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Сіамські мережі та триплетні втрати
Часті запитання
What is Class Imbalance and Resampling?
Дисбаланс класу — це коли один результат значно перевищує інший — наприклад, 99,9% законних транзакцій проти 0,1% шахрайства — що змушує моделі ігнорувати рідкісний, але важливий клас. Повторна вибірка балансує навчальні дані, щоб модель фактично навчилася виявляти меншість.
Чому звичайна точність є поганою метрикою для надзвичайно незбалансованої проблеми класифікації?
Якщо 99,9% випадків є негативними, модель, яка завжди передбачає негативний результат, отримує 99,9% точність, уловлюючи нуль позитивних результатів, тому точність приховує повний провал рідкісного класу.
Що робить SMOTE?
SMOTE (метод синтетичної надлишкової дискретизації меншини) створює нові приклади меншості шляхом інтерполяції між точкою меншини та її найближчими сусідами меншини, а не просто їх дублюванням.
Який підхід справляється з дисбалансом БЕЗ зміни кількості навчальних прикладів?
Зважування класу залишає дані недоторканими і натомість змушує функцію втрати штрафувати помилки меншого класу більш серйозно.
У чому полягає основний ризик застосування надмірної вибірки перед розділенням даних на набори тренувань і тестів?
Повторна дискретизація перед поділом дозволяє майже ідентичним точкам меншості з’являтися як у тренувальних, так і в тестових наборах, що призводить до витоку інформації та надто оптимістичних, нереалістичних показників.
Який головний недолік випадкової недостатньої вибірки?
Недостатня вибірка балансує класи, відкидаючи більшість прикладів, що може відкинути інформативні дані та зашкодити здатності моделі вивчати мажоритарний клас.