Дисбаланс классов и повторная выборка
Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.
Обзор
Resampling rebalances the training data so the model actually learns to spot the minority.
Глубокое погружение
Когда классы искажены, модель может достичь точности 99,9%, всегда предсказывая большинство и никогда не выявляя ни одного мошенничества, что бесполезно. Повторная выборка исправляет распределение обучения двумя основными способами. Передискретизация дублирует или синтезирует примеры меньшинства — классический SMOTE (техника чрезмерной выборки синтетического меньшинства) создает новые точки путем интерполяции между образцом меньшинства и его ближайшими соседями меньшинства, а не копируя их. Вместо этого при недостаточной выборке большинство примеров отбрасывается (случайно или разумно с помощью таких методов, как ссылки Tomek или NearMiss), чтобы выровнять ситуацию, за счет выбрасывания данных. Альтернативы, которые позволяют избежать прикосновения к данным, включают взвешивание классов (больше штрафуют за ошибки меньшинства в функции потерь) и корректировку порога принятия решения после обучения.
Техническая информация
Важное правило: повторно производите выборку только обучающего набора, а не проверочного или тестового набора, и всегда производите повторную выборку внутри сгибов перекрестной проверки. Передискретизация перед разделением приводит к утечке почти повторяющихся точек в тестовый набор и завышению оценок. Поскольку точность здесь не имеет смысла, оценка должна основываться на точности, полноте, F1, AUC точности-повторности или коэффициенте корреляции Мэтьюза — показателях, которые остаются честными, когда положительный класс встречается редко.
Стратегическое воздействие
Стоимость и бюджет
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Более четкие решения
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Контроль качества
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Будущее классового дисбаланса и повторной выборки
Повторная выборка все больше автоматизируется внутри конвейеров машинного обучения, а такие библиотеки, как несбалансированное обучение, интегрируются непосредственно в перекрестную проверку. Исследования смещаются в сторону экономичного обучения и адаптированных функций потерь — таких как фокусная потеря, которая снижает вес простых примеров большинства — которые часто превосходят грубую повторную выборку в глубоких сетях. Для табличных и графических данных генеративные модели, синтезирующие реалистичные выборки меньшинства, становятся более сложным преемником интерполяции в стиле SMOTE.
Реальная реализация
Обучение детектора мошенничества с кредитными картами, где фактическое мошенничество составляет менее 1% транзакций, с использованием SMOTE для выявления редких случаев мошенничества.
Построение медицинской модели для редкого заболевания, присутствующего лишь у нескольких процентов пациентов, с применением весовых коэффициентов классов, чтобы пропущенные случаи серьезно наказывались.
Обнаружение дефектных изделий на производственной линии, где почти вся продукция проходит проверку, занижение выборки «хороших» изделий для сбалансированного обучения.
Отметка редких сетевых вторжений в журналах кибербезопасности, в которых преобладает обычный трафик, оцениваемый с помощью AUC Precision-Recall вместо точности.
Риски и ограничения
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Дорожная карта реализации
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Сиамские сети и потеря триплета
Часто задаваемые вопросы
What is Class Imbalance and Resampling?
Классовый дисбаланс — это когда один результат значительно превосходит другой (например, 99,9% законных транзакций против 0,1% мошенничества), что заставляет модели игнорировать редкий, но важный класс. Повторная выборка меняет баланс обучающих данных, поэтому модель фактически учится выявлять меньшинство.
Почему простая точность является плохим показателем для сильно несбалансированной задачи классификации?
Если 99,9% случаев отрицательны, модель, которая всегда предсказывает отрицательный результат, получает точность 99,9%, не обнаруживая при этом ноль положительных результатов, поэтому точность скрывает полный провал в редком классе.
Что делает SMOTE?
SMOTE (метод синтетической избыточной выборки меньшинства) создает новые примеры меньшинства путем интерполяции между точкой меньшинства и ее ближайшими соседями меньшинства, а не просто дублируя их.
Какой подход устраняет дисбаланс БЕЗ изменения количества обучающих примеров?
Взвешивание классов оставляет данные нетронутыми и вместо этого заставляет функцию потерь более строго наказывать ошибки в классе меньшинства.
В чем заключается основной риск применения передискретизации перед разделением данных на обучающие и тестовые наборы?
Повторная выборка перед разделением позволяет практически идентичным точкам меньшинства появляться как в обучающих, так и в тестовых наборах, что приводит к утечке информации и получению чрезмерно оптимистичных и нереалистичных результатов.
Каков основной недостаток случайной недостаточной выборки?
Недостаточная выборка балансирует классы, отбрасывая примеры большинства, что может привести к потере информативных данных и повредить способности модели изучать класс большинства.