클래스 불균형 및 리샘플링
클래스 불균형은 하나의 결과가 다른 결과보다 훨씬 많은 경우입니다(예: 99.9%의 합법적인 거래 대 0.1%의 사기). 이는 모델이 드물지만 중요한 클래스를 무시하도록 속입니다.
개요
리샘플링은 훈련 데이터의 균형을 재조정하여 모델이 실제로 소수를 찾는 방법을 학습하도록 합니다.
심층 분석
클래스가 왜곡되면 모델은 항상 대다수를 예측하고 단 한 건의 사기도 포착하지 못하므로 모델의 정확도는 99.9%에 도달할 수 있습니다. 리샘플링은 두 가지 광범위한 방법으로 훈련 분포를 수정합니다. 오버샘플링은 소수 샘플을 복제하거나 합성합니다. 고전적인 SMOTE(Synthetic Minority Over-sampling Technique)는 소수 샘플과 가장 가까운 소수 이웃을 복사하는 대신 보간하여 새로운 포인트를 생성합니다. 대신 과소샘플링은 데이터를 버리는 대가로 대부분의 예제를 (무작위로 또는 Tomek 링크나 NearMiss와 같은 방법을 통해 스마트하게) 폐기하여 균등하게 만듭니다. 데이터를 건드리지 않는 대안에는 클래스 가중치 부여(손실 함수에서 소수 오류에 더 많은 처벌을 가함) 및 훈련 후 결정 임계값 조정이 포함됩니다.
기술적 통찰력
중요한 규칙: 훈련 세트만 리샘플링하고 검증 세트나 테스트 세트는 절대 리샘플링하지 말고 항상 교차 검증 접기 내부에서 리샘플링하십시오. 분할 전 오버샘플링으로 인해 거의 중복된 포인트가 테스트 세트로 유출되고 점수가 부풀려집니다. 여기서 정확도는 의미가 없기 때문에 평가는 정밀도, 재현율, F1, Precision-Recall AUC 또는 Matthews 상관 계수(양성 클래스가 드물 때 정직하게 유지되는 측정항목)에 의존해야 합니다.
전략적 영향
비용 및 예산
아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.
더 명확한 결정들
기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.
품질 관리
더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.
클래스 불균형과 리샘플링의 미래
불균형 학습과 같은 라이브러리가 교차 검증에 직접 통합되면서 ML 파이프라인 내에서 리샘플링이 점점 더 자동화되고 있습니다. 연구는 비용에 민감한 학습과 맞춤형 손실 기능(예: 쉬운 다수의 사례에 대한 가중치를 낮추는 초점 손실)으로 전환되고 있으며, 딥 네트워크에서 조잡한 리샘플링보다 성능이 뛰어난 경우가 많습니다. 표 형식 및 이미지 데이터의 경우 실제 소수 샘플을 합성하는 생성 모델이 SMOTE 스타일 보간법의 보다 정교한 후속 모델로 떠오르고 있습니다.
실제 구현
드문 사기 사례를 증폭시키기 위해 SMOTE를 사용하여 실제 사기가 거래의 1% 미만인 신용 카드 사기 탐지기 교육
소수의 환자에게만 존재하는 희귀 질환에 대한 의료 모델을 구축하고 클래스 가중치를 적용하여 놓친 사례에 큰 처벌을 적용합니다.
거의 모든 제품이 검사를 통과하는 제조 라인에서 결함 품목을 감지하고 '양호' 품목을 과소 샘플링하여 훈련 균형 유지
정확성 대신 Precision-Recall AUC로 평가하여 일반 트래픽이 지배하는 사이버 보안 로그에서 드문 네트워크 침입을 표시합니다.
위험 및 가드레일
하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.
인프라 및 유지 관리 비용은 종종 과소평가됩니다.
시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.
구현 로드맵
구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.
현실적인 로드 및 데이터 조건에서 벤치마킹합니다.
오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.
확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Class Imbalance and Resampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
샴 네트워크와 삼중항 손실
자주 묻는 질문
클래스 불균형 및 리샘플링이란 무엇입니까?
클래스 불균형은 하나의 결과가 다른 결과보다 훨씬 더 많은 경우입니다(예: 99.9%의 합법적인 거래 대 0.1%의 사기). 이는 모델이 드물지만 중요한 클래스를 무시하도록 속입니다. 리샘플링은 훈련 데이터의 균형을 재조정하여 모델이 실제로 소수를 찾는 방법을 학습하도록 합니다.
불균형이 심한 분류 문제에 대해 일반 정확도가 불량한 측정 기준인 이유는 무엇입니까?
99.9%의 사례가 음성인 경우 항상 부정을 예측하는 모델은 0의 양성을 포착하면서 99.9%의 정확도를 얻습니다. 따라서 정확도는 희귀 클래스의 전체 실패를 숨깁니다.
SMOTE는 무엇을 하나요?
SMOTE(Synthetic Minority Over-sampling Technique)는 단순히 복제하는 것이 아니라 소수 지점과 가장 가까운 소수 이웃 사이를 보간하여 새로운 소수 예제를 생성합니다.
학습 예제 수를 변경하지 않고 불균형을 처리하는 접근 방식은 무엇입니까?
클래스 가중치는 데이터를 그대로 유지하고 대신 손실 함수가 소수 클래스의 오류에 더 큰 처벌을 가하도록 만듭니다.
데이터를 학습 세트와 테스트 세트로 분할하기 전에 오버샘플링을 적용할 때 발생할 수 있는 주요 위험은 무엇입니까?
분할 전 리샘플링을 수행하면 훈련 세트와 테스트 세트 모두에 거의 동일한 소수 점이 나타나 정보가 유출되고 지나치게 낙관적이고 비현실적인 성능이 생성됩니다.
무작위 언더샘플링의 주요 단점은 무엇입니까?
과소샘플링은 다수의 예제를 버림으로써 클래스의 균형을 유지합니다. 이는 유익한 데이터를 삭제하고 다수 클래스를 학습하는 모델의 능력을 손상시킬 수 있습니다.