テクニカルガイド

クラスの不均衡とリサンプリング

Class imbalance is when one outcome vastly outnumbers another — like 99.9% legitimate transactions versus 0.1% fraud — which tricks models into ignoring the rare but important class.

2分の読書最終更新日

概要

Resampling rebalances the training data so the model actually learns to spot the minority.

ディープダイブ

クラスが偏っている場合、モデルは常に大多数を予測し、不正行為を 1 つも検出しないことで 99.9% の精度を達成できますが、これは役に立ちません。リサンプリングは、大きく 2 つの方法でトレーニング分布を修正します。オーバーサンプリングは少数派サンプルを複製または合成します。古典的な SMOTE (合成少数派オーバーサンプリング技術) は、少数派サンプルとその最も近い少数派サンプルの間をコピーするのではなく、それらの間を補間することによって新しいポイントを作成します。代わりにアンダーサンプリングでは、データを破棄するという犠牲を払って、大部分のサンプルを (ランダムに、または Tomek リンクや NearMiss などの方法を介して賢明に) 破棄して平準化します。データへの接触を避ける代替案には、クラスの重み付け (損失関数で少数のエラーにさらにペナルティを与える) やトレーニング後の決定しきい値の調整が含まれます。

技術的な洞察

重要なルール: トレーニング セットのみをリサンプリングし、検証セットやテスト セットは決してリサンプリングせず、常に相互検証フォールド内でリサンプリングします。分割前のオーバーサンプリングにより、重複に近い点がテスト セットに漏れ、スコアが膨らみます。ここでは精度は無意味であるため、評価は適合率、再現率、F1、適合率-再現率 AUC、またはマシューズ相関係数 (陽性クラスがまれな場合でも誠実さを保つ指標) に依存する必要があります。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

クラスの不均衡とリサンプリングの未来

リサンプリングは ML パイプライン内でますます自動化されており、不均衡学習のようなライブラリが相互検証に直接統合されています。研究は、コスト重視の学習と、簡単な大多数の例を重み付けする焦点損失などのカスタマイズされた損失関数に移行しており、多くの場合、深いネットワークでの粗雑なリサンプリングよりも優れたパフォーマンスを発揮します。表形式および画像データの場合、現実的な少数サンプルを合成する生成モデルが、SMOTE スタイルの内挿のより洗練された後継モデルとして登場しています。

現実世界の実装

本物の不正行為が取引の 1% 未満であるクレジット カード不正行為検出器をトレーニングし、SMOTE を使用してまれな不正行為を増幅します。

患者の数パーセントのみに存在する希少疾患の医学モデルを構築し、クラスの重み付けを適用して、見逃した症例に大きなペナルティを課す

ほぼすべての製品が検査に合格する製造ラインで不良品を検出し、トレーニングのバランスを取るために「良品」をアンダーサンプリングする

通常のトラフィックが大半を占めるサイバーセキュリティ ログで、まれなネットワーク侵入にフラグを立てます。精度ではなく精度-再現率 AUC で評価されます。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Class Imbalance and Resampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

シャムネットワークとトリプレット損失

よくある質問

What is Class Imbalance and Resampling?

クラスの不均衡とは、1 つの結果が別の結果を大幅に上回る場合 (99.9% の正当なトランザクションと 0.1% の不正行為など) で、まれではあるが重要なクラスを無視するようにモデルを騙します。リサンプリングによりトレーニング データのバランスが再調整されるため、モデルは実際に少数派を特定することを学習します。

単純な精度が、非常に不均衡な分類問題の指標として不十分なのはなぜですか?

ケースの 99.9% が陰性の場合、常に陰性を予測するモデルは、陽性を検出せずに 99.9% の精度を獲得するため、精度により、まれなクラスでの完全な失敗が隠蔽されます。

SMOTEって何をするの?

SMOTE (合成少数点オーバーサンプリング技術) は、少数点を単に複製するのではなく、少数点とそれに最も近い少数点の間を補間することにより、新しい少数点の例を作成します。

トレーニング サンプルの数を変更せずに不均衡に対処するアプローチはどれですか?

クラスの重み付けではデータは変更されず、代わりに損失関数によって少数クラスのエラーにさらに重くペナルティが課されます。

データをトレーニング セットとテスト セットに分割する前にオーバーサンプリングを適用する主なリスクは何ですか?

分割前にリサンプリングすると、トレーニング セットとテスト セットの両方にほぼ同一の少数点が表示され、情報が漏洩し、過度に楽観的で非現実的なパフォーマンスが生成されます。

ランダムアンダーサンプリングの主な欠点は何ですか?

アンダーサンプリングは多数派の例を破棄することでクラスのバランスをとりますが、これにより有益なデータが破棄され、多数派クラスを学習するモデルの能力が損なわれる可能性があります。