テクニカルガイド

局所外れ値係数

局所外れ値係数 (LOF) は、局所的な密度を最近傍の密度と比較することによって観測値をスコア付けします。

  • 3 分で読めます
  • 最終更新日
このページでは3 分で読めます
  1. 概要
  2. ディープダイブ
  3. 戦略的影響
  4. ローカル外れ値要因の将来
  5. 現実世界の実装
  6. リスクとガードレール
  7. 実装ロードマップ
  8. 探検を続けましょう
  9. よくある質問

概要

疎領域または密領域内で異常な点を検出できますが、近傍数、距離スケーリング、外れ値検出と新規性検出の区別がその使用に影響します。

ディープダイブ

LOF は密度ベースの異常スコアです。観測ごとに、k 個の最も近い点の近傍を見つけて、その点が近傍点と比較してどの程度密集しているかを反映するローカル到達可能密度を推定します。 LOF は、近隣の平均ローカル到達可能密度をポイント自体の密度と比較します。 1 に近いスコアは、同等の局所密度を示します。実質的に大きいスコアは、そのポイントが近くの観測値よりも密度が低いことを示します。これは、中心からの全体的な距離の測定ではなく、相対的なローカル比較です。この局所性により、グローバル メソッドが見逃す異常が表面化する可能性があります。ポイントは、データセット全体が広い領域に存在していても、密集した近傍では異常である可能性があります。逆に、メインクラウドから遠く離れた点は、別個の密なサブグループに属し、通常のローカルスコアを受け取る可能性があります。そのサブグループを異常としてカウントするかどうかはタスクによって異なります。近隣カウントは比較のスケールを制御します。小さな地区は細かい構造物や騒音に敏感です。大きいものは別のグループ間で比較する場合があります。 LOF は最近傍を使用するため、距離メトリックとフィーチャ単位が重要です。誤解を招く数値順序を作らずに、数値変数を適切にスケールし、カテゴリをエンコードします。予想されるグループのサイズに基づいて設定を選択し、理想的にはレビューされたケースを使用してスコアの動作を評価します。 Scikit-learn は、LOF によって近似されたデータセット内の異常な観測値が識別される外れ値検出と、モデルが参照データに近似されて新しいポイントで使用される新規性検出とを区別します。後者では、novelty=True が必要であり、ドキュメントでは、そのモードでトレーニング データに対してノベルティ スコア付け方法を使用しないように警告しています。 LOF スコアは校正された確率ではなく、API で逆符号規則が使用される場合があります。値が高いほど異常が大きいことを示しているのか、低いほど異常が大きいのかを検査します。近傍の異常は、選択した参照セットとメトリックに関連する証拠であり、データの品質やリスクに関する最終的な判断ではありません。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

ローカル外れ値要因の将来

LOF は、異常レポートが選択された近傍スケール、前処理、およびローカル スコアの方向を示す場合の慎重なレビューをサポートできます。チームは、異常なケースを実際のピア グループと比較して、局所的な逸脱が重要かどうかを判断する必要があります。データの分布が変化した場合は、慎重に参照セットを更新し、セグメントごとのスコアの変化を監視します。新規性検出を使用する場合は、トレーニングと将来のスコアリング パスを区別してください。より良いインターフェースは、どの近隣がスコアに寄与したかを説明すると同時に、近隣の比較が因果関係や調整されたリスク評価ではないことを明確にすることができます。

現実世界の実装

ポイントは、密集した近傍の隣の疎なポケットに位置します。そのローカル到達可能密度は近隣のものよりも低いため、その絶対的な位置がすべてのデータから世界的に遠くない場合でも、その LOF 比率は上昇します。

仮説的な観測は、主要な雲から遠く離れていますが、別の密なサブグループの内側にあります。 LOF は、同様の密度の近傍があり、世界的な希少性と局所的な外れ値ステータスの違いを示しているため、それを局所的に普通のものと見なす可能性があります。

チームは、距離を計算する前に、n_neighbors 値を比較し、数値特徴をスケーリングします。隣接する構造物が少なすぎると、小さな構造物が優勢になる可能性があります。多すぎると、ローカル グループがぼやけてしまう可能性があります。

新規性の検出の場合、アナリストは参照データに新規性 = True を指定して LOF を当てはめ、その後の未確認のポイントをスコア付けします。彼らは、ライブラリの文書化された区別に従って、このモードの下でトレーニングセットに新規性スコア付け方法を適用することを避けます。

リスクとガードレール

  • 1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

  • インフラストラクチャとメンテナンスのコストは過小評価されがちです。

  • システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

  1. 実装前にレイテンシ、品質、コストの目標を定義します。

  2. 現実的な負荷とデータ条件でのベンチマーク。

  3. エラー、ドリフト、ユーザーへの影響を計測器で監視します。

  4. スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Local Outlier Factor quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

局所外れ値係数とは何ですか?

局所外れ値係数 (LOF) は、局所的な密度を最近傍の密度と比較することによって観測値をスコア付けします。疎領域または密領域内で異常な点を検出できますが、近傍数、距離スケーリング、外れ値検出と新規性検出の区別がその使用に影響します。

1 を大幅に上回る LOF スコアは何を示唆していますか?

LOF は、近隣の密度をポイントの密度と比較します。比率が大きいほど、相対的にまばらであることを示します。

遠く離れたポイントが通常の LOF スコアを受け取ることができるのはなぜですか?

LOF はローカルです。独自の密集した近傍内の点は、グローバルな分離にもかかわらず、局所的には普通である可能性があります。

一般に、近隣カウントを増やすと何が変わりますか?

k は近傍サイズを決定し、したがって密度比較の局所性スケールを決定します。

LOF にとって機能のスケーリングが重要なのはなぜですか?

スケールの違いは距離計量を支配し、どの観測が隣接するかを変える可能性があります。

新規性の検出は、適合サンプルの外れ値の検出とどのように異なりますか?

ノベルティ モードは、参照データをフィッティングし、目に見えない観測値を評価します。これは、フィッティングされたサンプル内の外れ値を特定することとは異なります。