GUIDE Technique
Facteur de valeur aberrante locale
Le facteur de valeur aberrante locale (LOF) évalue une observation en comparant sa densité locale avec les densités de ses voisins les plus proches.
Sur cette page3 minutes de lecture
Aperçu
Il peut détecter des points inhabituels dans une région clairsemée ou dense, mais le nombre de voisins, la mise à l'échelle des distances et la distinction entre la détection des valeurs aberrantes et la détection de la nouveauté affectent son utilisation.
Plongée profonde
LOF est un score d'anomalie basé sur la densité. Pour chaque observation, il trouve un voisinage de k points les plus proches et estime la densité d'accessibilité locale, qui reflète la densité du point par rapport à ses voisins. LOF compare la densité d'accessibilité locale moyenne des voisins avec la propre densité du point. Un score proche de un indique une densité locale comparable ; un score sensiblement plus élevé indique que le point est moins dense que les observations proches. Il s’agit d’une comparaison locale relative plutôt que d’une mesure globale de la distance par rapport au centre. Cette localité peut faire apparaître des anomalies qui manquent aux méthodes globales. Un point peut être inhabituel dans un quartier dense tout en se trouvant dans une région où l'ensemble des données global est large. A l’inverse, un point éloigné du nuage principal peut appartenir à un sous-groupe dense distinct et recevoir un score local ordinaire. La question de savoir si ce sous-groupe doit être considéré comme anormal dépend de la tâche. Le nombre de voisins contrôle l’échelle de comparaison. Les petits quartiers sont sensibles à la structure fine et au bruit ; les plus grands peuvent se comparer à travers des groupes distincts. Les unités de mesure de distance et de caractéristiques sont importantes car LOF utilise les voisins les plus proches. Mettez à l'échelle les variables numériques de manière appropriée et codez les catégories sans inventer un ordre numérique trompeur. Choisissez les paramètres en fonction de la taille attendue des groupes et évaluez le comportement des scores, idéalement avec des cas examinés. Scikit-learn distingue la détection des valeurs aberrantes, où LOF identifie les observations inhabituelles dans l'ensemble de données ajusté, de la détection de nouveauté, où un modèle est ajusté sur des données de référence et utilisé sur de nouveaux points. Ce dernier nécessite newty=True, et la documentation met en garde contre l'utilisation des méthodes de notation de nouveauté sur les données d'entraînement dans ce mode. Les scores LOF ne sont pas des probabilités calibrées et peuvent utiliser des conventions de signes inversés dans les API. Vérifiez si des valeurs supérieures ou inférieures indiquent une anomalie plus importante. Une anomalie de quartier est une preuve relative à un ensemble de référence et à une mesure sélectionnés, et non un jugement définitif sur la qualité ou le risque des données.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L’avenir du facteur aberrant local
LOF peut prendre en charge un examen minutieux lorsque les rapports d'anomalies affichent l'échelle voisine sélectionnée, le prétraitement et la direction du score local. Les équipes doivent comparer les cas inhabituels avec leurs groupes de pairs réels pour décider si un écart local est important. À mesure que la distribution des données change, mettez à jour l’ensemble de référence de manière réfléchie et surveillez les changements de score par segment. Lorsque la détection de nouveauté est utilisée, gardez les parcours de formation et de notation futurs distincts. De meilleures interfaces pourraient expliquer quels voisins ont contribué à un score, tout en précisant que la comparaison de quartiers n’est pas une évaluation causale ou calibrée des risques.
Mise en œuvre dans le monde réel
Un point se trouve dans une poche clairsemée à côté d’un quartier dense. Sa densité d'accessibilité locale est inférieure à celle de ses voisins, donc son rapport LOF augmente même si sa localisation absolue n'est pas globalement loin de toutes les données.
Une observation hypothétique se situe loin du nuage principal mais à l’intérieur d’un sous-groupe dense distinct. LOF peut le considérer comme localement ordinaire car il a des voisins de densité similaire, illustrant la différence entre la rareté globale et le statut de valeur aberrante locale.
Une équipe compare les valeurs n_neighbours et met à l’échelle les caractéristiques numériques avant les calculs de distance. Avec trop peu de voisins, de minuscules structures peuvent dominer ; un trop grand nombre peut brouiller les groupes locaux.
Pour la détection de nouveauté, un analyste ajuste le LOF aux données de référence avec nouveauté = Vrai et marque plus tard des points invisibles. Ils évitent d'appliquer les méthodes de notation de nouveauté à l'ensemble de formation dans ce mode, conformément à la distinction documentée de la bibliothèque.
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Local Outlier Factor quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Questions fréquemment posées
Qu’est-ce que le facteur de valeur aberrante locale ?
Le facteur de valeur aberrante locale (LOF) évalue une observation en comparant sa densité locale avec les densités de ses voisins les plus proches. Il peut détecter des points inhabituels dans une région clairsemée ou dense, mais le nombre de voisins, la mise à l'échelle des distances et la distinction entre la détection des valeurs aberrantes et la détection de la nouveauté affectent son utilisation.
Que suggère un score LOF nettement supérieur à un ?
LOF compare les densités des voisins avec la densité du point ; un rapport plus élevé indique une relative rareté.
Pourquoi un point éloigné peut-il recevoir un score LOF ordinaire ?
LOF est local ; un point dans son propre voisinage dense peut être localement ordinaire malgré une séparation globale.
Qu'est-ce que l'augmentation du nombre de voisins change généralement ?
k détermine la taille du quartier et donc l'échelle de localité de la comparaison de densité.
Pourquoi la mise à l'échelle des fonctionnalités est-elle importante pour LOF ?
Les différences d’échelle peuvent dominer la métrique de distance et modifier les observations qui sont voisines.
En quoi la détection de nouveauté diffère-t-elle de la détection des valeurs aberrantes sur un échantillon ajusté ?
Le mode Nouveauté ajuste les données de référence et évalue les observations invisibles, contrairement à l'identification des valeurs aberrantes au sein de l'échantillon ajusté.
Continuez à apprendre
Guides associés
Plus de guides sélectionnés pour ce sujet