Il prossimoProssima guida
LIME Spiegazioni locali
Tecnico
GUIDA TECNICA
Il Local Outlier Factor (LOF) assegna un punteggio a un'osservazione confrontando la sua densità locale con le densità dei suoi vicini più prossimi.
Può rilevare punti insoliti all'interno di una regione sparsa o densa, ma il conteggio dei vicini, il ridimensionamento della distanza e la distinzione tra rilevamento di valori anomali e rilevamento di novità ne influenzano l'utilizzo.
LOF è un punteggio di anomalia basato sulla densità. Per ogni osservazione, trova un quartiere di k punti più vicini e stima la densità di raggiungibilità locale, che riflette quanto il punto sia compatto rispetto ai suoi vicini. LOF confronta la densità media di raggiungibilità locale dei vicini con la densità stessa del punto. Un punteggio vicino a uno indica una densità locale comparabile; un punteggio sostanzialmente più grande indica che il punto è meno denso delle osservazioni vicine. Si tratta di un confronto locale relativo piuttosto che di una misura globale della distanza dal centro. Questa località può far emergere anomalie che i metodi globali non rilevano. Un punto può essere insolito in un quartiere denso pur trovandosi ancora in una regione in cui il set di dati complessivo è ampio. Al contrario, un punto lontano dalla nuvola principale può appartenere a un sottogruppo denso distinto e ricevere un punteggio locale ordinario. Se quel sottogruppo debba essere considerato anomalo dipende dall'attività. Il conteggio dei vicini controlla la scala del confronto. I piccoli quartieri sono sensibili alla struttura fine e al rumore; quelli grandi possono essere confrontati tra gruppi separati. La metrica della distanza e le unità delle caratteristiche sono importanti perché LOF utilizza i vicini più vicini. Ridimensiona le variabili numeriche in modo appropriato e codifica le categorie senza inventare un ordine numerico fuorviante. Scegli le impostazioni in base alle dimensioni previste del gruppo e valuta il comportamento del punteggio, idealmente con casi esaminati. Scikit-learn distingue il rilevamento di valori anomali, in cui LOF identifica osservazioni insolite nel set di dati adattato, dal rilevamento di novità, in cui un modello viene adattato ai dati di riferimento e utilizzato su nuovi punti. Quest'ultimo richiede novelty=True e la documentazione mette in guardia contro l'utilizzo dei metodi di punteggio di novità sui dati di training in quella modalità. I punteggi LOF non sono probabilità calibrate e possono utilizzare convenzioni di segno invertito nelle API. Controllare se valori più alti o più bassi indicano un'anomalia maggiore. Un'anomalia di vicinato è una prova relativa a un insieme di riferimento e a una metrica selezionati, non un giudizio definitivo sulla qualità o sul rischio dei dati.
Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.
La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.
Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.
LOF può supportare un'attenta revisione quando i rapporti sulle anomalie mostrano la scala del vicino selezionato, la preelaborazione e la direzione del punteggio locale. I team dovrebbero confrontare i casi insoliti con i loro attuali gruppi di pari per decidere se una deviazione locale è importante. Man mano che la distribuzione dei dati cambia, aggiorna attentamente il set di riferimento e monitora le variazioni di punteggio per segmento. Quando viene utilizzato il rilevamento delle novità, mantenere distinti i percorsi di formazione e di punteggio futuro. Interfacce migliori potrebbero spiegare quali vicini hanno contribuito a un punteggio, chiarendo al contempo che il confronto tra quartieri non è una valutazione del rischio causale o calibrata.
Un punto si trova in una piccola tasca accanto a un quartiere denso. La sua densità di raggiungibilità locale è inferiore a quella dei suoi vicini, quindi il suo rapporto LOF aumenta anche se la sua posizione assoluta non è globalmente lontana da tutti i dati.
Un'ipotetica osservazione si trova lontano dalla nuvola principale ma all'interno di un denso sottogruppo separato. LOF può considerarlo localmente ordinario perché ha vicini con densità simile, illustrando la differenza tra rarità globale e status anomalo locale.
Un team confronta i valori di n_neighbors e ridimensiona le caratteristiche numeriche prima del calcolo della distanza. Con troppo pochi vicini, possono prevalere strutture minuscole; troppi possono confondere i gruppi locali.
Per il rilevamento delle novità, un analista adatta il LOF ai dati di riferimento con novità=Vero e assegna un punteggio ai punti invisibili successivi. Evitano di applicare i metodi di punteggio della novità al set di formazione in questa modalità, seguendo la distinzione documentata della biblioteca.
L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.
I costi delle infrastrutture e della manutenzione sono spesso sottostimati.
Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.
Definire obiettivi di latenza, qualità e costi prima dell'implementazione.
Benchmark in condizioni di carico e dati realistiche.
Monitoraggio dello strumento per errori, deriva e impatto sull'utente.
Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Il Local Outlier Factor (LOF) assegna un punteggio a un'osservazione confrontando la sua densità locale con le densità dei suoi vicini più prossimi. Può rilevare punti insoliti all'interno di una regione sparsa o densa, ma il conteggio dei vicini, il ridimensionamento della distanza e la distinzione tra rilevamento di valori anomali e rilevamento di novità ne influenzano l'utilizzo.
LOF confronta le densità dei vicini con la densità del punto; un rapporto maggiore indica una scarsità relativa.
LOF è locale; un punto nel suo stesso denso quartiere può essere localmente ordinario nonostante la separazione globale.
k determina la dimensione del quartiere e quindi la scala di località del confronto di densità.
Le differenze di scala possono dominare la metrica della distanza e cambiare quali osservazioni siano vicine.
La modalità Novità adatta i dati di riferimento e valuta le osservazioni invisibili, distinte dall'identificazione dei valori anomali all'interno del campione adattato.
Continua a imparare
Altre guide selezionate per questo argomento
Il prossimoProssima guida
LIME Spiegazioni locali
Tecnico