Il prossimoProssima guida
Confronto tra polizze assicurative e intelligenza artificiale
Applicazioni
GUIDA TECNICA
Testare molte ipotesi aumenta la possibilità di ottenere almeno un falso positivo, anche quando ciascun test utilizza lo stesso livello di significatività nominale.
Le procedure di confronto multiplo come Bonferroni controllano l'errore in termini di famiglia, mentre i metodi di tasso di false scoperte controllano la proporzione prevista di false scoperte tra le ipotesi rifiutate in condizioni stabilite.
Un test di ipotesi al livello alfa controlla una probabilità di falsi positivi per un test specificato in base alle sue ipotesi. Quando vengono testate molte ipotesi, la possibilità di almeno un falso rifiuto nell'insieme può superare l'alfa. Se 20 ipotesi nulle indipendenti vengono testate ciascuna a 0,05, la probabilità di nessun falso positivo è 0,95 elevata alla ventesima potenza, circa 0,358; quindi la probabilità che ne escano uno o più è di circa 0,642. La dipendenza cambia questo calcolo, ma rimane il problema fondamentale della molteplicità. Il tasso di errore familiare (FWER) è la probabilità che si verifichi almeno un falso rifiuto in una famiglia. La procedura Bonferroni controlla FWER testando ciascuna delle m ipotesi al valore alfa diviso per m, o regolando in modo equivalente i valori p moltiplicando per m e fissando il limite a uno. È semplice e valido in condizioni di ampia dipendenza, ma può essere conservativo, riducendo la potenza quando vengono eseguiti molti test. La procedura step-down di Holm controlla anche FWER e può essere meno conservativa del semplice Bonferroni. Il tasso di false scoperte (FDR) è la proporzione prevista di false scoperte tra le ipotesi rifiutate, con una definizione convenzionale impostata su zero quando non ci sono rifiuti. Benjamini-Hochberg ordina i valori p dal più piccolo al più grande e li confronta con una soglia dipendente dal rango. Spesso offre più potere quando è utile un ampio insieme di scoperte, ma la sua garanzia e interpretazione dipendono da ipotesi sulla dipendenza e dal processo di test. Il controllo FDR non significa che ogni risultato selezionato abbia la stessa probabilità di essere falso. Definire la famiglia di ipotesi basata sulla domanda scientifica o operativa, compresi i risultati, i sottogruppi e gli aspetti provvisori che appartengono insieme. Scegli un criterio di errore prima di controllare i risultati. Riportare il numero e la natura dei test, il metodo di aggiustamento, i valori aggiustati e le stime degli effetti. Le correzioni non riparano p-hacking, misurazioni inadeguate, confondimenti o ipotesi di test non valide. I risultati esplorativi possono ancora essere utili per generare ipotesi, ma dovrebbero essere etichettati come esplorativi e convalidati con nuovi dati quando possibile.
Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.
La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.
Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.
I team possono rendere i risultati multi-test più affidabili preregistrando la famiglia primaria, distinguendo le analisi di conferma da quelle esplorative e preservando tutti i risultati testati nei report. Quando vengono esaminati molti risultati correlati, gli analisti dovrebbero selezionare una correzione in linea con il costo di eventuali falsi positivi rispetto all'utilità della scoperta del candidato. La replica e la convalida indipendente rimangono importanti dopo l'aggiustamento. I futuri sistemi di analisi possono esporre il numero di confronti e il metodo di correzione insieme ai risultati, aiutando i lettori a vedere quando è emersa una scoperta sorprendente da un’ampia ricerca piuttosto che da un singolo test pianificato.
Un ipotetico team testa 20 risultati con livello di significatività 0,05. Con valori nulli indipendenti, la possibilità di almeno un falso positivo è 1 - 0,95^20, circa 0,64, il che illustra il motivo per cui le soglie isolate del valore p possono fuorviare.
Per 10 test pianificati e alfa familiare 0,05, Bonferroni utilizza una soglia per test di 0,005. Un valore p di 0,01 non supererebbe questo limite corretto, sebbene l'interpretazione dipenda ancora dal piano di test.
Un analista esplora migliaia di geni e utilizza una procedura Benjamini-Hochberg per controllare il tasso di false scoperte, quindi tratta le scoperte come candidati alla replicazione piuttosto che come meccanismi confermati.
Un team di prodotto registra il proprio endpoint primario prima di esaminare le metriche secondarie. Definire in anticipo la famiglia di test aiuta ad evitare di scegliere una correzione solo dopo aver visto quali risultati sono significativi.
L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.
I costi delle infrastrutture e della manutenzione sono spesso sottostimati.
Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.
Definire obiettivi di latenza, qualità e costi prima dell'implementazione.
Benchmark in condizioni di carico e dati realistiche.
Monitoraggio dello strumento per errori, deriva e impatto sull'utente.
Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Testare molte ipotesi aumenta la possibilità di ottenere almeno un falso positivo, anche quando ciascun test utilizza lo stesso livello di significatività nominale. Le procedure di confronto multiplo come Bonferroni controllano l'errore in termini di famiglia, mentre i metodi di tasso di false scoperte controllano la proporzione prevista di false scoperte tra le ipotesi rifiutate in condizioni stabilite.
Bonferroni delimita la probabilità di uno o più falsi rifiuti in famiglia.
FDR è definito in base alla percentuale prevista di false scoperte tra le ipotesi rifiutate.
I metodi FDR possono essere meno rigorosi del controllo FWER quando molte scoperte candidate sono utili.
La correzione dipende da quali test sono considerati parte della stessa famiglia di analisi.
Gli aggiustamenti della molteplicità non riparano la progettazione dello studio, la misurazione o le ipotesi di test errate.
Continua a imparare
Altre guide selezionate per questo argomento
Il prossimoProssima guida
Confronto tra polizze assicurative e intelligenza artificiale
Applicazioni