Forvirringsmatriser
En forvirringsmatrise er en enkel tabell som deler opp en klassifisers spådommer i riktige og ukorrekte tellinger for hver klasse.
Oversikt
It is the raw scoreboard from which nearly every other classification metric is calculated.
Dypdykk
En forvirringsmatrise er et rutenett som sammenligner antatte etiketter med faktiske etiketter. For binær klassifisering har den fire celler: True Positives (korrekt predikert positiv), True Negatives (korrekt predikert negativ), False Positives (negativer feilaktig flagget positive, en 'Type I-feil'), og False Negatives (positive som ble savnet, en 'Type II-feil'). Fra disse fire tallene utleder du nøyaktighet ((TP+TN)/total), presisjon (TP/(TP+FP)), gjenkalling eller sensitivitet (TP/(TP+FN)), spesifisitet (TN/(TN+FP)), og F1-poengsum (det harmoniske gjennomsnittet av presisjon og gjenkalling). For problemer med mer enn to klasser, blir matrisen N-for-N, der diagonalen har riktige spådommer og off-diagonale celler avslører nøyaktig hvilke klasser som blir forvirret for hvilke andre.
Teknisk innsikt
Matrisens kraft er at den bevarer strukturen til feil som et enkelt nøyaktighetstall skjuler. To modeller med identisk 90 % nøyaktighet kan ha veldig forskjellige falsk-negative rater, noe som betyr enormt når en tapt kreftdiagnose koster mer enn en falsk alarm. Etter konvensjon representerer rader ofte sanne klasser og kolonner predikerte klasser (selv om noen biblioteker snur dette), så sjekk alltid akseetikettene før du beregner presisjon kontra gjenkalling fra cellene.
Strategisk innvirkning
Tydeligere avgjørelser
Det hjelper deg å skille klare tekniske påstander fra markedsføringsspråk.
Cost and budget
Du kan stille bedre implementeringsspørsmål før du bruker penger eller tid.
Team and workflow
Team med delt forståelse tar bedre produkt-, policy- og læringsbeslutninger.
Fremtiden til forvirringsmatriser
Forvirringsmatriser vil forbli grunnleggende, men verktøy gjør dem rikere: interaktive, normaliserte varmekart, oppdelinger per klasse for store etikettsett og kostnadsvektede matriser som multipliserer hver feiltype med dens virkelige straff. I rettferdighetsrevisjon beregner utøvere nå separate forvirringsmatriser per demografisk undergruppe for å avdekke ulik feilprosent. Forvent fortsatt integrering i modelldashbord der klikk på en celle viser de faktiske feilklassifiserte eksemplene for inspeksjon.
Real-World Implementering
Diagnostisere hvor en bildeklassifiserer mislykkes ved å se at den ofte forveksler huskyer med ulver i cellene utenfor diagonalen
Revisjon av et medisinsk screeningsverktøy ved å undersøke falske negativer - pasienter med sykdommen modellen erklærte friske
Sammenligning av to spamfiltre for e-post som deler samme nøyaktighet, men som er forskjellige i hvor mange ekte e-poster de feilaktig blokkerer (falske positiver)
Evaluering av en flerklasses håndskrevne siffergjenkjenner for å finne at 4-er og 9-ere oftest forveksles med hverandre
Risikoer og rekkverk
Ulike team kan bruke samme begrep forskjellig, så definer omfang tidlig.
Benchmarks kan se sterke ut mens ytelsen i den virkelige verden er ujevn.
Å ignorere datakvalitet og evalueringsplaner skaper ofte skjøre resultater.
Veikart for implementering
Start med en klarspråklig definisjon av resultatet du trenger.
Velg én suksessberegning og én feilbetingelse før testing.
Kjør en liten pilot med representative data, ikke et polert demosett.
Dokumenter hvor Confusion Matrices hjelper og hvor enklere metoder er bedre.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Confusion Matrices quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Kryssvalidering
Ofte stilte spørsmål
What is Confusion Matrices?
En forvirringsmatrise er en enkel tabell som deler opp en klassifisers spådommer i riktige og ukorrekte tellinger for hver klasse. Det er den rå resultattavlen som nesten annenhver klassifiseringsberegning beregnes fra.
I en binær forvirringsmatrise, hva er en falsk negativ?
En falsk negativ er en faktisk positiv som modellen gikk glipp av ved å merke den negativ - for eksempel en syk pasient erklært frisk.
Hvilken beregning måler andelen faktiske positive som modellen identifiserer riktig?
Tilbakekalling (også kalt sensitivitet eller den sanne positive raten) er TP / (TP + FN) — andelen av reelle positive resultater modellen fanget.
I en forvirringsmatrise for et problem med 5 klasser, hva representerer diagonalcellene?
I en N-for-N-matrise har diagonalen tilfeller der den predikerte klassen samsvarer med den sanne klassen - dvs. korrekte prediksjoner.
Hvorfor kan nøyaktighet alene være misvisende uten en forvirringsmatrise?
To modeller med samme nøyaktighet kan fordele sine feil svært forskjellig; forvirringsmatrisen avslører om feil for det meste er falske alarmer eller tapte positive.
F1-poengsummen er det harmoniske gjennomsnittet av hvilke to metrikker?
F1 kombinerer presisjon og gjenkalling til ett tall ved å bruke det harmoniske gjennomsnittet, som straffer store ubalanser mellom de to.