Матриці плутанини
Матриця плутанини — це проста таблиця, яка розбиває прогнози класифікатора на правильні та неправильні підрахунки для кожного класу.
Огляд
It is the raw scoreboard from which nearly every other classification metric is calculated.
Глибоке занурення
Матриця плутанини — це сітка, яка порівнює прогнозовані мітки з фактичними мітками. Для двійкової класифікації він має чотири комірки: істинні позитивні (правильно передбачені позитивні), істинні негативні (правильно передбачені негативні), хибні позитивні (негативні помилки, помилково позначені як позитивні, «помилка типу I») і хибні негативні (негативні результати, які були пропущені, «помилка типу II»). З цих чотирьох чисел ви отримуєте точність ((TP+TN)/загальний), прецизійність (TP/(TP+FP)), запам’ятовуваність або чутливість (TP/(TP+FN)), специфічність (TN/(TN+FP)) і оцінку F1 (гармонічне середнє значення точності та пригадування). Для проблем із більш ніж двома класами матриця стає N-на-N, де діагональ містить правильні прогнози, а недіагональні комірки показують, які саме класи плутаються з іншими.
Технічне розуміння
Потужність матриці полягає в тому, що вона зберігає структуру помилок, які приховує одне число точності. Дві моделі з однаковою точністю 90% можуть мати дуже різні показники хибнонегативних результатів, що має величезне значення, коли пропущений діагноз раку коштує дорожче, ніж помилкова тривога. Згідно з домовленістю, рядки часто представляють справжні класи, а стовпці – передбачені класи (хоча деякі бібліотеки перевертають це), тому завжди перевіряйте мітки осей перед обчисленням точності та відкликання з клітинок.
Стратегічний вплив
Чіткіші рішення
Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.
Вартість і бюджет
Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.
Команда та робочий процес
Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.
Майбутнє матриць плутанини
Матриці плутанини залишаться основоположними, але інструменти роблять їх багатшими: інтерактивні нормалізовані теплові карти, розбивка за класами для великих наборів міток і матриці зваженої вартості, які множать кожен тип помилки на її реальний штраф. Під час аудиту справедливості практики тепер обчислюють окремі матриці плутанини для кожної демографічної підгрупи, щоб виявити неоднаковий рівень помилок. Очікуйте подальшої інтеграції в інформаційні панелі моделей, де клацання комірки відкриває фактичні неправильно класифіковані приклади для перевірки.
Реалізація в реальному світі
Діагностика, де класифікатор зображень не працює, бачачи, що він часто плутає хаскі з вовками в недіагональних клітинках
Перевірка інструменту медичного скринінгу шляхом дослідження помилкових негативних результатів — пацієнтів із хворобою, яку модель визнала здоровою
Порівняння двох спам-фільтрів електронної пошти, які мають однакову точність, але відрізняються кількістю справжніх електронних листів, які вони помилково блокують (помилкові спрацьовування)
Оцінка багатокласового розпізнавання рукописних цифр, щоб виявити, що 4s і 9s найчастіше помилково приймають одна за одну
Ризики та огорожі
Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.
Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.
Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.
Дорожня карта впровадження
Почніть із простого визначення необхідного результату.
Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.
Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.
Задокументуйте, де матриці плутанини допомагають, а де простіші методи кращі.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Confusion Matrices quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Перехресна перевірка
Часті запитання
What is Confusion Matrices?
Матриця плутанини — це проста таблиця, яка розбиває прогнози класифікатора на правильні та неправильні підрахунки для кожного класу. Це необроблена таблиця результатів, на основі якої розраховується майже кожна інша метрика класифікації.
У двійковій матриці плутанини, що таке хибно-від’ємне значення?
Помилково-негативний результат — це фактичний позитивний результат, який модель пропустила, позначивши його як негативний — наприклад, хворий пацієнт оголошений здоровим.
Який показник вимірює частку фактичних позитивних результатів, які модель правильно визначає?
Запам’ятовування (також називається чутливістю або справжнім позитивним показником) дорівнює TP / (TP + FN) — частка реальних позитивних результатів, які вловила модель.
Що означають діагональні клітинки в матриці плутанини для задачі з 5 класами?
У матриці N на N діагональ містить випадки, коли прогнозований клас відповідає справжньому класу, тобто правильні прогнози.
Чому сама по собі точність може ввести в оману без матриці плутанини?
Дві моделі з однаковою точністю можуть по-різному розподіляти свої помилки; матриця плутанини показує, чи є помилки здебільшого помилковими тривогами чи пропущеними позитивними результатами.
Оцінка F1 є гармонійним середнім яких двох показників?
F1 поєднує точність і відкликання в одне число, використовуючи середнє гармонічне, яке штрафує великі дисбаланси між ними.