РУКОВОДСТВО ПО ОСНОВАМ

Матрицы путаницы

Матрица путаницы — это простая таблица, которая разбивает прогнозы классификатора на правильные и неправильные значения для каждого класса.

2 минуты чтенияПоследнее обновление

Обзор

Это исходное табло, по которому рассчитываются почти все остальные показатели классификации.

Глубокое погружение

Матрица путаницы — это сетка, сравнивающая прогнозируемые метки с фактическими метками. Для двоичной классификации он имеет четыре ячейки: «Истинные положительные результаты» (правильно предсказанный положительный результат), «Истинные отрицательные значения» (правильно предсказанный отрицательный результат), «Ложные положительные результаты» (негативные значения, ошибочно помеченные как положительные, «ошибка типа I») и «Ложные отрицательные значения» (пропущенные положительные результаты, «ошибка типа II»). Из этих четырех чисел вы получаете точность ((TP+TN)/всего), прецизионность (TP/(TP+FP)), полноту или чувствительность (TP/(TP+FN)), специфичность (TN/(TN+FP)) и показатель F1 (среднее гармоническое значение точности и полноты). Для задач с более чем двумя классами матрица становится размером N на N, где диагональ содержит правильные предсказания, а недиагональные ячейки точно показывают, какие классы с какими другими путаются.

Техническая информация

Сила матрицы в том, что она сохраняет структуру ошибок, скрываемую одним числом точности. Две модели с одинаковой точностью 90% могут иметь совершенно разные показатели ложноотрицательных результатов, что имеет огромное значение, когда пропущенный диагноз рака стоит больше, чем ложная тревога. По соглашению строки часто представляют истинные классы, а столбцы — предсказанные классы (хотя некоторые библиотеки меняют это), поэтому всегда проверяйте метки осей перед вычислением точности по сравнению с отзывом из ячеек.

Стратегическое воздействие

Более четкие решения

Это поможет вам отделить четкие технические заявления от маркетингового языка.

Стоимость и бюджет

Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.

Команда и рабочий процесс

Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.

Будущее матриц путаницы

Матрицы путаницы останутся основополагающими, но инструменты делают их богаче: интерактивные нормализованные тепловые карты, разбивка по классам для больших наборов меток и матрицы, взвешенные по стоимости, которые умножают каждый тип ошибки на его реальный штраф. При аудите справедливости специалисты-практики теперь рассчитывают отдельные матрицы путаницы для каждой демографической подгруппы, чтобы выявить неодинаковую частоту ошибок. Ожидайте продолжения интеграции в информационные панели моделей, где при нажатии на ячейку будут показаны фактически неправильно классифицированные примеры для проверки.

Реальная реализация

Диагностика того, где классификатор изображений дает сбой, наблюдая, что он часто путает хаски с волками в недиагональных ячейках.

Аудит инструмента медицинского скрининга путем проверки ложноотрицательных результатов — пациентов с заболеванием, которое модель объявила здоровым.

Сравнение двух спам-фильтров электронной почты, которые имеют одинаковую точность, но различаются количеством реальных писем, которые они ошибочно блокируют (ложные срабатывания).

Оценка многоклассового распознавателя рукописных цифр и обнаружение того, что 4 и 9 чаще всего путают друг с другом.

Риски и ограничения

Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.

Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.

Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.

Дорожная карта реализации

1

Начните с простого определения желаемого результата.

2

Перед тестированием выберите один показатель успеха и одно условие отказа.

3

Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.

4

Документируйте, где матрицы путаницы помогают и где более простые методы лучше.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Confusion Matrices quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Перекрестная проверка

Часто задаваемые вопросы

Что такое матрицы запутанности?

Матрица путаницы — это простая таблица, которая разбивает прогнозы классификатора на правильные и неправильные значения для каждого класса. Это необработанное табло, на основе которого рассчитываются почти все остальные показатели классификации.

Что такое ложноотрицательный результат в двоичной матрице путаницы?

Ложноотрицательный результат — это фактически положительный результат, который модель пропустила, назвав его отрицательным — например, больной пациент объявлен здоровым.

Какой показатель измеряет долю фактических положительных результатов, которые правильно идентифицирует модель?

Напомним (также называемый чувствительностью или истинной положительной долей) — это TP / (TP + FN) — доля реальных позитивов, уловленных моделью.

Что представляют собой диагональные ячейки в матрице путаницы для задачи с 5 классами?

В матрице размером N на N диагональ содержит случаи, когда предсказанный класс соответствует истинному классу, т. е. правильные предсказания.

Почему сама по себе точность может вводить в заблуждение без матрицы путаницы?

Две модели с одинаковой точностью могут распределять свои ошибки совершенно по-разному; матрица путаницы показывает, являются ли ошибки в основном ложными тревогами или пропущенными позитивными событиями.

Показатель F1 является средним гармоническим значением каких двух показателей?

F1 объединяет точность и полноту в одно число, используя гармоническое среднее, что штрафует за большой дисбаланс между ними.