Техническое РУКОВОДСТВО

Метрики справедливости ИИ: демографический паритет для уравненных шансов

Метрики групповой справедливости измеряют, различаются ли решения или ошибки модели в разных демографических группах.

  • 4 минуты чтения
  • Последнее обновление
На этой странице4 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее показателей справедливости ИИ: демографический паритет для уравнивания шансов
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Демографический паритет сравнивает показатели отбора, равные возможности сравнивают истинно положительные показатели, уравненные шансы сравнивают как истинные, так и ложноположительные показатели, а прогнозирующий паритет сравнивает точность. Эти определения имеют значение, поскольку могут противоречить математически, поэтому выбор одного из них — это оценочное суждение о том, какой вид несправедливости имеет наибольшее значение в конкретном случае использования.

Глубокое погружение

Возьмем модель кредита и две группы A и B по 100 заявителей в каждой. В случае А 50 выплатят долг; в Б — 20 бы. Модель утверждает 40 человек в группе А (35 человек, которые будут платить, 5 человек, которые не будут платить) и 20 человек в группе Б (14 человек, которые будут платить деньги, 6 человек, которые не будут платить). Демографический паритет сравнивает показатели отбора: 40% против 20%. Коэффициент 0,5 находится ниже порога в четыре пятых (0,8), указанного в руководящих принципах США по трудоустройству, поэтому он не соответствует действительности. Равные возможности сравнивают истинно положительные показатели (TPR), долю одобренных квалифицированных людей: 35/50 = 0,70 и 14/20 = 0,70. Это удовлетворено. Уравненные шансы (Хардт, Прайс и Сребро, 2016) также требуют равных коэффициентов ложноположительных результатов (FPR): 5/50 = 0,10 против 6/80 = 0,075. Близко, но не равно. Прогностическая четность сравнивает точность или положительную прогностическую ценность (PPV): 35/40 = 0,875 против 14/20 = 0,70. Это терпит неудачу. Когда базовые ставки различаются, как в данном случае, несовершенный классификатор, как правило, не может одновременно удовлетворять нескольким определениям. Чоулдехова (2017) и Кляйнберг, Муллайнатан и Рагхаван (2016) доказали версии этого: при неравных базовых показателях прогностическая четность или калибровка не могут сосуществовать с равными ложноположительными и ложноотрицательными показателями, за исключением ухудшенных случаев, таких как идеальное предсказание. Дебаты по COMPAS и были именно этим конфликтом. Выбор метрики зависит от контекста. Демографический паритет подходит для случаев, когда сами ярлыки могут быть предвзятыми или когда целью является равный доступ. Равные возможности подходят для случаев, когда отсутствие квалифицированного специалиста является основным вредом. Уравненные шансы усиливают беспокойство по поводу ложных обвинений. Прогнозируемая четность или калибровка имеют значение, когда лица, принимающие решения, воспринимают оценку как вероятность. Распространенным заблуждением является то, что удаление атрибута protected делает модель справедливой. Связанные прокси-серверы, такие как почтовый индекс, могут нести одну и ту же информацию.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее показателей справедливости ИИ: демографический паритет для уравнивания шансов

Групповые показатели все чаще учитываются при аудите и регулировании. Например, закон Нью-Йорка об автоматизированных инструментах принятия решений о приеме на работу требует проведения проверок предвзятости, в которых сообщаются коэффициенты воздействия. Продолжаются исследования индивидуальной справедливости, причинной справедливости и справедливости генеративных моделей, где результатами являются тексты, а не решения «да» или «нет», а стандартные показатели не применяются напрямую. Результаты невозможности являются математическими и никуда не исчезнут. Будущий прогресс, скорее всего, будет достигнут за счет более четкой маркировки, лучшего документирования того, какие компромиссы были выбраны и почему, а также вклада заинтересованных сторон, чем за счет единого универсального показателя.

Реальная реализация

При приеме на работу продвигаются 40% кандидатов из одной группы и 20% из другой. Коэффициент 0,5 находится ниже эмпирического правила четырех пятых, используемого в анализе дискриминации при приеме на работу в США, что свидетельствует о проблеме демографического паритета.

Модель медицинского скрининга выявляет 70% истинных случаев в обеих группах. Это обеспечивает равные возможности, хотя степень отбора в группах различается.

Анализ инструмента COMPAS по борьбе с рецидивами, проведенный ProPublica в 2016 году, показал, что у чернокожих обвиняемых наблюдался более высокий уровень ложноположительных результатов. Поставщик ответил, что его оценки имеют одинаковую прогностическую ценность для разных групп. Спор показал, что два показателя справедливости находятся в прямом противоречии.

Специалист по данным использует MetricFrame Fairlearn, чтобы разбить точность, уровень выбора и уровень ложных срабатываний по группам. Затем она применяет ThresholdOptimizer для установки пороговых значений для конкретной группы, удовлетворяющих уравненным шансам.

Риски и ограничения

  • Оптимизация одного теста может скрыть более широкие недостатки системы.

  • Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

  • Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

  1. Определите целевые показатели задержки, качества и стоимости перед внедрением.

  2. Тестирование при реалистичной нагрузке и условиях данных.

  3. Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

  4. Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI Fairness Metrics: Demographic Parity to Equalized Odds quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Что такое показатели справедливости ИИ: демографический паритет и уравненные шансы?

Метрики групповой справедливости измеряют, различаются ли решения или ошибки модели в разных демографических группах. Демографический паритет сравнивает показатели отбора, равные возможности сравнивают истинно положительные показатели, уравненные шансы сравнивают как истинные, так и ложноположительные показатели, а прогнозирующий паритет сравнивает точность. Эти определения имеют значение, поскольку могут противоречить математически, поэтому выбор одного из них — это оценочное суждение о том, какой вид несправедливости имеет наибольшее значение в конкретном случае использования.

В примере кредита, приведенном в руководстве, доля выбора группы A составляет 40%, а доля выбора группы B — 20%. Какой показатель это нарушает?

Демографический паритет сравнивает показатели отбора. Коэффициент 0,5 не соответствует этому требованию и падает ниже порога в четыре пятых.

Равные возможности требуют, какое количество будет равным во всех группах?

Равные возможности требуют, чтобы квалифицированные люди утверждались с одинаковой скоростью, что является истинным положительным показателем.

Что добавляют уравненные шансы помимо равных возможностей?

Уравненные шансы требуют как равных истинных положительных результатов, так и равных ложных положительных результатов во всех группах.

В этом примере уровень ложноположительных результатов в группе Б составляет 6 из 80. Почему знаменатель равен 80?

FPR равен ложноположительным результатам, разделенным на все действительные отрицательные результаты. В группе B 100 заявителей, 20 из которых будут погашены, что дает 80 фактических отрицательных результатов.

Что означают невозможности, полученные Чоулдеховой и Кляйнбергом и др. сказать?

При неравных базовых ставках эти критерии конфликтуют, за исключением вырожденных случаев, таких как идеальный предиктор. Дебаты по COMPAS показали этот конфликт на практике.