ДалееСледующее руководство
Оценка CLIP и показатели человеческих предпочтений
Технический
Техническое РУКОВОДСТВО
Метрики групповой справедливости измеряют, различаются ли решения или ошибки модели в разных демографических группах.
Демографический паритет сравнивает показатели отбора, равные возможности сравнивают истинно положительные показатели, уравненные шансы сравнивают как истинные, так и ложноположительные показатели, а прогнозирующий паритет сравнивает точность. Эти определения имеют значение, поскольку могут противоречить математически, поэтому выбор одного из них — это оценочное суждение о том, какой вид несправедливости имеет наибольшее значение в конкретном случае использования.
Возьмем модель кредита и две группы A и B по 100 заявителей в каждой. В случае А 50 выплатят долг; в Б — 20 бы. Модель утверждает 40 человек в группе А (35 человек, которые будут платить, 5 человек, которые не будут платить) и 20 человек в группе Б (14 человек, которые будут платить деньги, 6 человек, которые не будут платить). Демографический паритет сравнивает показатели отбора: 40% против 20%. Коэффициент 0,5 находится ниже порога в четыре пятых (0,8), указанного в руководящих принципах США по трудоустройству, поэтому он не соответствует действительности. Равные возможности сравнивают истинно положительные показатели (TPR), долю одобренных квалифицированных людей: 35/50 = 0,70 и 14/20 = 0,70. Это удовлетворено. Уравненные шансы (Хардт, Прайс и Сребро, 2016) также требуют равных коэффициентов ложноположительных результатов (FPR): 5/50 = 0,10 против 6/80 = 0,075. Близко, но не равно. Прогностическая четность сравнивает точность или положительную прогностическую ценность (PPV): 35/40 = 0,875 против 14/20 = 0,70. Это терпит неудачу. Когда базовые ставки различаются, как в данном случае, несовершенный классификатор, как правило, не может одновременно удовлетворять нескольким определениям. Чоулдехова (2017) и Кляйнберг, Муллайнатан и Рагхаван (2016) доказали версии этого: при неравных базовых показателях прогностическая четность или калибровка не могут сосуществовать с равными ложноположительными и ложноотрицательными показателями, за исключением ухудшенных случаев, таких как идеальное предсказание. Дебаты по COMPAS и были именно этим конфликтом. Выбор метрики зависит от контекста. Демографический паритет подходит для случаев, когда сами ярлыки могут быть предвзятыми или когда целью является равный доступ. Равные возможности подходят для случаев, когда отсутствие квалифицированного специалиста является основным вредом. Уравненные шансы усиливают беспокойство по поводу ложных обвинений. Прогнозируемая четность или калибровка имеют значение, когда лица, принимающие решения, воспринимают оценку как вероятность. Распространенным заблуждением является то, что удаление атрибута protected делает модель справедливой. Связанные прокси-серверы, такие как почтовый индекс, могут нести одну и ту же информацию.
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Групповые показатели все чаще учитываются при аудите и регулировании. Например, закон Нью-Йорка об автоматизированных инструментах принятия решений о приеме на работу требует проведения проверок предвзятости, в которых сообщаются коэффициенты воздействия. Продолжаются исследования индивидуальной справедливости, причинной справедливости и справедливости генеративных моделей, где результатами являются тексты, а не решения «да» или «нет», а стандартные показатели не применяются напрямую. Результаты невозможности являются математическими и никуда не исчезнут. Будущий прогресс, скорее всего, будет достигнут за счет более четкой маркировки, лучшего документирования того, какие компромиссы были выбраны и почему, а также вклада заинтересованных сторон, чем за счет единого универсального показателя.
При приеме на работу продвигаются 40% кандидатов из одной группы и 20% из другой. Коэффициент 0,5 находится ниже эмпирического правила четырех пятых, используемого в анализе дискриминации при приеме на работу в США, что свидетельствует о проблеме демографического паритета.
Модель медицинского скрининга выявляет 70% истинных случаев в обеих группах. Это обеспечивает равные возможности, хотя степень отбора в группах различается.
Анализ инструмента COMPAS по борьбе с рецидивами, проведенный ProPublica в 2016 году, показал, что у чернокожих обвиняемых наблюдался более высокий уровень ложноположительных результатов. Поставщик ответил, что его оценки имеют одинаковую прогностическую ценность для разных групп. Спор показал, что два показателя справедливости находятся в прямом противоречии.
Специалист по данным использует MetricFrame Fairlearn, чтобы разбить точность, уровень выбора и уровень ложных срабатываний по группам. Затем она применяет ThresholdOptimizer для установки пороговых значений для конкретной группы, удовлетворяющих уравненным шансам.
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Метрики групповой справедливости измеряют, различаются ли решения или ошибки модели в разных демографических группах. Демографический паритет сравнивает показатели отбора, равные возможности сравнивают истинно положительные показатели, уравненные шансы сравнивают как истинные, так и ложноположительные показатели, а прогнозирующий паритет сравнивает точность. Эти определения имеют значение, поскольку могут противоречить математически, поэтому выбор одного из них — это оценочное суждение о том, какой вид несправедливости имеет наибольшее значение в конкретном случае использования.
Демографический паритет сравнивает показатели отбора. Коэффициент 0,5 не соответствует этому требованию и падает ниже порога в четыре пятых.
Равные возможности требуют, чтобы квалифицированные люди утверждались с одинаковой скоростью, что является истинным положительным показателем.
Уравненные шансы требуют как равных истинных положительных результатов, так и равных ложных положительных результатов во всех группах.
FPR равен ложноположительным результатам, разделенным на все действительные отрицательные результаты. В группе B 100 заявителей, 20 из которых будут погашены, что дает 80 фактических отрицательных результатов.
При неравных базовых ставках эти критерии конфликтуют, за исключением вырожденных случаев, таких как идеальный предиктор. Дебаты по COMPAS показали этот конфликт на практике.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Оценка CLIP и показатели человеческих предпочтений
Технический