사회 가이드

성별 음영 및 얼굴 인식 편견 감사

Gender Shades는 IBM, Microsoft 및 Face++의 상업용 얼굴 분석 시스템을 감사한 Joy Buolamwini와 Timnit Gebru의 2018년 연구입니다.

  • 4분 읽기
  • 마지막 업데이트
이 페이지에서4분 읽기
  1. 개요
  2. 심층 분석
  3. 전략적 영향
  4. 성별 음영 및 얼굴 인식 편향 감사의 미래
  5. 실제 구현
  6. 위험 및 가드레일
  7. 구현 로드맵
  8. 계속 탐색하세요
  9. 자주 묻는 질문

개요

연구 결과에 따르면 피부가 밝은 남성보다 피부색이 어두운 여성의 성별 분류가 훨씬 덜 정확하다는 사실이 밝혀졌습니다. 이 연구가 중요한 이유는 결과를 한 번에 하나씩이 아닌 결합된 속성별로 분류하는 교차 감사를 숨겨진 AI 오류를 노출하는 표준 방법으로 만들었기 때문입니다.

심층 분석

당시 MIT 미디어 랩의 Joy Buolamwini는 얼굴 감지 소프트웨어가 흰색 마스크를 쓰기 전까지는 얼굴을 인식하지 못한다는 사실을 발견했습니다. 그녀는 Timnit Gebru과 함께 구조화된 감사를 설계하고 이를 2018년 공정성, 책임 및 투명성 컨퍼런스에서 발표했습니다. 기존 벤치마크는 밝은 피부색의 남성이 지배했기 때문에 그들은 자체 파일럿 의회 벤치마크를 만들었습니다. 여기에는 아프리카 3개국과 유럽 3개국 국회의원의 이미지 1,270개가 포함되어 있으며 이진 성별과 피부과 전문의의 피츠패트릭 척도에 따른 피부 유형으로 분류되어 있습니다. 그들은 IBM, Microsoft 및 Face++의 성별 분류 서비스를 테스트했습니다. 세 가지 모두 여성보다 남성에게 더 좋은 결과를 보였고, 어두운 피부보다는 밝은 피부에 더 좋은 결과를 보였습니다. 두 가지가 겹치는 부분에서 최악의 결과가 나타났다. 피부색이 어두운 여성의 오류율은 최악의 시스템에서 약 35%에 달한 반면, 밝은 피부색의 남성은 1% 미만이었습니다. 단일 전체 정확도 수치가 이러한 격차를 숨겼습니다. Inioluwa Deborah Raji와 Buolamwini의 2019년 후속 보고서인 "Actionable Auditing"에서는 감사 대상 기업이 공개적으로 이름을 올린 후 격차가 줄어든 것으로 나타났습니다. Amazon를 포함하여 감사를 받지 않은 공급업체도 비슷한 차이를 보였습니다. Amazon는 방법론에 대해 이의를 제기했습니다. 일반적인 오해는 Gender Shades가 경찰이 사용하는 얼굴 식별을 측정했다는 것입니다. 성별 분류를 측정했습니다. 식별에 대한 증거는 약 200개의 알고리즘을 테스트한 NIST의 2019년 인구통계학적 영향 보고서에서 나왔습니다. 많은 사람들이 아프리카인과 동아시아인의 얼굴을 포함한 일부 그룹에 대해 종종 큰 요인으로 인해 더 높은 오탐률을 보인 반면, 가장 정확한 알고리즘은 훨씬 작은 차이를 보여주었습니다. 실제 피해가 뒤따랐습니다. 모두 흑인인 Robert Williams, Nijeer Parks 및 Porcha Woodruff는 각각 안면 인식 단서로 인해 잘못 체포되었습니다. 2020년 6월 IBM은 범용 안면 인식 사업을 떠날 것이라고 밝혔고, Amazon는 경찰의 Rekognition 사용을 중단했으며, Microsoft는 연방법이 제정될 때까지 미국 경찰에 판매하지 않겠다고 밝혔습니다.

전략적 영향

위험과 안전

치명적인 AI 피해와 일상적인 AI 피해는 누가 위험을 이해하고 누가 조치를 취할 수 있는지에 따라 달라집니다.

더 명확한 결정들

공공 및 전문 지식은 강력한 안전 정책이 정치적으로 가능한지 여부를 결정합니다.

과장된 과장을 뚫고 나가기

명확한 설명은 과대광고, 연구실 홍보, 모호한 윤리 연극에 의한 포착을 줄입니다.

성별 음영 및 얼굴 인식 편향 감사의 미래

얼굴 인식은 평균적으로 더 정확해졌으며 NIST의 지속적인 테스트에 따르면 주요 알고리즘의 경우 인구통계학적 차이가 사라지지는 않지만 줄어들고 다른 알고리즘의 경우 큰 차이가 유지되는 것으로 나타났습니다. 정책은 여전히 ​​단편화되어 있습니다. 미국의 일부 도시에서는 정부의 사용을 제한하고, EU AI법은 경찰이 공공 장소에서 실시간 원격 생체 인식을 식별하는 것을 엄격히 제한하고 있으며, 몇몇 공급업체는 일부 제품을 철수했습니다. 부당한 체포 사건으로 인해 경찰서는 성냥을 단서로만 처리하도록 계속해서 압박하고 있습니다. 세분화된 결과를 게시하고 공급업체를 명명하는 Gender Shades 방법은 이제 언어 및 이미지 생성기를 포함한 다른 AI 시스템을 감사하는 데 널리 사용됩니다.

실제 구현

제품 팀은 실패한 하위 그룹을 숨길 수 있는 하나의 헤드라인 번호를 게시하는 대신 피부가 어두운 여성, 피부가 어두운 남성, 피부가 밝은 여성 및 피부가 밝은 남성에 대한 얼굴 확인 정확도를 별도로 보고합니다.

디트로이트의 흑인 로버트 윌리엄스는 안면 인식 기능을 통해 운전면허증 사진과 물건을 훔치는 장면이 일치한 후 2020년 체포되었습니다. 혐의는 기각되었고 나중에 합의에 따라 그러한 성냥 사용에 대한 디트로이트 경찰의 규칙이 변경되었습니다.

오류 차이는 알고리즘마다 크게 다르기 때문에 공급업체를 승인하기 전에 시 조달청에서는 제공되는 특정 알고리즘 버전에 대한 NIST의 인구통계학적 테스트 결과를 확인합니다.

연구원은 출시 전에 새 얼굴 모델의 차이를 확인하기 위해 Pilot Parliaments Benchmark 접근 방식에 따라 피부 유형과 성별에 따라 균형을 맞춘 테스트 세트를 구축합니다.

위험 및 가드레일

  • 실존적 위험을 공상과학처럼 다루면서 능력을 합성합니다.

  • 높은 자율성 하에서 정렬과 표면 제품 안전성을 혼동합니다.

  • 영어가 아니거나 전문가가 아닌 청중에게는 품질이 낮은 소스만 남겨 둡니다.

구현 로드맵

  1. 제품 손상, 오용, 통제력 상실/잘못 정렬 위험을 분리합니다.

  2. 일정과 심각도에 대한 귀하의 견해를 바꿀 수 있는 증거가 무엇인지 물어보십시오.

  3. 마케팅 주장보다 기본 소스와 구체적인 평가를 선호하세요.

  4. 인식뿐만 아니라 경력, 정책, 자금 조달 또는 기술 등 하나의 행동 경로를 식별하십시오.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Gender Shades and Facial Recognition Bias Audits quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

성별 음영 및 얼굴 인식 편견 감사란 무엇입니까?

Gender Shades는 IBM, Microsoft 및 Face++의 상업용 얼굴 분석 시스템을 감사한 Joy Buolamwini와 Timnit Gebru의 2018년 연구입니다. 연구 결과에 따르면 피부가 밝은 남성보다 피부색이 어두운 여성의 성별 분류가 훨씬 덜 정확하다는 사실이 밝혀졌습니다. 이 연구가 중요한 이유는 결과를 한 번에 하나씩이 아닌 결합된 속성별로 분류하는 교차 감사를 숨겨진 AI 오류를 노출하는 표준 방법으로 만들었기 때문입니다.

원래 Gender Shades 연구에서 감사를 실시한 회사의 얼굴 분석 서비스는 무엇입니까?

2018년 연구에서는 IBM, Microsoft 및 Face++를 테스트했습니다. Amazon는 2019년 후속 조사에서 조사되었습니다.

파일럿 의회 벤치마크는 무엇으로 만들어졌나요?

벤치마크에는 성별과 피부 유형의 균형을 맞추기 위해 선택된 6개국 국회의원 이미지 1,270장이 사용되었습니다.

연구자들은 피부 유형을 표시하기 위해 어떤 척도를 사용했습니까?

그들은 피부과의 Fitzpatrick 척도를 사용했습니다. 일부 후기 작업에서는 Monk 스케일과 같은 더 넓은 스케일을 사용합니다.

Gender Shades는 실제로 어떤 작업을 측정했나요?

이 연구에서는 성별 분류를 측정했습니다. 일반적인 오해는 경찰이 사용하는 식별 시스템을 측정했다는 것입니다.

성별 차이에서 오류율이 가장 높은 하위 그룹은 무엇입니까?

피부색이 어두운 여성의 경우 두 특성이 겹치는 부분에서 오류가 최고조에 달해 최악의 시스템에서는 약 35%에 달했습니다.