기술 가이드

평균 정밀도 및 PR-AUC

평균 정밀도는 결정 임계값에 따라 재현율이 증가함에 따라 모델의 정밀도를 요약합니다.

  • 3분 읽기
  • 마지막 업데이트
이 페이지에서3분 읽기
  1. 개요
  2. 심층 분석
  3. 전략적 영향
  4. 평균 정밀도와 PR-AUC의 미래
  5. 실제 구현
  6. 위험 및 가드레일
  7. 구현 로드맵
  8. 계속 탐색하세요
  9. 자주 묻는 질문

개요

정밀도-재현율 곡선은 긍정적인 경우가 드물 때 유용하지만 평균 정밀도와 해당 곡선 아래의 사다리꼴 면적은 명확하게 명명되어야 하는 다른 계산입니다.

심층 분석

정밀도는 선택된 사례 중 몇 개가 긍정적인지 묻습니다. Recall은 전체 긍정적 사례 중 몇 개가 선택되었는지 묻습니다. 모델의 점수 임계값이 낮아지면 더 많은 케이스가 선택한 세트에 입력됩니다. 임계값이 낮아진다고 재현율이 줄어들 수는 없지만 새로 포함된 사례에 따라 정밀도가 높아지거나 낮아질 수 있습니다. 정밀도-재현율 곡선은 이러한 상충관계를 추적합니다. 이는 선택된 항목 중 얼마나 많은 항목이 잘못된 경보인지 직접 노출하므로 희귀 양성 클래스에 특히 유용합니다. 수신기 작동 특성 곡선은 분모에 실제 부정이 모두 포함되는 위양성 비율을 사용하여 다른 질문에 답합니다. 두 관점 모두 실제 결정 비용을 고려할 필요성을 제거하지 않습니다. 평균 정밀도는 해당 재현율 증가에 따라 정밀도 값에 가중치를 부여하여 정밀도-재현율 관계를 요약합니다. 동점 점수가 없는 단순 순위에서는 긍정적인 사례가 차지하는 순위의 평균 정밀도와 같습니다. 두 개의 긍정적인 결과가 첫 번째와 세 번째에만 나타난다고 가정해 보겠습니다. 해당 위치의 정밀도는 1/3이므로 평균 정밀도는 약 0.833입니다. PR-AUC 레이블은 모호할 수 있습니다. 일부 보고서는 재현율에 대한 정밀도의 사다리꼴 통합을 의미합니다. 다른 사람들은 평균 정밀도를 위해 느슨하게 사용합니다. Scikit-learn은 사다리꼴 규칙을 적용하는 auc와 Average_precision_score를 구별합니다. 보간 가정이 다르기 때문에 이러한 값은 다를 수 있습니다. 실제 계산을 기술하십시오. 정확성은 평가 모집단의 양성 비율에 따라 달라집니다. 균형 잡힌 표본의 점수는 긍정적인 결과가 거의 나오지 않는 배포 설정을 설명하지 못할 수도 있습니다. 긍정적인 부분과 평가 설계를 보고합니다. 마지막으로 임계값에 대한 요약에서는 작동 임계값을 선택하지 않습니다. 모델이 실제로 사용될 시점에서 정밀도, 재현율, 작업량 등을 검사합니다.

전략적 영향

비용 및 예산

아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.

더 명확한 결정들

기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.

품질 관리

더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.

평균 정밀도와 PR-AUC의 미래

평가 대시보드는 요약 점수 옆에 긍정적인 확산율, 정확한 영역 계산 및 실제 운영 포인트를 표시하여 순위 지표를 더욱 명확하게 만들 수 있습니다. 검토 팀은 고정된 일일 용량 내에서 얼마나 많은 유용한 사례가 나타나는지 가장 중요하게 생각하는 반면 다른 팀은 최소한의 리콜이 필요할 수 있습니다. 예측과 레이블을 보존하면 모델을 변경하지 않고도 해당 질문을 다시 검토할 수 있습니다. 모집단이 이동함에 따라 팀은 이전의 평균 정밀도 결과가 동일한 미래의 작업량이나 유용성을 보장한다고 가정하기보다는 대표 데이터에 대한 절충안을 재평가해야 합니다.

실제 구현

검토 대기열에는 많은 일반 항목과 몇 가지 관련 항목이 포함되어 있습니다. 정밀도-재현율 곡선은 더 관련성 있는 항목을 찾는 것과 검토자에게 더 관련 없는 항목을 검사하도록 요청하는 것 사이의 균형을 보여줍니다.

동률이 없는 가상 순위에서는 두 개의 긍정적 사례가 첫 번째와 세 번째로 나타납니다. 해당 위치의 정밀도는 1과 2/3이므로 평균 정밀도는 약 0.833입니다.

팀은 라벨 및 예측 점수에 scikit-learn의average_precision_score를 사용합니다. 어떤 클래스가 긍정적인 것으로 간주되는지 기록하고 평가 전에 점수를 어려운 결정으로 대체하는 것을 방지합니다.

두 개의 평가 데이터 세트에는 서로 다른 비율의 긍정적 사례가 포함되어 있습니다. 분석가는 정밀도-재현율 결과를 비교하기 전에 이러한 비율을 보고합니다. 왜냐하면 보급률에 따라 정밀도를 해석하는 방법이 달라지기 때문입니다.

위험 및 가드레일

  • 하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.

  • 인프라 및 유지 관리 비용은 종종 과소평가됩니다.

  • 시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.

구현 로드맵

  1. 구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.

  2. 현실적인 로드 및 데이터 조건에서 벤치마킹합니다.

  3. 오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.

  4. 확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Average Precision and PR-AUC quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

평균 정밀도와 PR-AUC란 무엇입니까?

평균 정밀도는 결정 임계값에 따라 재현율이 증가함에 따라 모델의 정밀도를 요약합니다. 정밀도-재현율 곡선은 긍정적인 경우가 드물 때 유용하지만 평균 정밀도와 해당 곡선 아래의 사다리꼴 면적은 명확하게 명명되어야 하는 다른 계산입니다.

선택한 검토 대기열에 대해 정밀도가 측정하는 수량은 무엇입니까?

정밀도는 선택한 세트의 순도를 측정합니다. 회상은 발견된 모든 긍정적인 부분의 비율을 측정합니다.

동점이 없는 순위에서는 유일한 긍정적인 점은 1위와 3위입니다. 다음 중 평균 정밀도는 무엇입니까?

정밀도는 첫 번째 양수에서는 1이고 두 번째 양수에서는 2/3입니다. 평균은 6분의 5, 약 0.833입니다.

사다리꼴 PR-AUC가 평균 정밀도와 다른 이유는 무엇입니까?

평균 정밀도는 재현율 증가에 따라 정밀도에 가중치를 부여하는 반면, 사다리꼴 통합은 다른 영역 구성을 사용하여 곡선 점을 연결합니다.

평균 정밀도에 필요한 순위 정보를 보존하는 입력은 무엇입니까?

점수를 통해 임계값을 기준으로 평가할 수 있습니다. 어려운 결정은 하나의 운영 포인트만 유지하고 대부분의 순위 정보를 폐기합니다.

두 데이터 세트의 포지티브 클래스 보급률은 매우 다릅니다. 정밀도-재현율 점수를 비교할 때 무엇을 동반해야 합니까?

정밀도는 계급 보급에 따라 달라지므로 모집단과 샘플링 방식은 필요한 맥락입니다.