基本ガイド

精度と再現率

精度と再現率は、特にクラスの不均衡がある場合に、分類器を評価するための 2 つの補完的な指標です。

2分の読書最終更新日

概要

Together they reveal what plain accuracy hides — how often a model's positive predictions are right, and how many real positives it actually catches.

ディープダイブ

モデルが項目に肯定的なフラグを立てる場合、2 つの質問が重要になります。精度は、私たちがフラグを立てたすべてのもののうち、どれだけが本当に陽性であったかを問うものです。これは、真の陽性者数をすべての予測陽性者数で割ったものに等しく、誤報にペナルティを与えます。想起(感度)は次のように問います。世の中に存在するすべての真の陽性者のうち、何人を捕まえたでしょうか?これは、真の陽性をすべての実際の陽性で割ったものに等しく、ミスにペナルティが課されます。これらは通常、トレードオフになります。判定しきい値を下げると、より多くの陽性結果が検出されますが (再現率が高くなります)、より多くのジャンク信号が検出されます (精度が低くなります)。またその逆も同様です。どちらを優先するかはコストによって決まります。スパム フィルターは正確性 (本物のメールをゴミ箱にしない) を優先するのに対し、がん検査は再現性 (腫瘍を見逃さない) を優先します。 F1 スコア、つまりそれらの調和平均は、両方を 1 つの数値でバランスさせます。

技術的な洞察

どちらの指標も混同行列の真陽性 (TP)、偽陽性 (FP)、および偽陰性 (FN) から取得されます: 精度 = TP / (TP + FP)、再現率 = TP / (TP + FN)。特に、どちらも真の陰性を使用していないため、陰性の数が陽性の数を大幅に上回っている場合でも有益な情報が得られます。分類しきい値をスイープすると、適合率と再現率の曲線が追跡されます。その下の領域 (平均精度) はパフォーマンスを要約しており、非常に不均衡なデータでは ROC-AUC よりも優先されます。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

精度と再現率の未来

AI が医療診断、コンテンツ管理、不正行為といった一か八かの分野に参入するにつれて、チームはますます精度だけではなく精度と再現率 (およびその曲線) を報告し、現実世界のコストと公平性の制約に合わせてしきい値を調整します。グループごとの精度/再現率監査は、人口統計全体で異なるエラー率を検出するための標準になりつつあります。より豊富なコスト重視のメトリクス、校正された確率、および利害関係者がデフォルトの 0.5 しきい値を受け入れるのではなく対話的に操作点を選択できるツールが期待されます。

現実世界の実装

スパム フィルターは高精度に調整されるため、正規の電子メールが誤ってスパム フォルダーに送信されることはほとんどありません。

医療スクリーニング検査では、実際に疾患を患っている患者を見逃さないように高再現率を優先し、追跡調査のためにより多くの偽陽性を受け入れます。

検索および推奨システムは、ランキングの品質を測定するために、precision@k (上位 k 件の結果のうち関連するものがいくつあるか) を報告します。

誤報と不正の見逃しはどちらもコストがかかるため、不正検出では F1 スコアを介して精度と再現率のバランスがとれます。

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

精度と再現率が役立つ部分と、より単純な方法の方が優れている部分を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Precision and Recall quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

精密医療における Tempus AI

よくある質問

What is Precision and Recall?

精度と再現率は、特にクラスの不均衡がある場合に、分類器を評価するための 2 つの補完的な指標です。これらを組み合わせることで、単純な精度に隠されているもの、つまりモデルの肯定的な予測がどれくらいの頻度で当たるか、そしてモデルが実際にどれだけの実際の肯定的な予測を検出するかが明らかになります。

What is next for Precision and Recall?

AI が医療診断、コンテンツ管理、不正行為といった一か八かの分野に参入するにつれて、チームはますます精度だけではなく精度と再現率 (およびその曲線) を報告し、現実世界のコストと公平性の制約に合わせてしきい値を調整します。グループごとの精度/再現率監査は、人口統計全体で異なるエラー率を検出するための標準になりつつあります。より豊富なコスト重視のメトリクス、校正された確率、および利害関係者がデフォルトの 0.5 しきい値を受け入れるのではなく対話的に操作点を選択できるツールが期待されます。

精度はどの質問に答えますか?

精度 = TP / (TP + FP) は、モデルの肯定的な予測の正確さ、つまり肯定的なフラグがどの程度信頼できるかを測定します。

非常に不均衡なデータセットでは、単純な精度よりも精度と再現率が優先されるのはなぜですか?

どちらの指標も真陰性を使用しないため、精度のように、大規模で予測しやすい陰性クラスによって水増しされることはありません。