技术指南

概率校准

校准意味着模型规定的概率与现实相符:当它说 70% 时,该事件应该在大约 70% 的情况下发生。

阅读时间:2分钟最后更新

概述

It matters because accurate confidence drives good decisions in medicine, finance, and risk-sensitive AI.

深入探讨

模型可能很准确,但校准很差。现代深度网络因过度自信而臭名昭著,其输出 99% 的预测正确率要低得多。校准通过按置信度对预测进行分桶并检查每个桶中观察到的频率来对此进行审核。可靠性图绘制了预测与实际情况;完美校准的模型位于对角线上。预期校准误差 (ECE) 将差距总结为各箱的加权平均值。修复有两种形式:事后方法,如 Platt 缩放(拟合逻辑变换)、温度缩放(用学习的标量 T 除 logits)和等渗回归(单调逐步拟合);以及训练时方法,例如标签平滑或适当的评分损失。校准和准确性是不同的目标,改进其中一个目标并不需要改进另一个目标。

技术洞察

温度缩放是神经网络的主力:将 softmax 之前的 logits 除以单个学习温度 T,然后重新进行 softmax。 T > 1 会软化过度自信的分布,T < 1 会锐化它们。至关重要的是,T 适合验证数据,以最大限度地减少负对数似然,并且永远不会改变哪个类别获胜,因此准确性不会受到影响,而概率会变得诚实。它的单一参数使其数据高效并且几乎不可能过度拟合。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

概率校准的未来

随着人工智能进入高风险循环,校准从事后想法转变为要求。工作正在扩展到校准大型语言模型置信度和言语不确定性、分布变化下的校准以及分组校准,以便各个子群体的概率是公平的。期望校准指标以及模型卡和监管审计的准确性,再加上与保形预测和选择性预测的更紧密集成,以便系统在诚实信心较低时能够可靠地弃权。

现实世界的实施

气象服务可确保预测降雨量为 30% 的日子里,实际有 30% 的时间会下雨,这是教科书的校准目标。

信用违约模型是有温度尺度的,因此规定的 5% 违约风险确实对应于定价贷款的 5% 历史违约率。

医疗诊断网络通过等渗回归重新校准,因此“疾病的高概率”反映了临床医生采取行动之前的真实发病率。

自动驾驶感知堆栈可校准对象检测置信度,因此规划模块会适当信任 90% 的行人得分。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Probability Calibration quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

AI信任校准

常见问题

What is Probability Calibration?

校准意味着模型规定的概率与现实相符:当它说 70% 时,该事件应该在大约 70% 的情况下发生。这很重要,因为准确的信心可以推动医学、金融和风险敏感型人工智能领域的良好决策。

温度缩放对神经网络的输出有何影响?

温度缩放将 logits 除以单个学习的 T 并重新应用 softmax,软化或锐化概率而不更改 argmax。

可靠性图绘制了什么?

可靠性图将预测置信度与实际结果频率进行比较;对角线代表完美的校准。

为什么高精度模型还需要校准?

模型可以很好地对预测进行排名(高精度),但会分配不匹配的概率值,因此必须单独检查校准。