概率校准(Calibration)
一句话定义:校准(Calibration)是让模型报出的概率与真实发生率对得上的性质——被赋予 0.2 概率的那些预测,大约有 20% 真的会发生。它是”模型的不确定性可以被软件直接使用”的前提。
1. 官方定义:0.2 的事应约 20% 发生
TypeSafe 官方在 AI primer 中给出可检验的定义:
“Calibration makes uncertainty usable by software. Across many predictions from a well-calibrated model: Outcomes assigned a probability of
0.2should occur about 20% of the time. Outcomes assigned a probability of0.8should occur about 80% of the time. Outcomes assigned a probability of1.0should occur 100% of the time.”
翻译:校准让不确定性变得可被软件使用。在一个校准良好的模型的大量预测中:被赋予 0.2 概率的结果应约 20% 的时间真的发生;被赋予 0.8 的应约 80%;被赋予 1.0 的应 100% 发生。
三档是同一个规律:说出什么数,就该出现多大频率。
2. 校准是在”一群预测”上度量的,不保证单个答案正确
官方紧接着给出最关键的限定:
“These rates describe groups of predictions, not a guarantee about any single answer.”
翻译:这些比率描述的是一群预测,而不是对任何一个单独答案的保证。
系统一模型页的说法更直接:
“Calibration is measured across groups of predictions; it does not guarantee that an individual answer is correct.”
翻译:校准是在一群预测上度量的;它不保证某个单独答案是正确的。
这条限定决定了工程态度:哪怕某次置信度是 1.0,也只说明模型”押得很死”,不等于它一定对。 参见 置信度与概率。
3. 为什么它让不确定性可被软件使用
未校准模型给出的”把握度”不能进代码,因为数字和准确率之间没有稳定关系。官方博客描述的正是这个失效现象:
“Even if prompted for a confidence estimate, models tend to be overconfident and inconsistent. If a model can do a task 95% of the time but doesn’t say when it’s in the 5%, it can’t automate that task.”
翻译:即便被要求给出置信度估计,模型也倾向于过度自信且前后不一致。如果一个模型能以 95% 的概率做对一件事,却不说出自己何时落在那 5% 里,它就没法自动化这件事。
校准之后,概率变成一个可被阈值判断的信号:代码可以规定”高于某个数就自动执行,低于某个数就转人工”。这正是 置信度与概率 中”红绿灯”用法的前提。
4. 第三方发现:域外数据会过度自信
校准不是全局保证。独立第三方实测发现,Jev 在公开数据集上表现接近校准,但遇到分布之外的规则时会偏过度自信。awesome-typesafe.md 收录的 jev-ood-calibration 结论:
“probabilities were near calibrated on the public sets but overconfident on an unseen priority rule, while the Boolean question showed a different error direction.”
翻译:在公开数据集上概率接近校准,但在一条未见过的优先级规则上过度自信,而布尔型问题表现出不同的误差方向。
该条目自带的限定:合成任务只覆盖一个家族,且网关没有暴露固定的模型版本。另一条 jev-calibration-audit 也强调,其”强弃权(abstention)“结论来自 KoBBQ 数据集,不是普适的校准保证。
5. 与 Jev 的关系
- Jev 的训练目标就是校准:RLCD 优化”诚实的概率”,而不是人类偏好或可验证奖励。见 RLCD。
- 校准是 Jev 返回”概率分布 + 置信度”的底层依据,见 置信度与概率。
- 官方把”为校准决策而训练”列为系统一模型区别于 LLM 的核心特征(见 双系统理论)。
- 实践建议:上线前用自己的数据画”置信度 vs 准确率”曲线来设阈值,不要照抄别人的数字。
相关来源
introduction__machine-learning-primer.md—— 校准定义与三档概率concepts__system-one.md—— “不保证单个答案正确”的官方表述confidence.md—— 置信度如何从概率推导o04-blog-sysone.txt—— 未校准模型的过度自信问题awesome-typesafe.md—— 第三方域外校准研究(jev-ood-calibration、jev-calibration-audit)