置信度与概率(Confidence vs. Probability)
一句话定义:概率(Probability)是模型对”每个选项各有多可能”给出的完整分布;置信度(Confidence)是把这份分布压成一个 0–1 的数字,回答”这次判断有多确定”。 两者不是一回事,把置信度当成”正确率”会出事故。
1. 概率:一份分布
“All Score and Choice answers from TypeSafe include a
probabilitiesproperty representing the probability distribution across the options (for Choice) or levels (for Score). The shape of that distribution is what tells you how certain the model is: concentrated on one outcome means a confident answer, spread out means an uncertain one.”
翻译:TypeSafe 的所有 Score 与 Choice 答案都带一个 probabilities 属性,表示在各选项(Choice)或各档位(Score)上的概率分布。**这份分布的”形状”**才说明模型有多确定:集中在某一个结果上就是自信的答案,摊得很开就是不确定的答案。
2. 置信度:把分布压成一个数
“The answer’s
confidenceproperty collapses that shape into a single number from 0 to 1, so you can threshold on it without doing the math yourself. (Noul answers don’t carry one.)”
翻译:答案的 confidence 属性把这份形状压成一个 0 到 1 的单一数字,让你不用自己算就能设阈值。(Noul 的答案不带这个值。)
官方对”形状”如何决定高低有明确表述:
“All of it on one option gives 1.0; the more evenly it spreads, the lower the confidence.”
翻译:全部押在一个选项上得到 1.0;分布得越平均,置信度越低。
3. 官方近似公式
对 n 个选项,官方文档中演示用的近似公式为:
(n × 最高概率 − 1) ÷ (n − 1)
三选项时即 (3 × 最大概率 − 1) / 2(官方说明文字与脚本实现一致)。官方把它描述为一个方便的默认度量,但不锁定:
“We provide
confidenceas a convenient measure that fits most use-cases, but you are never locked into our definition.”
翻译:我们提供的 confidence 是一个适合多数用例的便捷度量,但你完全不必被我们的定义锁死。
因为响应里始终给全 probabilities,你可以按自己的场景换一套算法。
4. 谁带置信度,谁不带
| 原语(Primitive) | 返回字段 | 置信度 |
|---|---|---|
| Choice(选择题) | choice、probabilities、confidence | 有 |
| Score(打分题) | score、legend、probabilities、confidence | 有 |
| Noul(是非题) | noul(0–1 的概率) | 无 |
“Noul has no separate
confidence.”
翻译:Noul 没有单独的 confidence。
原因:Noul 的答案本身就是一个 0–1 的概率,这个数已经把”有多确定”说完了——0.5 表示是/否概率相等,接近 1 是很强的是,接近 0 是很强的否。
5. 置信度高 ≠ 一定对
置信度描述的是模型关于自己这个答案的状态,不是答案正确的保证。这与 概率校准 的限定一致:校准是在一群预测上度量的,不保证单个答案。因此:
- 置信度 1.0 只说明分布几乎全压在一个选项上;
- 一个被误读的题目同样可以拿到很高的置信度;
- 阈值必须用你自己的数据验证。
6. 怎么当红绿灯用
官方给出的三段式用法:
- 高置信度:自动执行(act automatically)。
- 中置信度:谨慎推进——请用户确认、标记复核、或先补充信息。
- 低置信度:不行动——转人工、请求澄清、或回退到另一个系统。
阈值随风险变化。官方示例中:低于 0.5 一律转人工;“查余额”这类可恢复的动作可以直接做;“批准转账”这类破坏性动作要置信度高于 0.9 才执行。
对 Noul,阈值写在你的代码里,官方给的默认参考是 0.5:是/否代价相当时用 0.5;误报代价高(如退款、呼叫值班)就调高;漏报代价高(如漏掉安全问题)就调低。
7. 与 Jev 的关系
- 置信度是 Jev 相对 LLM 的差异点之一。官方博客称 LLM”即使被要求,也倾向于过度自信且不一致”,而 Jev”每个输出都沟通置信度与不确定性”,且”更高的置信度意味着更高的准确率”(官方声称)。
- 只有判断类原语(Choice/Score)带置信度,这也决定了它在工作流里的用法:模型只判断,阈值门控与分支留给代码,见 工具调用 与 双系统理论。
相关来源
confidence.md—— 概率与置信度的定义、近似公式、三段式用法primitives.md—— 三种原语的返回字段对照primitives__noul.md—— Noul 的概率语义与阈值建议o04-blog-sysone.txt—— LLM 过度自信 vs. Jev 校准置信度的对照o01-home.txt—— “每个决策都带置信度估计”的官方主张