校准 · 置信度 · 证据

决策模型校准:每一条阈值都在默认它成立

决策模型能自动化到什么程度,取决于它的置信度能被信任到什么程度。本页讲清校准与 ECE 的口径,放出本站基准的可查数字,如实汇总四份质疑决策模型置信度的公开文献,并给出从校准集到审计车道的五步工作流。

速览

校准是模型报出的置信度与真实正确率之间的对齐:把模型所有报「0.80」的预测收拢起来,正确率应当就在 80% 附近。它从可靠性图上读出,再压缩成一个数字——期望校准误差(ECE)。没有校准的置信度无法给自动化兜底:「0.85 以上自动执行」只有在 0.85 真的代表约 85% 正确率时才成立。2026 年 10 月公布的一份 57.5 万次付费调用审计发现,某托管决策模型在正确率仅 1% 的不可知问题上仍报出 32–36% 的置信度——而且重校准修不好它。校准不是规格表上的参数,而是要在你自己的标注上、按模型逐个测量、并随负载漂移持续复验的性质。

本页第三方数字均引自具名公开文献(Synthpop.AI 与 Red Hat Developers,10 月 2 日;Cloudflare 官方博客,10 月 1 日;DoubtBench,10 月 4 日;anth.us,10 月 1 日,均为 2026 年)。厂商基准数字一律标注「厂商口径」,本站未独立复验。本站自有数字来自基准页上三个可复现的评测切片。

校准到底在测什么

每个预测都有两部分:答案,和挂在答案上的那个数字。校准说的是数字。当模型报出的置信度与经验正确率对齐时,它就是校准的——把所有报 0.70 的预测收拢起来打分,正确率应当落在 70% 附近。标准工具是可靠性图:按报出的置信度分桶,画出每桶的实际正确率,再与对角线比较;两条线之间的差距压缩成一个数字,就是期望校准误差(ECE)——基准世界的诚实度指标。

对类型化决策模型——横在软件逻辑前面的 Choice / Score / Noul 三原语层——校准不是锦上添花,而是一切下游模式的先决条件。Noul 的 yes/no 概率决定订单是否放行;Choice 的置信度决定工单自动流转还是等待人工;Score 决定内容是否发布。三种下游模式都把置信度当成概率来消费。如果 0.9 不代表「十对九」,那压在它上面的整架梯子——阈值、车道、降级链、审计存证——都只是装饰。

失败模式一:又自信又错

过度自信的模型在只有一半能答对的问题上报 0.95。你设的每一条阈值都在把垃圾放进自动车道,审计日志里塞满了「当时看起来很确定」的错误决策。这就是 Synthpop 审计在知识边界处记录的失败——见下一节。

失败模式二:校准了但胆小

过度保守的模型更安全但更贵:正确答案只报 0.55,什么都要进复核队列,自动化率塌向零。ECE 对两个方向对称惩罚——目标是一个可以拿来给决策定价的置信度,不是一个谦逊的置信度。

实测而非宣称:可查的数字

本站公布的评测切片把 ECE 与 Macro F1、尾部延迟并排报出。下面的客服路由切片是 204 条人工标注、schema 冻结的用例;三个切片合计 654 条,混淆矩阵与复现脚本全部公开。

ECE — 客服路由切片

0.048

经验诚实度误差,N = 204

Macro F1

78.4%

四大队列均衡

P95 延迟

410 ms

并发负载下

0.85 闸门处精确率

94.2%

自动流转 78.0% 流量

阈值曲线是校准变现的地方:置信度 ≥ 0.85 时,切片以 94.2% 精确率自动流转 78.0% 的流量;0.65–0.85 区间(16.5% 流量)进人工一键确认;低于 0.65(5.5%)永不自动流转。模型若没校准,这三条车道就是虚构——数字能成立,是因为置信度成立。

再看本站切片之外的量级:独立 49 任务基准(49 个任务、869 条用例,第三方所为,并非本站)给托管 Jev 打出 0.966 的 macro accuracy,最强开源模型约 0.704。注意两条轴不同:那张榜量的是准确率而非校准——这正是我们按切片公布 ECE、而不是只发一张天梯榜的原因。

完整方法学、混淆矩阵与可复现脚本,见本站基准页

置信度之争:四份公开质疑

2026 年 10 月的第一周,四份独立文献先后把决策模型的置信度放到台面上——一份审计、一个跨范式基准、一家把校准押为卖点的厂商、一个关于人类分歧的基准。以下逐一摘要,附来源与各家自述的限定条件。

synthpop.ai · 审计 · 2026-10-02

Synthpop.AI:57.5 万次调用审计

一项针对 57.5 万次付费 API 调用(约 11.5 亿 token、48 美元)的审计,对象是 Jev 1.13.0。在熟悉领域模型校准良好:筛出它自评 ≥0.90 的答案,正确率 99.75%、ECE 0.031。失败出现在知识边界。在正确率仅 1% 的不可知问题上,模型仍报 32–36% 的置信度;公平骰子题上,720 种选项排序它全押「one」,均值 0.80;跨过知识截止日期后,正确率跌到抛硬币水平(51%),置信度反而升到 82%。温度缩放与 Platt 重校准都修不好——24 个点的差距一直都在,用审计的原话说,数字本身不携带漂移信号。同一周,anth.us 发文《The OpenAI Decisions API needs a confidence you can trust》,指认 OpenAI 的预览版有同构的问题。

developers.redhat.com · 基准 · 2026-10-02

Red Hat:决策模型对传统分类器

Red Hat 的工程基准在四种范式下跑了九项护栏任务——前沿大模型、决策模型、微调分类器、LLM 评审。决策模型没有赢。提示词注入维度上,35B 开源大模型 89.31%,CPU 上的 deberta-v3 分类器 89.01%、耗时 54.1ms,Jev 是 86.35%、348.1ms;内容安全维度 Jev 以 86.20% 居首,决策模型阵营里的 Laya 却崩到 57.87%。作者结论——决策模型尚未兑现对 LLM-as-judge 或传统分类器「更快、更便宜、更准」的宣称——带着诚实的限定:跨大西洋延迟对远端 API 不利、策略未按模型逐一调优。如果你是来比较决策模型和分类器的,目前证据的诚实状态是:按任务看、有公开护栏、当前打平。

blog.cloudflare.com · 厂商评测 · 2026-10-01

Cloudflare Clef:把校准做成卖点

Cloudflare 携开放权重的 Clef 与 Clef-flash 进场,还配了一个以本页主题命名的微调服务:RLCD——面向校准决策的强化学习。其公布的基准把 Clef-flash 打到 BFCL 98.76、对 Jev 的 95.75,延迟 38.8ms 对 524.1ms。这些是厂商口径——厂商在发布周给自己阅卷——本站未独立复验。更有结构意义的信号是:这个品类最新最响的产品宣称恰恰是校准本身,说明本节的辩论已经打进了厂商层。

Show HN · 基准 · 2026-10-04

DoubtBench:模型知道人类何时产生分歧吗

2026 年 10 月 4 日发布的 DoubtBench 问了另一个问题:在人类对正确答案本身存在分歧的条目上,模型的置信度应该意味着什么?真值有争议时,笃定的单一答案就是错的形状——不确定性在世界里,不是模型缺陷。它是质疑线的第三块拼图,前两块是校准审计与跨范式基准,而它瞄准的是每一条阈值脚下的假设:每个输入都有唯一正确答案。

Jev 的置信度从哪来——以及两家厂商各自的回答

当聊天模型说「我不太确定」,那是一段关于概率的生成文本——模型用与其他一切输出相同的通道给自己做汇报。类型化决策模型的置信度则是结构性的:答案是你声明的决策契约里的固定选项,置信度是一次前向中对所有已声明选项的并行打分——没有可以打太极的散文通道,也没有可以被提示词操纵的自我报告。这并不等于数字已校准——上面的 Synthpop 审计打的就是这个架构——但它让数字可检查:每个声明选项一个数,schema 冻结即可复现,而这正是下面工作流第 1–4 步的原料。

两家厂商在两条轴上各自作答。TypeSafe 在文档中列明 Jev 1.13 的六类失败模式,并把托管模型校准到 90% 置信度对应十对九;独立邮件实测发现现实没那么整齐——同一张校准图上,Jev 的 ECE 是 0.134,claude-haiku-4.5 是 0.097——我们在「Jev 什么时候用」指南里完整拆过。Cloudflare 的回答是 RLCD:在训练时就强制校准,而不是事后测量。两者都是对移动目标的宣称:模型版本会变,校准数字只对被测的那个精确版本为真——本页所有置信度数字,包括我们自己的,都请当成需要在你自己的标注上复验的假设。

五步校准工作流

托管决策 API 和自托管编码器通用。第 1–4 步负责测量,第 5 步把测量变成车道。

  1. 01

    建校准集

    从你自己的负载里切出 200–500 条留出标注——与任何基准相同的金标纪律:多轮人工标注、判定标准冻结、边界案例真值无歧义。彻底留出:在训练分布上给模型打分,校准会显得比实际更好。

  2. 02

    跑预测并全量记录

    逐条发送并记录完整输出:选中选项、全部选项概率、报出的置信度、延迟、模型版本。记原始数而不是派生数——之后要重新分桶时,不必再给 API 付一遍钱。

  3. 03

    画可靠性图

    按报出的置信度分桶(惯例十等分桶),画出每桶实际正确率与对角线的关系。低于对角线的桶是过度自信,高于对角线的是过度保守。图形会告诉你修正是否可能——不可知问题上一条 32% 的平线,不是温度缩放能解决的问题。

  4. 04

    算 ECE,并与准确率并排报

    ECE 是各桶「置信度与正确率之差」按桶内样本量加权后的平均。把它放在 Macro F1 旁边发布,而不是替代它:模型可以校准良好但不准(它知道自己什么时候在猜),也可以很准但校准稀烂(对的理由自己都定不了价)。我们的切片两者都公布,就是这个原因。

  5. 05

    把曲线变成车道,然后审计

    只在图上置信度为真的位置设阈值:顶格闸门之上自动执行;中间带人工确认;跌破下限的永不自动化。然后把每条被闸门的决策连同置信度一起存为证据,并在模型变更时于 CI 里重放。

决策模型校准:常见问题

什么是决策模型校准?

校准是模型报出的置信度与真实正确率之间的统计对齐:把所有报 70% 置信度的预测收拢起来,正确率在 70% 附近,模型就是校准的。对返回「类型化选项 + 概率」的决策模型来说,校准是阈值有意义的前提。「0.85 以上自动执行」是对你负载未来的断言,只有当 0.85 在你的标注上真的对应约 85% 正确率时才成立。

ECE(期望校准误差)怎么算?

把所有预测按置信度分桶(惯例十桶),算每桶内实际正确率与平均报出置信度之差,再按各桶样本占比加权平均。一个「报 0.9 必对、报 0.4 必错」的模型,即使整体准确率平平,ECE 也接近零——ECE 量的是诚实,不是能力。务必配着可靠性图一起读:两个 ECE 相同的模型可以在相反方向上失败,一个系统性过度自信,一个过度保守。

置信度高就代表可信吗?

不。Synthpop 审计是最干净的反例:在正确率仅 1% 的不可知问题上,模型仍报 32–36% 的置信度;跨过知识截止日期后正确率跌到抛硬币,置信度反而升到 82%。高置信度是一个主张,不是证据。只有当你在自己标注的负载上测过「这个置信度水平实际对过多少次」,它才变成证据——这正是本页五步工作流产出的东西。

怎么给自己的模型做校准?

从负载里冻结一个留出标注集,跑模型、记录全部概率、画可靠性图、算 ECE,然后只在曲线诚实的位置设自动/复核/人工阈值——并按季度复验,或每当模型版本或流量构成变化时复验。如果图形呈现温度缩放式的系统性形变,在校准集上拟合一个缩放因子会有帮助;如果是不可知问题上的高置信答案——即上面的审计失败——任何事后重校准都修不好,只能把这类问题路由给别的流程。

Jev 的置信度从哪来?

不是模型对自我的点评。一次 Jev 调用返回从你声明选项中选出的类型化答案,加上一次前向对全部选项的并行打分——置信度是决策契约的结构性输出,不是生成的散文。这让数字在冻结 schema 下可检查、可复现,也是我们的基准能按切片公布 ECE 的原因。但它不豁免审计:公开的 Synthpop 校准审计打的就是这个架构,并在知识边界处发现了高置信失败。

校准和准确率有什么区别?

准确率是模型对多少次;校准是它的置信度有没有如实告诉你它什么时候对。模型可以 95% 准确但校准稀烂(每个错误都盖着 0.99 的章),也可以只有 70% 准确但校准近乎完美(它稳定地知道自己在猜)。自动化对第二种性质的需求不亚于第一种:阈值、降级车道、审计存证全都建立在置信度上,而不是准确率上。