什么是决策模型校准?
校准是模型报出的置信度与真实正确率之间的统计对齐:把所有报 70% 置信度的预测收拢起来,正确率在 70% 附近,模型就是校准的。对返回「类型化选项 + 概率」的决策模型来说,校准是阈值有意义的前提。「0.85 以上自动执行」是对你负载未来的断言,只有当 0.85 在你的标注上真的对应约 85% 正确率时才成立。
ECE(期望校准误差)怎么算?
把所有预测按置信度分桶(惯例十桶),算每桶内实际正确率与平均报出置信度之差,再按各桶样本占比加权平均。一个「报 0.9 必对、报 0.4 必错」的模型,即使整体准确率平平,ECE 也接近零——ECE 量的是诚实,不是能力。务必配着可靠性图一起读:两个 ECE 相同的模型可以在相反方向上失败,一个系统性过度自信,一个过度保守。
置信度高就代表可信吗?
不。Synthpop 审计是最干净的反例:在正确率仅 1% 的不可知问题上,模型仍报 32–36% 的置信度;跨过知识截止日期后正确率跌到抛硬币,置信度反而升到 82%。高置信度是一个主张,不是证据。只有当你在自己标注的负载上测过「这个置信度水平实际对过多少次」,它才变成证据——这正是本页五步工作流产出的东西。
怎么给自己的模型做校准?
从负载里冻结一个留出标注集,跑模型、记录全部概率、画可靠性图、算 ECE,然后只在曲线诚实的位置设自动/复核/人工阈值——并按季度复验,或每当模型版本或流量构成变化时复验。如果图形呈现温度缩放式的系统性形变,在校准集上拟合一个缩放因子会有帮助;如果是不可知问题上的高置信答案——即上面的审计失败——任何事后重校准都修不好,只能把这类问题路由给别的流程。
Jev 的置信度从哪来?
不是模型对自我的点评。一次 Jev 调用返回从你声明选项中选出的类型化答案,加上一次前向对全部选项的并行打分——置信度是决策契约的结构性输出,不是生成的散文。这让数字在冻结 schema 下可检查、可复现,也是我们的基准能按切片公布 ECE 的原因。但它不豁免审计:公开的 Synthpop 校准审计打的就是这个架构,并在知识边界处发现了高置信失败。
校准和准确率有什么区别?
准确率是模型对多少次;校准是它的置信度有没有如实告诉你它什么时候对。模型可以 95% 准确但校准稀烂(每个错误都盖着 0.99 的章),也可以只有 70% 准确但校准近乎完美(它稳定地知道自己在猜)。自动化对第二种性质的需求不亚于第一种:阈值、降级车道、审计存证全都建立在置信度上,而不是准确率上。