Benchmark / 实验详情

Jev 垃圾信息识别 Benchmark

重点观察误杀正常消息、漏掉垃圾内容以及人工复核比例,而不是只公布一个看起来很高的总分。

发布前检查

这页目前是 Benchmark 方法模板。补齐真实数据集、运行日期、provider、model、统计口径和复现链接后,再公开 F1、延迟与样本数。

把误杀成本单独列出来

将普通消息、明显垃圾内容和边界营销信息分组,分别统计 false positive、false negative、延迟和 review rate。

这组实验只提供方法模板。真正上线前,必须换成自己产品里的中文流量和政策标准。

相关页面