Benchmark / 实验详情
Jev 垃圾信息识别 Benchmark
重点观察误杀正常消息、漏掉垃圾内容以及人工复核比例,而不是只公布一个看起来很高的总分。
发布前检查
这页目前是 Benchmark 方法模板。补齐真实数据集、运行日期、provider、model、统计口径和复现链接后,再公开 F1、延迟与样本数。
把误杀成本单独列出来
将普通消息、明显垃圾内容和边界营销信息分组,分别统计 false positive、false negative、延迟和 review rate。
这组实验只提供方法模板。真正上线前,必须换成自己产品里的中文流量和政策标准。