Benchmark / 证据
Jev Benchmark:先看方法,再看分数
每个实验都应该公开任务定义、样本版本、provider、model、延迟、失败案例和 fallback policy。
这些是方向性小样本实验,不是 Jev 的通用排行榜。
Jev 客服工单路由 Benchmark
用带人工标签的客服问题,检查队列 criteria、confidence 阈值和 fallback 是否真的能减少人工分诊。
数据字段待补:发布前请绑定数据集版本、运行日期、provider 与可复现结果。
Jev 垃圾信息识别 Benchmark
重点观察误杀正常消息、漏掉垃圾内容以及人工复核比例,而不是只公布一个看起来很高的总分。
数据字段待补:发布前请绑定数据集版本、运行日期、provider 与可复现结果。
Jev Prompt Injection 检测 Benchmark
用不同攻击类型检查 Jev 能否把可疑指令拦到人工复核,同时明确它只是 Agent 安全体系中的一层。
数据字段待补:发布前请绑定数据集版本、运行日期、provider 与可复现结果。