Benchmark / 实验详情
Jev 客服工单路由 Benchmark
用带人工标签的客服问题,检查队列 criteria、confidence 阈值和 fallback 是否真的能减少人工分诊。
发布前检查
这页目前是 Benchmark 方法模板。补齐真实数据集、运行日期、provider、model、统计口径和复现链接后,再公开 F1、延迟与样本数。
中文客服数据怎么测
按业务线保留真实表达、错别字和上下文缺失样本,固定 schema 后记录 provider、model、每类错误和进入人工分诊的比例。
当前数字是小样本示意,不代表 Jev 在所有客服系统里的通用效果,更不能直接当生产 SLA。