Benchmark / 实验详情

Jev 客服工单路由 Benchmark

用带人工标签的客服问题,检查队列 criteria、confidence 阈值和 fallback 是否真的能减少人工分诊。

发布前检查

这页目前是 Benchmark 方法模板。补齐真实数据集、运行日期、provider、model、统计口径和复现链接后,再公开 F1、延迟与样本数。

中文客服数据怎么测

按业务线保留真实表达、错别字和上下文缺失样本,固定 schema 后记录 provider、model、每类错误和进入人工分诊的比例。

当前数字是小样本示意,不代表 Jev 在所有客服系统里的通用效果,更不能直接当生产 SLA。

相关页面