Jev 替代品

Kev

保住官方 SDK 不动的那条 drop-in 路线

一句话结论

当目标是"不动业务代码就替掉托管 Jev 调用"时选 Kev:它说同一套 `/v1/systemone` 线格式,改 base URL 后官方 TypeSafe SDK 直接可用。但要预期自动化覆盖率只有约 0.45–0.57(5% 错误预算下),而 Jev 是 0.70;知识类任务差距更大,而且那来自基座模型而非适配器。

Kev 是 Jared Palmer 做的一组 rank-16 LoRA 适配器加指针头,基座是 Qwen3.5。它从 Kev-0.5B 起步,长成了 0.8B / 4B / 9B 以及一个 27B 变体。它真正的卖点不是准确率,而是实现了 TypeSafe 自己的 POST /v1/systemone 契约——改一个 base URL,官方 SDK 原样可用。

Adapt a large model

Keep the LLM as the backbone and bolt a decision structure onto it — LoRA adapters or a pointer head — so one prefill answers every question.

搜索别名

kevKev-0.5Bkev-0.8bkev-4bkev-9bkev-latestjaredpalmer/kev

关键规格

Licence
Apache-2.0
Author
Jared Palmer
Backbone
Qwen3.5 + rank-16 LoRA + 指针头 · 0.8B / 4B / 9B,另有 27B 变体
Size
4B 约 9GB · 27B 约 55GB
Latency
MLX 重复 state 47ms、新 state 77ms · H100 上 18.1ms · M5 上 721ms
Wire format
TypeSafe POST /v1/systemone,原样兼容
Install
uv sync --extra serve

Kev 对 Jev:用 Kev 自己公布的败绩说话

均为第三方或项目自述数字。Kev 的自我评测对标定问题异常坦诚,这也是本页能写得具体的原因。

Kev 对 Jev:用 Kev 自己公布的败绩说话KevJev
未见过的来源上0.822(9B)· 0.848 / 0.896(27B)0.857
自信错误率4.0%3.7%
5% 错误预算下的自动化覆盖率0.45–0.570.70
知识类任务(MMLU-Pro)0.515 —— 基座模型的天花板,不是适配器问题0.840
接入成本改一个 base URL,SDK 不动需要等候名单与 API key

什么时候该选 Kev

Kev 是整个开源生态里迁移路径最短的一条。如果你的代码已经在调 TypeSafe SDK,而你真正在意的是数据不出域、单次成本或限流,改 base URL 就是一行改动,其他一切照旧。中端显卡上的 4B 是实用甜点;MLX 后端让 Mac 变得可行——从旧 PyTorch MPS 路径的 213ms 降到重复 state 的 47ms。

什么时候该放弃它

知识密集型的判断不要用 Kev。MMLU-Pro 0.515 对 Jev 0.840,这是基座模型的天花板,加多少适配器训练都补不上。也不要直接采信它的准确率:那是用它自己的协议在留出来源上测的,而其他每个开源项目都用不同协议——这正是同一周里冒出四个互不相容的"Jev 分数"的原因。

三步接入 Kev

01装好并起服务:克隆仓库,`uv sync --extra serve`,然后 `python -m kev.serve --run jaredpalmer/kev-0.8b`。
02把官方 SDK 指过来:将 TypeSafe base URL 改成你本机端口,业务代码零改动。
03拿生产流量双跑一周(shadow mode),再在固定错误预算下比自动化覆盖率——决定能不能切换的是这个数字,不是准确率。
bash / drop-in
# 1. 本地起一个 Kev checkpoint
git clone https://github.com/jaredpalmer/kev.git && cd kev
uv sync --extra serve
KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve \
  --run jaredpalmer/kev-0.8b --port 8009

# 2. 用与 Jev 相同的请求形状调用
curl -s localhost:8009/v1/systemone \
  -H 'content-type: application/json' \
  -d '{
    "model": "kev-latest",
    "state": "鞋子到得晚,而且尺码发错了。",
    "questions": {
      "department": {
        "type": "choice",
        "instructions": "该由哪个团队处理?",
        "criteria": {
          "returns": "换货、退款、破损商品",
          "shipping": "物流状态、延误",
          "billing": "扣款、发票"
        }
      }
    }}'
因为线格式一致,已有的 TypeSafe SDK 客户端只需改 base URL 就能指过来。

关于 Kev 的常见问题

Kev 真的能当 Jev 的平替吗?

线格式上可以。它实现了 TypeSafe 的 POST /v1/systemone,接受同样的 state 与 choice / score / noul 结构,改 base URL 后官方 SDK 可用。质量上不等价:留出来源上的准确率落后几分,5% 错误预算下的自动化覆盖率 0.45–0.57 对 0.70,知识类问题落后更多。

该跑哪个 Kev checkpoint?

中端显卡上选 4B 最实用:9B 的收益不值那两倍显存,27B 要 55GB 左右。最早的 Kev-0.5B 仍然存在,也是早期文章点名的那个,但项目后来已经转到 0.8B / 4B / 9B,所以旧对比可能测的根本不是同一个模型。

为什么 Kev 在 Mac 上很慢?

以前确实慢。旧的 PyTorch MPS 路径上同一请求约 213ms;2026 年 9 月加入的 MLX 后端把它降到新 state 77ms、重复 state 47ms,代价是首次调用有 3.2 秒的一次性开销。

能用我自己的决策数据微调 Kev 吗?

这正是它的设计工作流——适配器很小,训练路径有文档。但先测自己的留出集:项目公布的数字用的是它自己的协议,而这个生态里的跨项目对比出了名地不一致。

来源

本页所有对比数字均为第三方公开口径或对公开仓库的阅读,不是本站实测。我们没有对 TypeSafe Jev 本体做过实测,且其主客户协议禁止利用其输出开发同类产品。