替代品 / 选型决策

Jev 的替代品:一份不会被 star 数骗到的清单

把日志读数、专用编码器、改造大模型与扩散四条路线一次讲清。每个数字都标明来源,并附上各项目自己承认的失败边界——包括那个没人愿意提的事实:JevBench 曾两次在没有任何新测量的情况下改变分数。

速查:该用哪个替代品?

要迁移成本最低、代码不动——选 Kev(同一套 /v1/systemone 契约)。要 CPU 上跑、完全不要显卡——选 Von(395M,15ms 以内)。要复用你已经在跑的开源模型、完全不训练——选 SemIf 或 AnyJev。要在自己的标注上微调出最好的效果——选 Laya,并优先考虑它的后继者 cbjev(注意 GPL-3.0)。要紧密控制回路——选 NanoJev。要图像输入或研究扩散路线——看 djev 与 OpenJev。

Star 数与延迟数字为 2026-09-23/25 快照,几天内就可能过时。 · 收录项目: 30

四条路线,替代掉的是不同的东西

行业自己在 Jev 发布一周后就把开源复现分成了四派(BlockBeats)。分清它们,才能看懂为什么各种"替代品"根本无法直接比较。

训练专用决策模型

小型非自回归编码器加决策头。完全不生成文本——传统分类器形态,但能读自然语言的选项。

  • Laya
  • Von
  • NanoJev
  • cbjev
  • jevlike
  • JevK5

直读 logits

不训练新权重。在模型即将作答时拦截,直接读取每个选项的概率,而不是让它把答案写出来。

  • SemIf
  • AnyJev
  • Verdict
  • litjev
  • simple-jev
  • fastjev

改造大模型

保留大模型作为基座,在其上加装决策结构(LoRA 适配器或指针头),一次 prefill 回答所有问题。

  • Kev
  • Nimble
  • decider (Mapika)
  • Decitron (决策机)
  • Winnow-12B
  • Open-Jev (Zefan Cai)

用扩散模型填空作答

把答案位置留空,像扩散模型补全图像那样一次性填好,而不是逐 token 解码。

  • djev
  • OpenJev (razorback16)
  • LocalJev
  • openjev-sglang
  • DiffusionGemma
  • Lichen

全量对照表

许可证、基座、延迟、star 数与适用场景。带内页的项目可以直接进详情页,其余外链到一手仓库。

项目许可证基座与规模延迟Stars最适合
LayaConvai InnovationsApache-2.0ModernBERT-large 421M · mmBERT-base 322M (multilingual)32.8–39.5 ms/question on a T4 · 7.2 ms for ten batched · other measurements put single-question CPU inference at 193–464 ms19,301拿来在自有标注上微调的快速多语基座——不是零样本开箱替代品。
KevJared PalmerApache-2.0Qwen3.5 0.8B / 4B / 9B + rank-16 LoRA + pointer head47 ms on MLX (repeated state), 77 ms fresh · 12–26 ms on an H1005,385不动一行业务代码就替掉托管 Jev——它直接实现同一套 /v1/systemone 契约。
SemIfTheo LeeMITFrozen Qwen3.5-4B — no fine-tune at all1.023 s for 21 binary criteria · 5.21× faster than generating the same answers as JSON4,023复用你已经在跑的开源模型,零训练、零输出 token。
VonwfzyxApache-2.0ModernBERT-Large 395M encoder + three decision headsUnder 15 ms per decision on a CPU — no GPU at all546完全不需要显卡的部署:笔记本、旧服务器、边缘设备。也是独立 49 任务基准上最强的开源模型。
NanoJevTianyuCodingsNot stated in the repository; third parties list MITQwen3-0.6B + parallel decision headsCUDA only — the inference script has no Apple Silicon path2,086高频控制回路——唯一在某个任务上真的打败 Jev 的开源项目(ViZDoom Basic 128/128 对 56/128)。
cbjevtomek7667GPL-3.0-or-laterModernBERT / mmBERT, fine-tuned from Laya3.0 ms for one question · 11.4 ms for ten questions over a 500-token document—更快、标定更好的 Laya 后继者,且沿用同一线格式。注意它是 GPL-3.0 许可证。
AnyJevJiamu (Morris) Zhang · Nokia Applied ResearchApache-2.0Any open LLM — a training-free debiasing layerOne prefill per call; no generation—在零标注的前提下消除选项顺序偏置与标签偏置,再用 100–500 条标注做标定。
djevMaisaApache-2.0 per the repositoryDiffusionGemma 26B-A4B read as a canvas; no weights shippedJevBench 74.3 → 73.0 → 52.23 across the three board versions, with no new measurements · 76.87 ms p50 on the older quantized config—扩散路线,也是被引用为支持图像 state 的两条路线之一。证据很薄——去读仓库,并确认分数来自哪个榜单版本。
jevlikevinnylarougeMITByte encoder, or any frozen Hugging Face encoderCPU / MPS / CUDA — four commands to train1,255这是一个训练器而不是模型。带上你自己的选项清单和标注,在笔记本上训练。
VerdictManavarya09 (one of three unrelated projects using the name)Apache-2.0multilingual-e5-small 118M (PyPI verdictml)0.5 ms/example batched on an M5 CPU · under 2 ms single with ONNX int8—诚实的概率:温度标定 + 带覆盖率保证的 conformal 弃权,且选项顺序在结构上无法改变答案。但它自报的 0.77 对 Jev,与 JevBench v1.4.2 上 5.69 的一行并存,需自行判断。
OpenJev (razorback16)razorback16 — note: "OpenJev" names at least seven unrelated projectsApache-2.0DiffusionGemma 26B-A4B with a one-step structured read~94 ms median on an RTX PRO 600050被引用为唯一能对图像作答的开源实现,也是其他桥接项目参照的原型。务必带上作者名:笼统的"OpenJev"不可用。
LocalJevGitHub NextSee repositoryDiffusionGemma 26B-A4B through an OpenAI-compatible endpointDepends on oMLX; a TypeScript/Bun bridge—当你的推理后端缺少扩散原语时的可移植桥接。它的 README 明确写着:线兼容,但数学上不等价。
openjev-sglangekzhangSee repositoryQwen3.6-35B-A3B served on SGLangB200-class hardware—在你有数据中心级 GPU 时,高吞吐地服务一个大体量开源决策模型。
litjevzhengxuyuApache-2.0Open weights (Qwen and others), option logitsSee repository13一个小而可读的 /v1/systemone 服务端,适合学习或 fork 出自托管的完整契约。它自己没有任何与 Jev 的对比数字。
simple-jevfeatherless-aiMITAny OpenAI-compatible endpointSee repository168最快的零训练试水:把它指向 vLLM 或 Hugging Face 端点,直接读选项 logits。
fastjevchengyongruSee repositoryA SemIf forkSee repository—更精简的 SemIf,想要自托管语义决策但不要那么多脚手架时的选择。
JevK5allebeeApache-2.0Open weights, one forward passSee repository—需要检视或完全拥有决策模型时的 Apache-2.0 开放权重选项。
poorjevrupeshpoojary9See repositoryRuns locally with no API keyECE 0.170 → 0.071 after calibration—离线、无需等候名单的试验场景,且标定比原始准确率更重要时。
NimbleBespokeSee repositoryQwen3.5-9B with contrastive post-trainingPicked the reference answer 90.1% of the time on 324 held-out samples (Jev: 93.2%)—关心训练配方的团队:数据刻意构造成"改一个事实就翻转正确答案"。仓库里没有 LICENSE 文件——Apache-2.0 的说法只来自模型卡。
decider (Mapika)Mark MarosiApache-2.0Qwen3.5 2B / 4B / 35B-A3B-Base + one-pass letter-slot readout32.3 ms median on a B300 · 3.2 ms with CUDA graphs—当前 JevBench 榜(v1.4.2,64.13)第一名。注意被广泛转述的"33ms"其实是 Laya 在 T4 上的数字,不是 decider。
GLiNER2.5-DecideFastinoSee source340M per the vendor (some cards say 205M — the conflict is unresolved)0.698 macro accuracy on the independent 49-task benchmark—你已经有一套 GLiNER 流水线、且决策形态偏向路由与抽取时。
sokudan (即断)GeneLabApache-2.0 code · MIT backbonesbintuitions/modernbert-ja-310m with cross-attentionDay-1 results published without releasing weights (bool still below the majority baseline)—日语原生决策。其公开的 day-1 结果在 score(有序量表)任务上已超过所有基线。
DiffusionGemmaGoogleGemma terms26B-A4B diffusion language model27.4 decisions/s in batch routing—它是引擎而不是替代品——上面多个项目都建立在它之上。
Decitron (决策机)中科闻歌 / Zhongke WengeProprietaryA general-purpose decision LLMNot comparable—不是 Jev 的开源替代品。它的轴是"瞬时判断 vs 未来推演"——属于另一个品类,常被误当成 clone。
JevForgezwliJayMITQwen3.5 0.8B / 0.6B with an end-to-end synthesis-train-calibrate-serve toolkitTest noul 0.826 / 0.776 vs Jev 0.910 · out-of-distribution noul 0.860 / 0.769 vs Jev 0.825—我们找到的唯一在分布外某一维度上赢过 Jev 的参赛者——同时在分布内落后。转述前值得独立验证。
Winnow-12B—Apache-2.012B, 16 GB GPU198/231 on one JevBench subset — level with Jev’s 85.71% there—在某个公开子集上与 Jev 打平的中等体量选择。在把它当作真实胜利之前,先看密封准确率那一列。
Open-Jev (Zefan Cai)Zefan CaiMIT codeLoRA + scalar head + calibration temperature on pinned Qwen3.5 2B / 9B / 27B85 ms against Jev’s 295 ms—公开 JevBench 单轮报告 197/231,对 Jev 200/231——公开分数上最接近的开源结果,但切片很窄。
LichenMushroom-SystemsMITDocker / llama.cpp over GGUF (gemma-4-26B-A4B)93 ms · 207/231 against Jev’s 200/231, p = 0.09 (not significant)—用容器方式起一个决策端点。它甚至自己报告了对 Jev 的领先在统计上不显著。
Cygnetblockbrain (Nood Co)MIT shim / Apache-2.0 weightsFrozen gemma-4-12B-it plus an MIT shim, temperature 3.4 — no fine-tune50–72 ms · JevBench v1.4.2 #4 at 61.76—零训练却在智力子项上高于 decider-4b v2。它的密封准确率是 33.8%,decider 是 34.7%。
HopperHopitAIApache-2.0 code, but "do not use this adapter commercially"LoRA r16 on Qwen3.5-4B, ~9 GB, 16 GB GPU minimum44–57 ms · JevBench v1.4.2 #5 at 59.43—标定子项 79.06,高于 Jev 的 76.34。许可证文本禁止商用,内部试用前也请先读清楚。

别只看 star 数:独立第三方基准

这是整个生态里唯一由"与任何项目都无利益关系的人"跑的基准。它同时记录了每个系统的失败模式。

系统macro accuracy记录到的失败模式
TypeSafe Jev (hosted)0.966
Von (395M, open)0.704在陌生领域会塌缩到单一模式
GLiNER2 (~300M, open)0.698对关键词过度触发
Laya (421M, open)0.583压缩评分量表

49 个任务、869 条用例,覆盖合规、工单分诊、法律、DevOps、语言学与安全。v2 macro accuracy。 jabr/classifier-benchmark

同一个项目,三个分数:JevBench 榜单版本

同一批系统被重新打分两次,没有做任何新测量。任何"X 打败了 Jev"的文章,都要先问它引用的是哪一版。

榜单版本第一名Jevdjev说明
v1.2.8-eraJev 75.375.3 (#1)74.3 (#3)大多数博客至今仍在引用的那一版。
v1.3.0Jev 74.474.4 (#1)73.0 (#3)引入机会校正智力分与接近随机惩罚后重新打分——没有做任何新测量。
v1.4.2decider-4b v2 64.1363.29 (#2)52.23 (#8)308 条密封决策 + 调和平均 + 泛化门槛。Jev 不再是第一。

撞名警告

在这个生态里,只写项目名是不可用的——同一个名字对应的可能是完全不同的东西。

  • OpenJev × 7

    至少七个互不相关的仓库:SemIf 的旧名、Zefan Cai 的 Open-Jev、S1LV3RJ1NX、razorback16、SiliconLabAI(那是个 Next.js playground,不是模型)等。务必带作者名。

  • Verdict × 3

    Manavarya09/verdict(118M,PyPI verdictml)、openJev-verdict-2.0(149.6M ModernBERT + GLiClass)与 JevBench 榜上的 "verdict-small" 是三个不同项目。

关于 Jev 替代品的常见问题

有真正能替代 Jev 的开源项目吗?

接口层面有,准确率层面还没有。Kev、cbjev、Verdict 一类项目都实现了同一套 /v1/systemone 契约,改一个 base URL 就能替换调用;但独立 49 任务基准上,最强的开源模型约 0.70–0.72,而 Jev 是 0.966。省钱、降延迟、数据不出域这三件事开源阵营已经赢了,零样本跨域质量还没有。

为什么不同的文章给出的同一个项目分数差那么多?

因为 JevBench 有三个榜单版本。同一批系统在 v1.2.8 时代、v1.3.0 和 v1.4.2 上分别被打分,中间没有任何新测量:djev 从 74.3 掉到 52.23,某个项目从 67.0 掉到 40.6,还有一个从 62.4 掉到 27.4。看到任何分数,先问它是哪一版。

「OpenJev」到底指哪个项目?

至少七个互不相关的仓库都用这个名字:SemIf 的旧名、Zefan Cai 的 Open-Jev、S1LV3RJ1NX、razorback16、SiliconLabAI(那其实是个 Next.js playground,不是模型)等等。Verdict 也撞了三个。所以本站的写法是"作者名/仓库名",从不单独写项目名。

我应该直接零样本用 Laya 吗?

不应该。Laya 自己的 README 写着 base checkpoint 在 typed decisions 上只有 0.362 和 0.342,而随机基线是 0.318、多数类基线是 0.461;那个常被引用的 0.766 是在该基准训练集上微调过的 checkpoint。而且 300 条日语实测发现它的有序量表存在严重位置偏置:首位选项在 300 条里只被选中 0 到 1 次。它适合当微调基座。

开源替代品在生产里最实际的风险是什么?

不是准确率,而是"看起来能用"。位置偏置、自信错误、以及评测集与训练集重叠,都会让一个模型在演示里表现良好、在生产里悄悄出错。上任何替代品之前,准备几百条自己业务的标注样本,测三件事:置信度是否可信(ECE)、重排选项是否改变答案、以及低置信度样本是否真的更难。

这些数字有多新?

Star 数和延迟是 2026-09-23/25 的快照,基准分数按各自来源标注。这个生态一周就能变一次——Jev 发布后 24 小时内出现第一批开源复现,两天内被数出六个 clone,一周后就有了十几个。任何具体数字都应当重新核实再引用。

本站没有对 TypeSafe Jev 本体做过实测。TypeSafe 主客户协议 2.3(b) 禁止利用其服务或输出开发同类产品,因此这个生态里几乎不存在干净的 head-to-head;本页所有数字均为第三方公开口径或对公开仓库的阅读,应视为假设而非结论。