替代品 / 选型决策
Jev 的替代品:一份不会被 star 数骗到的清单
把日志读数、专用编码器、改造大模型与扩散四条路线一次讲清。每个数字都标明来源,并附上各项目自己承认的失败边界——包括那个没人愿意提的事实:JevBench 曾两次在没有任何新测量的情况下改变分数。
速查:该用哪个替代品?
要迁移成本最低、代码不动——选 Kev(同一套 /v1/systemone 契约)。要 CPU 上跑、完全不要显卡——选 Von(395M,15ms 以内)。要复用你已经在跑的开源模型、完全不训练——选 SemIf 或 AnyJev。要在自己的标注上微调出最好的效果——选 Laya,并优先考虑它的后继者 cbjev(注意 GPL-3.0)。要紧密控制回路——选 NanoJev。要图像输入或研究扩散路线——看 djev 与 OpenJev。
Star 数与延迟数字为 2026-09-23/25 快照,几天内就可能过时。 · 收录项目: 30
四条路线,替代掉的是不同的东西
行业自己在 Jev 发布一周后就把开源复现分成了四派(BlockBeats)。分清它们,才能看懂为什么各种"替代品"根本无法直接比较。
训练专用决策模型
小型非自回归编码器加决策头。完全不生成文本——传统分类器形态,但能读自然语言的选项。
- Laya
- Von
- NanoJev
- cbjev
- jevlike
- JevK5
直读 logits
不训练新权重。在模型即将作答时拦截,直接读取每个选项的概率,而不是让它把答案写出来。
- SemIf
- AnyJev
- Verdict
- litjev
- simple-jev
- fastjev
改造大模型
保留大模型作为基座,在其上加装决策结构(LoRA 适配器或指针头),一次 prefill 回答所有问题。
- Kev
- Nimble
- decider (Mapika)
- Decitron (决策机)
- Winnow-12B
- Open-Jev (Zefan Cai)
用扩散模型填空作答
把答案位置留空,像扩散模型补全图像那样一次性填好,而不是逐 token 解码。
- djev
- OpenJev (razorback16)
- LocalJev
- openjev-sglang
- DiffusionGemma
- Lichen
全量对照表
许可证、基座、延迟、star 数与适用场景。带内页的项目可以直接进详情页,其余外链到一手仓库。
| 项目 | 许可证 | 基座与规模 | 延迟 | Stars | 最适合 |
|---|---|---|---|---|---|
| LayaConvai Innovations | Apache-2.0 | ModernBERT-large 421M · mmBERT-base 322M (multilingual) | 32.8–39.5 ms/question on a T4 · 7.2 ms for ten batched · other measurements put single-question CPU inference at 193–464 ms | 19,301 | 拿来在自有标注上微调的快速多语基座——不是零样本开箱替代品。 |
| KevJared Palmer | Apache-2.0 | Qwen3.5 0.8B / 4B / 9B + rank-16 LoRA + pointer head | 47 ms on MLX (repeated state), 77 ms fresh · 12–26 ms on an H100 | 5,385 | 不动一行业务代码就替掉托管 Jev——它直接实现同一套 /v1/systemone 契约。 |
| SemIfTheo Lee | MIT | Frozen Qwen3.5-4B — no fine-tune at all | 1.023 s for 21 binary criteria · 5.21× faster than generating the same answers as JSON | 4,023 | 复用你已经在跑的开源模型,零训练、零输出 token。 |
| Vonwfzyx | Apache-2.0 | ModernBERT-Large 395M encoder + three decision heads | Under 15 ms per decision on a CPU — no GPU at all | 546 | 完全不需要显卡的部署:笔记本、旧服务器、边缘设备。也是独立 49 任务基准上最强的开源模型。 |
| NanoJevTianyuCodings | Not stated in the repository; third parties list MIT | Qwen3-0.6B + parallel decision heads | CUDA only — the inference script has no Apple Silicon path | 2,086 | 高频控制回路——唯一在某个任务上真的打败 Jev 的开源项目(ViZDoom Basic 128/128 对 56/128)。 |
| cbjevtomek7667 | GPL-3.0-or-later | ModernBERT / mmBERT, fine-tuned from Laya | 3.0 ms for one question · 11.4 ms for ten questions over a 500-token document | — | 更快、标定更好的 Laya 后继者,且沿用同一线格式。注意它是 GPL-3.0 许可证。 |
| AnyJevJiamu (Morris) Zhang · Nokia Applied Research | Apache-2.0 | Any open LLM — a training-free debiasing layer | One prefill per call; no generation | — | 在零标注的前提下消除选项顺序偏置与标签偏置,再用 100–500 条标注做标定。 |
| djevMaisa | Apache-2.0 per the repository | DiffusionGemma 26B-A4B read as a canvas; no weights shipped | JevBench 74.3 → 73.0 → 52.23 across the three board versions, with no new measurements · 76.87 ms p50 on the older quantized config | — | 扩散路线,也是被引用为支持图像 state 的两条路线之一。证据很薄——去读仓库,并确认分数来自哪个榜单版本。 |
| jevlikevinnylarouge | MIT | Byte encoder, or any frozen Hugging Face encoder | CPU / MPS / CUDA — four commands to train | 1,255 | 这是一个训练器而不是模型。带上你自己的选项清单和标注,在笔记本上训练。 |
| VerdictManavarya09 (one of three unrelated projects using the name) | Apache-2.0 | multilingual-e5-small 118M (PyPI verdictml) | 0.5 ms/example batched on an M5 CPU · under 2 ms single with ONNX int8 | — | 诚实的概率:温度标定 + 带覆盖率保证的 conformal 弃权,且选项顺序在结构上无法改变答案。但它自报的 0.77 对 Jev,与 JevBench v1.4.2 上 5.69 的一行并存,需自行判断。 |
| OpenJev (razorback16)razorback16 — note: "OpenJev" names at least seven unrelated projects | Apache-2.0 | DiffusionGemma 26B-A4B with a one-step structured read | ~94 ms median on an RTX PRO 6000 | 50 | 被引用为唯一能对图像作答的开源实现,也是其他桥接项目参照的原型。务必带上作者名:笼统的"OpenJev"不可用。 |
| LocalJevGitHub Next | See repository | DiffusionGemma 26B-A4B through an OpenAI-compatible endpoint | Depends on oMLX; a TypeScript/Bun bridge | — | 当你的推理后端缺少扩散原语时的可移植桥接。它的 README 明确写着:线兼容,但数学上不等价。 |
| openjev-sglangekzhang | See repository | Qwen3.6-35B-A3B served on SGLang | B200-class hardware | — | 在你有数据中心级 GPU 时,高吞吐地服务一个大体量开源决策模型。 |
| litjevzhengxuyu | Apache-2.0 | Open weights (Qwen and others), option logits | See repository | 13 | 一个小而可读的 /v1/systemone 服务端,适合学习或 fork 出自托管的完整契约。它自己没有任何与 Jev 的对比数字。 |
| simple-jevfeatherless-ai | MIT | Any OpenAI-compatible endpoint | See repository | 168 | 最快的零训练试水:把它指向 vLLM 或 Hugging Face 端点,直接读选项 logits。 |
| fastjevchengyongru | See repository | A SemIf fork | See repository | — | 更精简的 SemIf,想要自托管语义决策但不要那么多脚手架时的选择。 |
| JevK5allebee | Apache-2.0 | Open weights, one forward pass | See repository | — | 需要检视或完全拥有决策模型时的 Apache-2.0 开放权重选项。 |
| poorjevrupeshpoojary9 | See repository | Runs locally with no API key | ECE 0.170 → 0.071 after calibration | — | 离线、无需等候名单的试验场景,且标定比原始准确率更重要时。 |
| NimbleBespoke | See repository | Qwen3.5-9B with contrastive post-training | Picked the reference answer 90.1% of the time on 324 held-out samples (Jev: 93.2%) | — | 关心训练配方的团队:数据刻意构造成"改一个事实就翻转正确答案"。仓库里没有 LICENSE 文件——Apache-2.0 的说法只来自模型卡。 |
| decider (Mapika)Mark Marosi | Apache-2.0 | Qwen3.5 2B / 4B / 35B-A3B-Base + one-pass letter-slot readout | 32.3 ms median on a B300 · 3.2 ms with CUDA graphs | — | 当前 JevBench 榜(v1.4.2,64.13)第一名。注意被广泛转述的"33ms"其实是 Laya 在 T4 上的数字,不是 decider。 |
| GLiNER2.5-DecideFastino | See source | 340M per the vendor (some cards say 205M — the conflict is unresolved) | 0.698 macro accuracy on the independent 49-task benchmark | — | 你已经有一套 GLiNER 流水线、且决策形态偏向路由与抽取时。 |
| sokudan (即断)GeneLab | Apache-2.0 code · MIT backbone | sbintuitions/modernbert-ja-310m with cross-attention | Day-1 results published without releasing weights (bool still below the majority baseline) | — | 日语原生决策。其公开的 day-1 结果在 score(有序量表)任务上已超过所有基线。 |
| DiffusionGemmaGoogle | Gemma terms | 26B-A4B diffusion language model | 27.4 decisions/s in batch routing | — | 它是引擎而不是替代品——上面多个项目都建立在它之上。 |
| Decitron (决策机)中科闻歌 / Zhongke Wenge | Proprietary | A general-purpose decision LLM | Not comparable | — | 不是 Jev 的开源替代品。它的轴是"瞬时判断 vs 未来推演"——属于另一个品类,常被误当成 clone。 |
| JevForgezwliJay | MIT | Qwen3.5 0.8B / 0.6B with an end-to-end synthesis-train-calibrate-serve toolkit | Test noul 0.826 / 0.776 vs Jev 0.910 · out-of-distribution noul 0.860 / 0.769 vs Jev 0.825 | — | 我们找到的唯一在分布外某一维度上赢过 Jev 的参赛者——同时在分布内落后。转述前值得独立验证。 |
| Winnow-12B— | Apache-2.0 | 12B, 16 GB GPU | 198/231 on one JevBench subset — level with Jev’s 85.71% there | — | 在某个公开子集上与 Jev 打平的中等体量选择。在把它当作真实胜利之前,先看密封准确率那一列。 |
| Open-Jev (Zefan Cai)Zefan Cai | MIT code | LoRA + scalar head + calibration temperature on pinned Qwen3.5 2B / 9B / 27B | 85 ms against Jev’s 295 ms | — | 公开 JevBench 单轮报告 197/231,对 Jev 200/231——公开分数上最接近的开源结果,但切片很窄。 |
| LichenMushroom-Systems | MIT | Docker / llama.cpp over GGUF (gemma-4-26B-A4B) | 93 ms · 207/231 against Jev’s 200/231, p = 0.09 (not significant) | — | 用容器方式起一个决策端点。它甚至自己报告了对 Jev 的领先在统计上不显著。 |
| Cygnetblockbrain (Nood Co) | MIT shim / Apache-2.0 weights | Frozen gemma-4-12B-it plus an MIT shim, temperature 3.4 — no fine-tune | 50–72 ms · JevBench v1.4.2 #4 at 61.76 | — | 零训练却在智力子项上高于 decider-4b v2。它的密封准确率是 33.8%,decider 是 34.7%。 |
| HopperHopitAI | Apache-2.0 code, but "do not use this adapter commercially" | LoRA r16 on Qwen3.5-4B, ~9 GB, 16 GB GPU minimum | 44–57 ms · JevBench v1.4.2 #5 at 59.43 | — | 标定子项 79.06,高于 Jev 的 76.34。许可证文本禁止商用,内部试用前也请先读清楚。 |
别只看 star 数:独立第三方基准
这是整个生态里唯一由"与任何项目都无利益关系的人"跑的基准。它同时记录了每个系统的失败模式。
| 系统 | macro accuracy | 记录到的失败模式 |
|---|---|---|
| TypeSafe Jev (hosted) | 0.966 | |
| Von (395M, open) | 0.704 | 在陌生领域会塌缩到单一模式 |
| GLiNER2 (~300M, open) | 0.698 | 对关键词过度触发 |
| Laya (421M, open) | 0.583 | 压缩评分量表 |
49 个任务、869 条用例,覆盖合规、工单分诊、法律、DevOps、语言学与安全。v2 macro accuracy。 jabr/classifier-benchmark
同一个项目,三个分数:JevBench 榜单版本
同一批系统被重新打分两次,没有做任何新测量。任何"X 打败了 Jev"的文章,都要先问它引用的是哪一版。
| 榜单版本 | 第一名 | Jev | djev | 说明 |
|---|---|---|---|---|
| v1.2.8-era | Jev 75.3 | 75.3 (#1) | 74.3 (#3) | 大多数博客至今仍在引用的那一版。 |
| v1.3.0 | Jev 74.4 | 74.4 (#1) | 73.0 (#3) | 引入机会校正智力分与接近随机惩罚后重新打分——没有做任何新测量。 |
| v1.4.2 | decider-4b v2 64.13 | 63.29 (#2) | 52.23 (#8) | 308 条密封决策 + 调和平均 + 泛化门槛。Jev 不再是第一。 |
撞名警告
在这个生态里,只写项目名是不可用的——同一个名字对应的可能是完全不同的东西。
OpenJev × 7
至少七个互不相关的仓库:SemIf 的旧名、Zefan Cai 的 Open-Jev、S1LV3RJ1NX、razorback16、SiliconLabAI(那是个 Next.js playground,不是模型)等。务必带作者名。
Verdict × 3
Manavarya09/verdict(118M,PyPI verdictml)、openJev-verdict-2.0(149.6M ModernBERT + GLiClass)与 JevBench 榜上的 "verdict-small" 是三个不同项目。
逐个替代品的深度拆解
每个页面包含规格表、与 Jev 的对照、最小可跑代码,以及最重要的——什么时候不该用它。
关于 Jev 替代品的常见问题
有真正能替代 Jev 的开源项目吗?
接口层面有,准确率层面还没有。Kev、cbjev、Verdict 一类项目都实现了同一套 /v1/systemone 契约,改一个 base URL 就能替换调用;但独立 49 任务基准上,最强的开源模型约 0.70–0.72,而 Jev 是 0.966。省钱、降延迟、数据不出域这三件事开源阵营已经赢了,零样本跨域质量还没有。
为什么不同的文章给出的同一个项目分数差那么多?
因为 JevBench 有三个榜单版本。同一批系统在 v1.2.8 时代、v1.3.0 和 v1.4.2 上分别被打分,中间没有任何新测量:djev 从 74.3 掉到 52.23,某个项目从 67.0 掉到 40.6,还有一个从 62.4 掉到 27.4。看到任何分数,先问它是哪一版。
「OpenJev」到底指哪个项目?
至少七个互不相关的仓库都用这个名字:SemIf 的旧名、Zefan Cai 的 Open-Jev、S1LV3RJ1NX、razorback16、SiliconLabAI(那其实是个 Next.js playground,不是模型)等等。Verdict 也撞了三个。所以本站的写法是"作者名/仓库名",从不单独写项目名。
我应该直接零样本用 Laya 吗?
不应该。Laya 自己的 README 写着 base checkpoint 在 typed decisions 上只有 0.362 和 0.342,而随机基线是 0.318、多数类基线是 0.461;那个常被引用的 0.766 是在该基准训练集上微调过的 checkpoint。而且 300 条日语实测发现它的有序量表存在严重位置偏置:首位选项在 300 条里只被选中 0 到 1 次。它适合当微调基座。
开源替代品在生产里最实际的风险是什么?
不是准确率,而是"看起来能用"。位置偏置、自信错误、以及评测集与训练集重叠,都会让一个模型在演示里表现良好、在生产里悄悄出错。上任何替代品之前,准备几百条自己业务的标注样本,测三件事:置信度是否可信(ECE)、重排选项是否改变答案、以及低置信度样本是否真的更难。
这些数字有多新?
Star 数和延迟是 2026-09-23/25 的快照,基准分数按各自来源标注。这个生态一周就能变一次——Jev 发布后 24 小时内出现第一批开源复现,两天内被数出六个 clone,一周后就有了十几个。任何具体数字都应当重新核实再引用。
本站没有对 TypeSafe Jev 本体做过实测。TypeSafe 主客户协议 2.3(b) 禁止利用其服务或输出开发同类产品,因此这个生态里几乎不存在干净的 head-to-head;本页所有数字均为第三方公开口径或对公开仓库的阅读,应视为假设而非结论。