Jev 替代品
NanoJev
唯一在某个任务上真的打败了 Jev 的开源项目
一句话结论
NanoJev 赢在延迟与重复性:0.6B 模型本地可跑,ViZDoom Basic 128/128 对 Jev 的 56/128。但它评测的四个游戏就是它训练的四个游戏,而且迷宫测试集上 Jev 仍以 7/10 对 4/10 取胜。把它当作"小而专用的模型能在紧密回路里跑赢托管决策 API"的证据,而不是通用分类器。
NanoJev 是 Qwen3-0.6B 基座加并联决策头,训练数据是取自四个游戏环境的 18,760 条决策问题。在这份对比里,它是唯一一个在某项任务上正面赢过 Jev 的开源项目——而诚实的解读是:那个基准正好落在它自己的训练分布内。把它留给控制回路,不要用在工单上。
Train a decision model
A small non-autoregressive encoder with decision heads. No text generation at all — the classic classifier shape, rebuilt for natural-language options.
搜索别名
关键规格
- Licence
- 仓库未声明;第三方资料写 MIT
- Author
- TianyuCodings
- Backbone
- Qwen3-0.6B + 并联决策头
- Size
- 0.6B 参数
- Latency
- 推理脚本要求 CUDA —— 无 Apple Silicon 路径
- Wire format
- 自带测试框架;不是 /v1/systemone 服务
- Install
- 见仓库(提供中文 README)
NanoJev 对 Jev,逐任务看
以下为项目自己的留出结果。请连同范围说明一起读:训练四个游戏,评测也是这四个游戏。
| NanoJev 对 Jev,逐任务看 | NanoJev | Jev |
|---|---|---|
| ViZDoom Basic | 128/128 | 56/128 |
| Predict Position | 27/128 | 11/128 |
| 50x50 迷宫所需尝试次数 | 225 | 2,738 |
| 迷宫测试集 | 4/10 | 7/10 |
| Snake | 8/8 | 8/8(打平) |
| 适用范围 | 训练与评测都是同样四个游戏 | 通用托管模型 |
什么时候该选 NanoJev
当你的决策发生在紧密控制回路里——游戏智能体、仿真器、高频分支评估——并且你希望整套东西跑在自己的 GPU 上时,用 NanoJev。它证明了一个有用的点:在狭窄且被反复采样的任务上,0.6B 的专用模型能打赢前沿决策 API,而这正是单次延迟与成本占主导的场景。
什么时候该放弃它
不要用 NanoJev 做工单分诊、内容审核或客服路由。它的数字来自它训练过的四个游戏环境,迷宫测试集上 Jev 仍然获胜,而且对它的迷宫框架做独立复跑后发现:没有任何 LLM 读出方式——哪怕是更大的模型——能在"向北一步是否通畅"这种简单问题上超过多数类标签。此外没有 Apple Silicon 路径,仓库也没有声明许可证。
三步接入 NanoJev
# NanoJev 在一次前向里回答关于同一 state 的多个问题, # 这正是控制回路可行的原因。 # # 已公布的框架结果(留出对局): # ViZDoom Basic 128/128 (Jev 56/128) # Predict Position 27/128 (Jev 11/128) # 50x50 迷宫 225 次尝试 (Jev 2,738) # 迷宫测试集 4/10 (Jev 7/10) # Snake 8/8 (打平) # # 训练与评测流水线随仓库提供。推理脚本要求 CUDA。 # 在信这些数字之前,请在自己的环境里评测: # 那四个游戏同时也是训练集。
关于 NanoJev 的常见问题
NanoJev 真的打败 Jev 了吗?
在项目报告的两项任务上是的:ViZDoom Basic 128/128 对 56/128、Predict Position 27/128 对 11/128,而且迷宫尝试次数远少。但迷宫测试集上 Jev 仍以 7/10 对 4/10 获胜,Snake 打平。这个胜利是真的,但范围限定在它训练过的那四个游戏内。
能把 NanoJev 当通用分类器用吗?
不能。它是 0.6B 模型,训练数据是四个游戏环境的 18,760 条决策问题,评测也是同样这四个。这套设定没有任何部分能迁移到工单分诊、内容审核或路由,项目本身也没有这样的主张。
它的许可证能商用吗?
不清楚。仓库没有声明许可证——几篇第三方文章写的是 MIT,但那和仓库里有 LICENSE 文件不是一回事。内部上线前先过法务,不要拿博客文章当作授权条款。
这些基准数字可信吗?
诚实但范围很窄。另一个项目独立复跑了 NanoJev 自己的迷宫框架,发现结论高度依赖"你怎么读模型":同一个未微调的 Qwen3-0.6B,在一种读出方式下是 13/15 迷宫、20,555 次尝试,换成另一种是 15/15、5,825 次。这是读出方式的属性,不是地图理解能力的差异。
来源
本页所有对比数字均为第三方公开口径或对公开仓库的阅读,不是本站实测。我们没有对 TypeSafe Jev 本体做过实测,且其主客户协议禁止利用其输出开发同类产品。