Jev 替代品

NanoJev

唯一在某个任务上真的打败了 Jev 的开源项目

一句话结论

NanoJev 赢在延迟与重复性:0.6B 模型本地可跑,ViZDoom Basic 128/128 对 Jev 的 56/128。但它评测的四个游戏就是它训练的四个游戏,而且迷宫测试集上 Jev 仍以 7/10 对 4/10 取胜。把它当作"小而专用的模型能在紧密回路里跑赢托管决策 API"的证据,而不是通用分类器。

NanoJev 是 Qwen3-0.6B 基座加并联决策头,训练数据是取自四个游戏环境的 18,760 条决策问题。在这份对比里,它是唯一一个在某项任务上正面赢过 Jev 的开源项目——而诚实的解读是:那个基准正好落在它自己的训练分布内。把它留给控制回路,不要用在工单上。

Train a decision model

A small non-autoregressive encoder with decision heads. No text generation at all — the classic classifier shape, rebuilt for natural-language options.

搜索别名

nanojevNanoJevNano JevTianyuCodings/NanoJev

关键规格

Licence
仓库未声明;第三方资料写 MIT
Author
TianyuCodings
Backbone
Qwen3-0.6B + 并联决策头
Size
0.6B 参数
Latency
推理脚本要求 CUDA —— 无 Apple Silicon 路径
Wire format
自带测试框架;不是 /v1/systemone 服务
Install
见仓库(提供中文 README)

NanoJev 对 Jev,逐任务看

以下为项目自己的留出结果。请连同范围说明一起读:训练四个游戏,评测也是这四个游戏。

NanoJev 对 Jev,逐任务看NanoJevJev
ViZDoom Basic128/12856/128
Predict Position27/12811/128
50x50 迷宫所需尝试次数2252,738
迷宫测试集4/107/10
Snake8/88/8(打平)
适用范围训练与评测都是同样四个游戏通用托管模型

什么时候该选 NanoJev

当你的决策发生在紧密控制回路里——游戏智能体、仿真器、高频分支评估——并且你希望整套东西跑在自己的 GPU 上时,用 NanoJev。它证明了一个有用的点:在狭窄且被反复采样的任务上,0.6B 的专用模型能打赢前沿决策 API,而这正是单次延迟与成本占主导的场景。

什么时候该放弃它

不要用 NanoJev 做工单分诊、内容审核或客服路由。它的数字来自它训练过的四个游戏环境,迷宫测试集上 Jev 仍然获胜,而且对它的迷宫框架做独立复跑后发现:没有任何 LLM 读出方式——哪怕是更大的模型——能在"向北一步是否通畅"这种简单问题上超过多数类标签。此外没有 Apple Silicon 路径,仓库也没有声明许可证。

三步接入 NanoJev

01先解决许可证问题——仓库没有声明,商业部署前必须先过法务。
02在 CUDA 硬件上跑,并在你自己的环境里验证。公布的胜利来自它训练过的那四个游戏。
03除了成功率,还要记录尝试次数与碰撞次数:在项目自己的框架里,尝试次数的变化远大于目标测试结果。
python / 每步并联决策
# NanoJev 在一次前向里回答关于同一 state 的多个问题,
# 这正是控制回路可行的原因。
#
# 已公布的框架结果(留出对局):
#   ViZDoom Basic      128/128   (Jev 56/128)
#   Predict Position    27/128   (Jev 11/128)
#   50x50 迷宫          225 次尝试 (Jev 2,738)
#   迷宫测试集          4/10     (Jev 7/10)
#   Snake               8/8      (打平)
#
# 训练与评测流水线随仓库提供。推理脚本要求 CUDA。
# 在信这些数字之前,请在自己的环境里评测:
# 那四个游戏同时也是训练集。
可复用的思路是:在一次前向中对动态候选集做并联决策——这才让"每步都判定一次"变得负担得起。

关于 NanoJev 的常见问题

NanoJev 真的打败 Jev 了吗?

在项目报告的两项任务上是的:ViZDoom Basic 128/128 对 56/128、Predict Position 27/128 对 11/128,而且迷宫尝试次数远少。但迷宫测试集上 Jev 仍以 7/10 对 4/10 获胜,Snake 打平。这个胜利是真的,但范围限定在它训练过的那四个游戏内。

能把 NanoJev 当通用分类器用吗?

不能。它是 0.6B 模型,训练数据是四个游戏环境的 18,760 条决策问题,评测也是同样这四个。这套设定没有任何部分能迁移到工单分诊、内容审核或路由,项目本身也没有这样的主张。

它的许可证能商用吗?

不清楚。仓库没有声明许可证——几篇第三方文章写的是 MIT,但那和仓库里有 LICENSE 文件不是一回事。内部上线前先过法务,不要拿博客文章当作授权条款。

这些基准数字可信吗?

诚实但范围很窄。另一个项目独立复跑了 NanoJev 自己的迷宫框架,发现结论高度依赖"你怎么读模型":同一个未微调的 Qwen3-0.6B,在一种读出方式下是 13/15 迷宫、20,555 次尝试,换成另一种是 15/15、5,825 次。这是读出方式的属性,不是地图理解能力的差异。

来源

本页所有对比数字均为第三方公开口径或对公开仓库的阅读,不是本站实测。我们没有对 TypeSafe Jev 本体做过实测,且其主客户协议禁止利用其输出开发同类产品。