Jev 替代品

djev

扩散路线——也是这份清单里证据最薄的一个

一句话结论

djev 值得关注,但不值得盲信采用。它是扩散一派的代表——把 DiffusionGemma 26B-A4B 当作画布来读,而不是逐 token 解码——也是被引用为"能接受图像 state"的两条路线之一。它公布的 JevBench 分数在没有任何新测量的情况下从某一榜的 74.3 掉到后来的 52.23,而且和 Jev 之间根本不存在干净的 head-to-head。

djev 属于最小也最有意思的一派:它既不读 logits,也不训练编码器,而是把扩散语言模型当作画布,把答案位置留空再一次性填好。它自己不发布权重,基准分数又在不同榜单版本之间大幅漂移。所以这是一个讲"方向值得关注、证据还很薄"的页面,而不是推荐页。

Fill answers with diffusion

Leave the answer slots blank and fill them all at once, the way a diffusion model completes an image, instead of decoding token by token.

搜索别名

djevDJevdjev-devDiffusionGemmaJevDavipar/djev

关键规格

Licence
仓库标注 Apache-2.0
Author
Maisa
Backbone
DiffusionGemma 26B-A4B,按画布读取
Size
项目自身不发布权重
Latency
旧量化配置下 p50 为 76.87ms
Wire format
见仓库
Install
见仓库

djev 与 JevBench 榜单问题

这是本页最重要的一条前提。JevBench 曾在没有任何新测量的情况下对同一批系统重新打分两次,而且幅度极大——这正是同一个项目在不同文章里会被写成第三名或第八名的原因。

djev 与 JevBench 榜单问题djevJev
JevBench,最早榜单74.3 —— 第三名75.3 —— 第一名
JevBench v1.3.073.0 —— 第三名74.4 —— 第一名
JevBench v1.4.252.23 —— 第八名63.29 —— 第二名
与 Jev 的干净 head-to-head没有任何公开结果—
技术路线扩散:一次填满所有答案槽单次前向、非生成式

什么时候可以考虑 djev

当决策依赖图像时,或者当你在研究"基于扩散的决策模型"而不是要落地一个时,可以考虑它。这一派与读 logits 的人群确实不同:OpenJev 与 LocalJev 都建立在这条路线上,而 LocalJev 的 README 非常清楚地写明它自己的桥接版本"线兼容但数学上不等价"。如果你今天就需要能看图像的类型化决策,请准备好自己做评测。

什么时候该放弃它

不要因为某篇博客说它在 JevBench 上排第三就选 djev。那是最早的三个榜之一;当前榜单把它排在 52.23,而"密封准确率"那一列——衡量未公开题目表现的部分——才是整个品类集体塌方的地方。此外,djev 与 Jev 之间没有任何在受控输入下的公开对比,所以关于它相对水平的任何说法都是推断,不是测量。

负责任地评估 djev

01看榜单,不要看博客:注意你看到的任何分数来自哪个 JevBench 版本——同一个系统曾在没有任何新测量的情况下从 74.3 被重打到 52.23。
02确认你要测的路线是否暴露了带种子的扩散画布与选定 token 的 logits。没有这些原语,你拿到的只是聊天端点"自报"的概率,那是另一个产品。
03做任何决定前先跑自己的标注集。这是整份清单里唯一一个我们两个方向都没找到受控对比的条目。
text / 评估之前先确认
扩散路线检查表
-----------------------
[ ] 模型:DiffusionGemma 26B-A4B(djev 不发布权重)
[ ] 推理后端是否暴露结构化读取原语:
      - 带种子的扩散画布
      - 只读去噪
      - 选定 token 的 logits / logprobs
    没有这些,概率就是模型通过 OpenAI 兼容端点
    "自报"的——线兼容,但数学上不等价。
[ ] 记录任何分数来自哪个 JevBench 版本。
      74.3(最早榜)-> 73.0(v1.3.0)-> 52.23(v1.4.2)
[ ] 在自己的标注决策上对比;如果你是为了图像来的,
    记得把图像也放进测试集。
"读 logits"与"让模型自报概率"的区别在这条路线上就是全部胜负手,而两者都以 JSON 形式到达时,很容易搞混。

关于 djev 的常见问题

djev 的分数为什么从 74.3 掉到 52.23?

不是因为模型变了。JevBench 在新规则下对同一批系统重新打分——某个版本引入机会校正后的智力分与接近随机惩罚,更晚的版本引入密封决策集与调和平均——而且没有做任何新测量。整体漂移极其剧烈:一个项目从 67.0 掉到 40.6,另一个从 62.4 掉到 27.4。任何数字都要说明它来自哪个榜。

djev 发布权重吗?

不发布。项目提供的是方法而不是 checkpoint——它把 DiffusionGemma 26B-A4B 当作画布来读。这意味着结果高度依赖推理后端:你需要带种子的扩散画布、只读去噪与选定 token 的 logits,否则最后得到的就是一个自报概率的聊天端点。

djev 能处理图像吗?

它是被描述为"接受图像 state"的两条路线之一,而且各来源对哪条是主力说法不一——一篇流传较广的对比把 razorback16 的 OpenJev 说成唯一能对图像作答的项目,另一些文章则指向 djev。请把图像能力当作"有希望但未验证",如果这是你来的理由,就自己测。

什么是"密封准确率",为什么它重要?

它衡量的是系统被打分时尚未公开的决策上的表现,是防止基准污染的唯一防线。在当前榜单上,最好的公开准确率在八成区间,而密封准确率落在三成左右——Jev 自己也是。这个落差是整个生态里最诚实的一个数字,也是我们把这里所有对比表都称为"假设"的原因。

来源

本页所有对比数字均为第三方公开口径或对公开仓库的阅读,不是本站实测。我们没有对 TypeSafe Jev 本体做过实测,且其主客户协议禁止利用其输出开发同类产品。