局限 · 准确率 · 校准

Jev 局限:TypeSafe 决策模型做不到什么(2026)

本站大多数页面在讲一样东西好在哪;这一页存在,是因为你要在其上跑自动化的决策模型,值得一份「失败优先」的读法。Jev 的基准实测两面、「不能幻觉」到底承诺了什么、置信度数字被测出说谎的地方,以及四件厂商页面不会放在首屏的结构性限制。

一句话答案

Jev 是纯文本的托管决策模型:返回带概率的类型化答案、零文本生成,每百万输入 token $0.042、输出免费。独立证据是双面的:vals.ai 的预注册评测里,它在 claim verification 上追平 GPT-6 级系统(0.975,成本约为 Astra 的 1/498)——也在 LegalBench 上十二家垫底(0.730)、单个 contract NLI 子任务坍塌(0.485)、该任务校准十二家最差(ECE 0.108)。硬限制四条:不能读图、32k token 读取上限、无自由文本推理、无工具调用。至少有一个团队(EmDash)在发布时评测过 Jev,最终上线选了 Clef。

本页的批评和背书一样带来源:vals.ai 预注册评测(2026-10-06)、EmDash 生产复盘(2026-10-07)、以及正文点名的第三方限制专页。背书与批评来自同一批信源、并列呈现——只引用单边的「局限页」过不了它自己的测试。我们自己的 fixture 同为第三方口径、公开在 /benchmarks。

Jev 准确率到底如何?基准实测的两面

目前最严格的独立数据是 vals.ai 的预注册评测(2026-10-06):十二个系统、400 条从 SEC 文件构建并经人工审计的 claim verification 用例、所有假设在开跑前锁定。同一份评测同时产出了 Jev 最好的头条与最差的成绩——所以两面都放这里。

确实强的地方

Claim verification:0.975,每千例 $0.02——与 GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna 统计打平,成本约为 Astra 的 1/498,ECE 0.011 为十二家最低,中位延迟约 0.1 秒。评测者对 TypeSafe 发布头条「快 193.6 倍、便宜 444.6 倍」的结论是:站得住。在分类形状的工作(路由、分诊、断言核查)上,这是一个配得上自动化通道的成绩单。

vals.ai — An Independent Evaluation of TypeSafe’s Jev

实测吃力的地方

在 LegalBench 的 12 子任务预注册切片上,Jev 的 class-balanced accuracy 十二家垫底:0.730,对 GPT-5.6 Terra 的 0.932,且其他所有系统的领先都具有统计显著性。单个 contract NLI 子任务坍塌(33 项里 30 项答 Yes,得 0.485),该任务上 ECE 升到 0.108——十二家最差。一个任务上测出的校准没有迁移到另一个任务。

更宽的第三方记录

vals.ai 不是孤例:truestandard.ai 发过专门的《Jev Accuracy Tested: 108 Claims Across Three Models》;layer3labs 在限制分析之外也跑 Jev 基准;iatrox、benchlm、lmspedia 的「Jev 限制」专页已经自成一个小品类。我们自己的 fixture 与方法论公开在 /benchmarks——和本页其他一切一样是第三方口径、一样只描述特定任务。

诚实的总结:分类强、法律 NLI 弱。0.975 和 0.730 都不描述你的工作负载——它们只描述任务。在把任何数字拿去支撑自动化之前,先跑约 100 条你自己的标注样本——好看的数字也不例外。

我们公开的 fixture、ECE 与方法论

Jev 会产生幻觉吗?「零幻觉」卖点审视

架构层面的主张是真的:Jev 没有文本生成头,吐不出散文、编不出引用、也虚构不了段落。经典 LLM 意义上的幻觉——流畅但错误的文本——在结构上就不存在,批评者也承认这一点。问题在于它真正买到的是什么。

准确性主张并不能从架构推出。类型化答案照样可以错:模型选错选项、给它盖上高置信度、然后你的代码在两者之上自动化。「不能幻觉」的意思是「不能生成文本」,不是「不会错」——两篇独立评论的标题就是这个意思:andrewbaker.ninja 的《Jev AI Can't Hallucinate, But It Can Still Be Wrong》,以及 Protos 的《Meet Jev, the AI that claims it can't hallucinate》。真正的失败模式在下面。

独立写作者如何定性这个主张

取而代之的真实失败模式

01

高置信度的类型化错误答案

0.97 置信度的事实性错误答案在我们自己的 JEV-27B 本地评测(Jev 的学生模型、同一契约形状)里有记录:0.50–0.95 全阈值段扫过去,没有任何一道闸门能把「好运气」和「真本事」分开。

02

任务边界上的校准失准

vals.ai 在 LegalBench 上测出 ECE 0.108——十二家最差,而就在同一篇评测的另一个任务上它是十二家最好(0.011)。Synthpop 审计的通用结论在这里同样适用:置信度是任务分布的性质,不是模型常量。

03

安静的越界失败

喂一段超过 32k token 的文档、一张图、或一个需要多步推理的问题,失败不会以报错出现——它表现为一个在你以为的信息量之下做出的决策。

Jev 过度自信:置信度数字什么时候说谎

整个记录里最有力的单条批评是 vals.ai 的校准发现:LegalBench 上 Jev 的 ECE 为 0.108——十二家最高——评测者的结论是:其置信度分数相对原始概率没有提供额外信号。对照同一篇评测在 claim verification 上测出的 0.011(十二家最低):校准不是模型常量,是任务性质。

独立审计在别处也呈现同样的形状:Synthpop 57.5 万次调用审计记录到模型在不可答问题上仍然自信(准确率 1%、置信度 32–36%);RUNTIME. 对一个 Jev 学生模型的本地评测里,0.969 置信度的答案没过事实核查。这个问题已被行业摆上台面——连 Synthpop 的官方答疑《Does a decision model know when it is guessing?》都把过度自信当作公开议题。

生产上的答案无聊且没有商量余地:只在自己可靠性图诚实的地方设阈值,阈值以下走人工复核通道,任务构成一变就重新验证。EmDash 的 Clef 部署是这套纪律的活例子——0.45 最低分才允许自动动作,且模型永远无权单独封禁插件。

Jev 的硬限制:它做不到什么

四条结构性限制——不是 bug,也不是路线图,是 2026 年 10 月这个已发布架构的属性。layer3labs 那篇限制分析的复盘框架说得很好:它读了多少,以及它不能做什么。

不能读图

State 只收文本。Perplexity 的 Decisions API 按 32×32 tile 读 base64 图片,Clef 开箱即多模态,OpenAI beta 收内联 base64 图像。如果你的决策要读截图,这一行直接决定厂商。

32k token 读取上限

Jev 的上下文读取上限是 32k token;Perplexity 文档写 262k 输入 token,Clef 64k。长文档需要分块加你自己负责的合并策略——而每一个分块边界都是上下文悄悄丢失的地方。

无自由文本推理与解释

它给你声明的选项打分;不能对陌生问题做推理、不能起草回复、也不能解释为什么。你的代码拿着它返回的数字做推理——这正是卖点,直到某一天你需要那个「为什么」。

没有工具调用

没有 agent 循环:Jev 不调用函数、不取数据、不执行动作。它只回答关于你发去的 state 的问题。一切看起来像「Jev 做了 X」的东西,都是你的代码在 Jev 调用周围做了 X。

生产注脚:一个团队评测过 Jev 然后换了

CMS 插件注册表 EmDash 在 2026 年 10 月写道:「We evaluated Jev when it launched, but unfortunately it underperformed our baseline.」他们最终用 Clef 上线了内容审核——每条提交 9 个文本问题、每张图 8 个问题,0.45 最低分才允许自动动作、模型永远无权单独封禁;63 条文本 fixture 全部符合预期,端到端 p95 1.64 秒。这是一个没有公布 Jev 侧测试方法的孤例——当案例研究读,别当基准读——但它是公开记录里唯一的生产级 Jev 对比选型叙事,而它没有走向 Jev。

EmDash — How EmDash uses Clef to moderate the plugin registry

谁该用 Jev,谁不该

同一份证据在两边都给出一张短清单——上面的限制在这一节变成选型标准。

适合,当

你的决策是文本分类形状(路由、分诊、按量表打分);你需要可审计的阈值和公开的校准方法论;你要多问题一次调用、单次约 70–100ms;并且这种按输入计费(每百万 token $0.042、输出免费)的模式匹配你的量级。

另寻他家,当

你的决策今天就要读图;文档超过 32k token;任务是法律 NLI 形状的推理而不是分类;模型必须跑在你自己的基础设施里;或者你的验收标准是一张榜单分数而不是自己的标注数据。

品类全景:全部厂商、价格与选型

Jev 局限常见问题

Jev 准确吗?

取决于任务——同一份评测把两面都证明了。在 vals.ai 预注册的 claim verification 上,Jev 得 0.975,与 GPT-6 级系统统计打平、成本只有零头;在预注册的 LegalBench 切片上十二家垫底(0.730,对 GPT-5.6 Terra 的 0.932)、单个 contract NLI 子任务坍塌(0.485)、该任务校准十二家最差。分类形状的工作强、法律蕴含弱——而且这两个数字在你在自己的标注上测过之前,都不描述你的工作负载。

Jev 会产生幻觉吗?

经典意义上不会——它没有文本生成头,编不出流畅的散文、引用或解释。但「不能幻觉」不等于「不会错」:类型化答案可以错、置信度可以失准(vals.ai LegalBench 切片 ECE 0.108,十二家最差),而一个高置信度的错误答案可能比犹豫的答案更危险——你的代码会拿着它自动执行。诚实的说法是:没有生成文本类错误,没有决策类错误的豁免权。

Jev 开源吗?

不开源。Jev 是专有托管 API(也可经 OpenRouter 与各类网关访问),没有官方权重。本地路线走开放生态——Kev、SemIf、Von、Laya 等 Jev 兼容复现,对比在本站替代品 hub——注意线协议兼容不等于精度与校准也兼容。

Jev 能看图吗?

不能——state 只收文本,这是结构性限制,不是配置问题。Perplexity 的 Decisions API 收 base64 图像部件、按 32×32 tile 读取,Cloudflare 的 Clef 原生多模态(27B 版连视频都收),OpenAI beta 收内联 base64 图像。如果你的决策要读截图、证件照或商品图,这一条就足以一票否决。

Jev 不擅长什么?

实测的短板:法律蕴含(vals.ai LegalBench 切片十二家垫底,contract NLI 子任务坍塌到 0.485)、该任务上的校准(ECE 0.108)。结构上做不到的:图像输入、超过 32k token 的文档、多步推理、工具调用。前两条是实测,后四条是架构。

EmDash 为什么选 Clef 不选 Jev?

他们的复盘原话是「We evaluated Jev when it launched, but unfortunately it underperformed our baseline」,最终用 Clef 上线了内容审核——从能力表看这吻合:他们的管道要读插件列表图(每图 8 问),而 Jev 完全无法接收图像。Jev 侧的测试方法没有公布,所以把它当一则选型轶事(附一个体面的设计:0.45 最低分、人工复核),不要当基准。

Jev 过度自信吗?

看任务——而这本身就是发现。同一份评测里,Jev 的置信度在 claim verification 上是十二家最诚实的(ECE 0.011),在 LegalBench 上是十二家最不诚实的(ECE 0.108),评测者的结论是:后者的置信度分数相对原始概率没有提供额外信号。过度自信不是可以查表得到的模型常量——它是任务分布的性质,必须自己测量,这正是我们校准工作流要做的事。