Guides / 视频转图文攻略
Jev 实测:官方宣称与独立复测之间的距离
01Coder(小木头)的 Jev 实测:发布两天后的第三方审计把官方 20-400 倍对账到 5-25 倍、海外延迟 1.6-3.7 秒、「不会有幻觉」不成立、校准无法公开验证;本页以图文帧记录四条接入路径、自建 Playground 六场景与官方 agent skill 三步法。
速览结论
Jev 发布两天后,第三方审计就把官方数字重新对了一遍账,这期中文视频(01Coder,站内第二支同频道)把对账过程完整走了一遍:官方宣称 20-400 倍的速度成本优势,独立复测落在 5-25 倍;官方延迟 70-500ms,海外实测 1.6-3.7 秒(本站自研 benchmark 三套任务 P95 为 290-410ms——延迟跟链路走,两边共同指向「以自己场景实测为准」);「前沿智能」说过头了,准确率与中档模型持平;「不会有幻觉」不成立——官方文档原话「类型化输出保证的是接口,不是真相」;而最核心的卖点「校准概率」至今没有任何公开校准或基准可验证。接入走 Vercel AI Gateway(typesafe-ai/jev),只能用 AI SDK 7 的 experimental_evaluate 调用,OpenAI 兼容 endpoint 不支持;拍片时官方 API 还在排队,现已自助开放、另有 Ollama 本地路线。作者自建了一个一文件 Next.js Playground 跑了六个场景:退款 boolean 换 state 看概率走、五问并发(实测 245ms/599 tokens,与单问几乎同延迟)、矛盾工单与乱码看置信度门控转人工、模型路由(改错别字选便宜模型,写 LRU+TTL 缓存以 1.0 概率选强模型)、评论审核直接传 JSON state、LLM 输出质检抓出故意埋的内部政策泄露——结论是 Jev 不替代语言模型:LLM 生成,Jev 在后面判断。官方 skill(typesafe-ai/skills,比模型发布还早三周)教 agent 三件事:按需读文档、从应用需求倒推判断、纠正 LLM 时代习惯。最终边界:答案空间能事先定义就用,要解释、要生成、选项没设计好就别用;闭源托管无权重,隐私自己权衡;先拿几十条有标注的数据对账,再决定上不上。
视频来源
01Coder
分步图文攻略
- 1
先把官方的数字摆上桌:便宜、快、与 Terra 打平
片子先把官方口径完整摆出来:输入每百万 token 0.042 美元、输出免费(根本没有输出 token)、端到端延迟 70-500 毫秒;官方工作流评测准确率 67.8%,与 GPT-5.6 Terra 的 67.9% 持平,成本是后者的 1/76、快 25 倍;结构化输出错误率 0%——「数学上不可能输出错误的类型」。背景也交代了:9 月 15 日上线当天 Hacker News 1679 分、400 多条评论,次日 Vercel 宣布 AI Gateway 接入;这是 TypeSafe 结束隐身后的第一个模型,创始人 Diogo 是前 OpenAI 的 RLHF 共同发明人。解说为频道主真人中文口播(片头自报「小木头」),全程扁平动态图形卡、无真人出镜——本页帧图即取自这些卡片。

官方口径:$0.042/M 输入、输出免费、70-500ms、67.8% vs 67.9%。跳转至 4:25 - 2
发布两天后,第三方审计开始逐行对账
数字发布两天后,第三方开发者就做了独立审计(画面署名一份 jev-exploration 复测项目,本节数字经频道转述):速度与成本倍数官方说 20-400 倍,独立测出来是 5-25 倍;延迟海外实测 1.6-3.7 秒,并非几百毫秒——不过频道也强调链路不同会有偏差。准确率与中档模型持平、落后于推理模型,「前沿智能」说过头了。「不会有幻觉」也不成立:官方文档自己写着「类型化输出保证的是接口,不是真相」——保证答案一定是你给的选项之一,不保证选对。最难验证的是校准:说的 80% 是不是真有 80% 概率对,目前没有任何公开校准或基准可评判,而这恰恰是该产品最核心的卖点。平衡口径:本站 benchmarks 页的三套自测(工单路由/垃圾识别/提示注入)实测 P95 为 290-410ms,与官方量级一致——两个信源共同指向同一句话:延迟跟链路走,以自己的接入路径实测为准。

五行对账:倍数缩到 5-25x、延迟 1.6-3.7s 看链路、「不幻觉」不成立。跳转至 5:52 - 3
频道的三点判词:便宜快是真的,格式安全不是答案正确
频道把整场对账收成三行判词:便宜和快是真的,倍数看你怎么比;类型安全 = 格式安全,不是答案正确;答案对不对,得在自己的场景里测。这与本站的立场一致——benchmark 报告里的自动化门限、人工分流与可复现 harness 都围绕「自己测」展开。这也是本页的定位:站内第一个「批判性独立实测」视角的攻略页——批评性结论署名频道与第三方审计观点,官方口径并列给出,不替任何一边背书。

频道判词:便宜快是真的——答案对不对,得在自己的场景里测。跳转至 6:05 - 4
接入路径:排队中的官方 API 与已在架的 Vercel AI Gateway
接入路径一共四条:官方 API、Vercel AI Gateway、AI SDK 的 evaluate 调用、官方 agent skill。拍片时(9 月中旬)官方 API 仍在排队发放,作者本人还在等待队列里,所以他走 Vercel AI Gateway:模型 ID 是 typesafe-ai/jev。两个必须记住的限制:只能通过 AI SDK 7 的 experimental_evaluate 调用;OpenAI 兼容 endpoint 不支持。时效注记:waitlist 已是历史——本站后续确认 Jev 已开放自助使用,且存在 Ollama 本地路线(见 run-jev-locally-guide)。

没排到官方 API?Gateway 上已有 typesafe-ai/jev——但只认 AI SDK 的 evaluate。跳转至 7:42 - 5
一个文件的 evaluate 路由:AI SDK 的最小接入面
作者用 TypeScript 手写了一个 Playground:服务端就一个文件 app/api/evaluate/route.ts——evaluate 传 model(Gateway 的 typesafe-ai/jev)、state、questions,拿到 answers 和 usage,顺手用 performance.now 记一下延迟一起返回。这个一文件形状就是通过 AI SDK 调 Jev 的最小面。后面六个场景的演示全部跑在这个 Playground 里:布局三栏——左边预设场景、中间请求、右边响应,请求和响应都能切到 JSON 看原始体。

一个文件就够:evaluate 传 model/state/questions,顺手计时。跳转至 8:02 - 6
五问并发与条件相关性:类别决定哪些答案有意义
场景二是一条复合工单:登录不上、上个月多扣了钱、要求退款、语气很急。五个问题一次发出——Choice 四选项分类、Score 四档故障程度、boolean 有无复现步骤、boolean 是否要求退款、Score 三档情绪——五个答案一起回来,实测 245ms、599 tokens,延迟与单问几乎相同。用法上的关键是条件相关性:故障严重程度只有类别是故障时才有意义,退款只有类别是收费时才有意义。传统做法串行追问,Jev 的建议是全部并行问,回来后代码只取相关项、不相关的忽略。随后作者换了条自相矛盾的工单——「一切正常,但什么都用不了。我不要退款,把钱退给我」——类别仍然必须选一个,但概率分布已经体现了不确定性。

五问一次回:类别决定哪些答案有意义,代码只取相关项。跳转至 9:58 - 7
乱码工单看置信度:类型永远对,答案不一定对
把状态换成一段乱码,它还是会选一个类别——再看置信度:这正是「类型永远是对的,答案并不一定对」的直接演示。代码里可以加一条规则:置信度低于阈值就转人工,这正是官方文档 confidence-gated routing 推荐的方案。skill 里还有两条纠偏:置信度只表示概率分布的集中程度,不表示整个流程的正确性;Noul 接近 0.5 是「是/否」各半,不是程度中等。官方 FAQ 补了一句反向建议:如果只是要选最优,直接取概率最高的那个,不要到处设置信度阈值。

乱码也必须选一个——置信度低于阈值就转人工(官方推荐方案)。跳转至 10:20 - 8
LLM 生成、Jev 判断:一次生成后面放一道校验
场景五给 Jev 定了位:状态里放两段用户问题和一段 LLM 客服回复草稿,提三个问题——回复质量 Score、有无泄露内部政策 boolean、语气 Choice(道歉/中性/推诿)。草稿里故意埋了一句内部政策「投诉两次以上可额外申请折扣券」,泄露项被抓出;删掉再跑,数据回落。场景四补充了 state 的一个友好细节:直接传 JSON 对象(作者/时间/正文/历史举报次数),不用拼成一段话,模型自己读字段——评论审核的三问(是否垃圾广告、冒犯程度、放行/人工复核/删除)就是这样跑的。结论画成了流程图:它不是用来替代语言模型的——LLM 负责生成,Jev 在后面负责判断,每次生成后面放一道校验。

不是替代语言模型:LLM 生成,Jev 在后面把一道关。跳转至 13:10 - 9
官方 skill 三件事:指文档、教拆需求、纠 LLM 时代习惯
真到自己项目要接 Jev,多半是让 Claude Code 这类编程 agent 去写。官方为此准备了 skill:仓库 typesafe-ai/skills,8 月 25 日就建好——比模型发布还早三周;整个仓库就一个 SKILL.md,不到 150 行;Claude Code 两条命令装成插件,其他 agent 用 npx skills add 安装。它不是 API 参考手册(在线文档才是事实来源,Mintlify 页面地址加 .md 即得 Markdown),做三件事:指向在线文档让 agent 按需读取;教 agent 从「应用要展示/选择/改变什么」倒推需要哪些判断,并列出 6 种场景形态(路由并填参数、选择而不是生成、检索后判断证据、把判断变成可复用数据、校验并且升级、随状态变化决定下一步);以及纠正 LLM 时代的习惯——相互独立的问题一次性都问(包括投机性问题),问题和阈值常量放同一个文件方便人审。

不是 API 手册,是一套工作流:按需读文档、倒推判断、纠偏习惯。跳转至 15:04 - 10
用与别用的边界,以及频道给的起步方法
初步体验后的判断卡把边界画得很清楚。用:答案空间事先能定义的场景——分类、路由、打分、验证,以及需要每秒几次决策的实时循环,这些场景里语言模型的文本生成开销是实实在在的。别用:需要解释(它给不了理由)、需要生成(它不会写字)、选项设计不好(正确答案可能不在选项里,概率还得落在剩下的选项里)——官方也承认,难的部分从写提示词变成了设计决策的模式。两条补充:闭源托管 API、无权重,隐私敏感场景自己权衡(社区已有人在用 Qwen 微调做带校准概率的开放权重复刻);频道给的建议是拿手头真实的分类/路由任务先跑几十条有标注数据,看概率与标注对不对得上,再决定要不要放进系统。

答案空间定义得了就用;要理由、要生成、选项没设计好就别用。跳转至 15:57
常见问题(FAQ)
Jev 值得用吗?
频道实测后的判断:便宜和快是真的,值不值取决于任务形状。答案空间能事先定义的场景——分类、路由、打分、验证,以及每秒几次决策的实时循环——省下的文本生成开销是实打实的,值得用;需要解释、需要自由生成、或选项设计还没想清楚的场景就不值得。落地检验法:拿自己任务里几十条有标注的数据先跑一遍,看概率和标注对不对得上,再决定要不要进系统。
这期 Jev 实测的结论是什么?
五行对账:官方 20-400 倍的倍数被第三方复测修正为 5-25 倍;海外实测延迟 1.6-3.7 秒(本站 benchmark 自测三套任务的 P95 为 290-410ms——延迟跟链路走);准确率与中档模型持平、落后推理模型;「不会有幻觉」不成立——类型化输出保证的是接口,不是真相;校准至今没有公开校准或基准可验证,而这恰是核心卖点。一句话:便宜快是真的,类型安全只是格式安全,答案对不对得在自己场景里测。
Jev 到底有多快?
取决于谁的数字、走哪条链路:官方口径 70-500ms 端到端;视频转述的第三方海外实测 1.6-3.7 秒;本站自己的三套 benchmark 实测 P95 290-410ms。三个口径都诚实——延迟由网络链路与接入方式决定,所以所有来源最终都指向同一句话:用自己的链路实测。另一个来自视频的数据点:五问并发的延迟与单问几乎相同(实测 245ms、599 tokens),问题数量几乎免费。
Jev 会幻觉吗?
官方「不会有幻觉」的说法不成立——这正是视频演示的核心:类型化输出保证的是接口,不是真相;答案一定是你给的选项之一,但不保证选对。喂它一条自相矛盾的工单,类别照样选一个,但概率分布已经体现不确定性;喂它一段乱码,置信度走低。要做的事恰恰建在这上面:用置信度门控自动化、低置信度转人工(官方文档的 confidence-gated routing 方案)——同时记住 置信度只表示概率分布的集中程度,不表示整个流程正确。
Jev 和直接调大模型比,成本怎么样?
官方定价:输入每百万 token 0.042 美元,输出免费——根本没有输出 token。对 GPT-5.6 Terra:官方工作流评测准确率 67.8% 对 67.9% 持平,成本 1/76、快 25 倍;第三方复测把速度与成本倍数落在 5-25 倍(看跟谁比)。下游还有一层省法:模型路由这一步的耗时与费用,和真正调用大模型相比可以忽略。LLM 输出把关模式里则两者分工——LLM 照常生成,Jev 在每次生成后面加一道便宜的判断。
Jev 有哪些接入路径?
四条:① 官方 API——拍片时还在排队发放,现已自助开放,另有 Ollama 本地路线;② Vercel AI Gateway,模型 ID typesafe-ai/jev;③ AI SDK 7 的 experimental_evaluate 调用——Gateway 上唯一支持的调用方式,OpenAI 兼容 endpoint 不支持;④ 官方 agent skill(typesafe-ai/skills)——不到 150 行的 SKILL.md,给编程 agent 指文档、教拆需求、纠 LLM 时代习惯。
相关推荐
Jev 入门:从零到第一次 API 调用
概念与上手细节本页刻意不展开(对账时一笔带过);第一次调用的分步教学在那边。
阅读Jev Playground 逐场景走读(站内工具)
视频里是作者自建的 Playground;本站自己的在线 playground 走读在那一页——不用写代码就能亲手换 state 看概率。
阅读本站 Jev Benchmark 自测报告
与视频转述的第三方审计互为对照:工单路由 Macro F1 78.4%、P95 410ms,垃圾识别 320ms、提示注入防御 290ms,附复现 harness。
阅读Jev vs GPT-5.6 Luna 基准对照
第三方基准轴上的另一种读法——准确率、延迟、成本三角怎么量才公平。
阅读本地跑 Jev(Ollama 路线)
片中「官方 API 还在排队」已成历史:自助开放与本地路线的安装与端点在这篇。
阅读更多视频攻略
- Jev 极速分类实战:从 API 调用到 Choice/Score/Noul 三大原子类型
- 7 分钟透析 Jev 架构:为什么 70ms 决策模型颠覆了 LLM 自动化工作流?
- Jev 赋能极速浏览器 Agent:178ms DOM 决策循环与双模型协作实战
- OpenJevs 开源 Jev 模型全景:Semif、Nimble、Decider、DiffusionGemma 与 Laya 实测
- Jev 会取代 LLM 吗?Krish Naik 白板图解 Jev vs LLM 与混合架构
- Jev Trader 教程:在 Monad 上搭建亚秒级 AI 交易机器人
- Jev Model Router 实战:用 Jev 搭建带隐私门控的本地模型路由器
- Jev 入门教程:State、三类问题与 TypeScript SDK 实操
- 本地跑 Jev:Kev、SemIf 与 Von,自己的 GPU 就够了
- Jev RAG Reranker 实战:用可执行 criteria 打造策略化检索重排
- Jev 什么时候该用:工程视角核实宣传口径、守门与失败模式
- LangChain + Jev 集成实战:路由、护栏与评测
- Jev MCP Server 接入指南:把 Jev 决策层接进 Claude Code 与 Cursor
- Jev vs Luna 独立基准实测:「更快更准更便宜」是真是假?
- Jev Agent Harness 实战:决策闸门该装在 LLM 循环的哪个位置
- Jev Playground 实测攻略:热狗课程、criteria 校准与四平台 token 账单
- Jev 文本分类 API 实战:用 classifier.dev 打通零样本 CLI 与 REST 调用
- Jev API 实战示例:第一条 curl、载荷结构与三种问题类型
- 用 Expanso Edge 和 Jev 搭建日志分流流程
- Treg + Jev 线索丰富:ICP 分类与注册用户评分
- 在 Heym 中使用 Jev 决策节点:语言判断与模型路由
- Laya 上手教程:开源自托管决策引擎的安装、路由与概率校准(Laya vs Jev 实操)
- 训练自己的 Jev:花 $5–$17 微调一个 Jev 式决策模型(能训什么、不能训什么)
- Jev 实用技巧:拿到更好决策结果的 8 条最佳实践(state、questions、criteria 与阈值)
- Jev 上下文压缩实战:不用生成式摘要,直接剪枝 Agent 记忆
- Jev 当 LLM 评审:置信度级联,只要强模型 0.36% 的成本
- TypeSafe Computer Use 实操:用 Jev 做本地桌面自动化
- Jev 简历筛选实战:Express + Jev JavaScript SDK 搭一个 AI 简历评估器
- Jev + Claude Code 实战:语音控制浏览器,类型化决策全程接管
- Jev vs Ollama:本地跑 AI 决策,数据不出门真的可行吗?
- 自己动手造一个 Jev:免费开源零样本分类器(还能打 Doom)
- CUA-S1-Forms:706K 参数的 Jev 型表单填写模型,CPU 就能跑
- 用 Jev 做 NOC/SOC 告警分诊:规则先行、一个类型化问题、一道策略闸门
- Ollama 决策模型实测:tev1 + nimble 跑在 8GB 显卡上
- Jev 生产环境护栏:五步接入实战手册
- Pi Agent 防跑偏插件实战:让 Jev 出概率,让代码做决定
- Tev1 用例实测:50 个任务看尽本地决策模型的能力边界
- Jev 工单分类实战:after-insert hook 与计算字段两种接法