Guides / 视频转图文攻略
本地跑 Jev:Kev、SemIf 与 Von,自己的 GPU 就够了
拆解在你自己的硬件上跑 Jev 系决策模型:System One 模型背后的 logit 读取技巧、Qwen 3.5 上的即插即用 Kev、免训练的 SemIf、CPU 级的 Von,以及每种方案各牺牲了多少准确率。
速览结论
Jev 本体是托管且闭源的——每一次决策都要把 state 发到 TypeSafe 服务器,医院、银行或受数据协议约束的团队没法接受。开源生态复刻的是技巧而非模型:System One 决策的本质是「读允许答案的 logit」而不是「让模型写答案」,一次前向返回所有答案,模型不可能凭空捏造第五个选项。Kev(Jared Palmer 出品,基于阿里开源 Qwen 3.5)完整复刻了 Jev 的接口——把 base_url 改成 localhost:8080,同一份 SDK 代码直接可用——未见任务上 9B 跑出 0.852、4B 跑出 0.837,对位托管 Jev 的 0.883;4B 和 9B 都塞得进 32GB Mac。SemIf(Theo Lee 出品)完全免训练:直接给你已经在跑的 Qwen 4B 做 logit 打分,102 行对齐样本上拿下 81.3%(Jev 为 88.3%),同时比让模型写 JSON 快 5.21 倍。Von 干脆不要 GPU:395M 参数的 ModernBERT 编码器带三个决策头,CPU 上单次决策不到 15ms。诚实的代价:本地模型落在低到中 80 分段,对位 Jev 的高 80 分段——给工单排队是小事,给贷款审批是大事,所以先跑自己的 100 个样本,验证「87% 置信」是否真有 87 次是对的。
分步图文攻略
- 1
为什么要本地跑:state 才是敏感的那部分
开场 30 秒讲完全部动机:"my card just got charged twice. What do I do?" 落进本地模型,半秒内以 87% 置信选出 escalate——这位客户的信息没有离开房间。托管版 Jev 很优秀,但它闭源:每次调用都要把你的程序 state——用户消息、内部文档、客户记录——发到 TypeSafe 的服务器。对医院、银行或任何受数据协议约束的团队,这是硬性红线:决策不能在楼内跑,自动化就干脆不做。接下来所有内容,都围绕把 Jev 系决策搬上你已有的 GPU 或 CPU。

每一次托管调用都在把 state——用户的消息本体——送出你的机器。跳转至 2:20 - 2
核心技巧:读 logit,把句子扔掉
语言模型开口之前,会给每个候选词打一个叫 logit 的原始分。类型化决策跳过「写」这一步:你给定允许的答案——refund、escalate、reply、ignore——然后直接从模型里读每个答案的 logit。得分最高者胜,一次前向完成,模型不可能捏造第五个选项,也不可能用散文把答案裹起来。更进一步,多个问题可以共享一次阅读:模型把你的文档读一遍,笔记留在 key-value 缓存里,每个问题都从同一份笔记取用。在一个开源实现上,从零打分每秒只有几次;复用缓存后同一张卡能爬到每秒约 20 次。

一次阅读,多次决策——吞吐跃升全靠 key-value 缓存。跳转至 3:40 - 3
Kev:说 Jev 接口的「即插即用」
Kev 来自 Jared Palmer——Formik 和 Turborepo 的作者——是一小族基于阿里开源 Qwen 3.5 权重的决策模型:0.8B、4B、9B 三档。下载权重、起一个小型本地服务就能跑。让它成为省心之选的是接口还原度:Kev 完整复刻 Jev 的 API,所以你拿 TypeSafe 官方 SDK,把 base_url 从他们的云改成 http://localhost:8080,同一份应用代码直接工作——你的应用感知不到差别。Palmer 参考公开的 Jev 架构拆解文,用 AI 编码代理在几个周末里组装出它,还公开了评测——这比想象中罕见。

同一套 SDK,只改一行——决策端点从此住在你的机器上。跳转至 5:56 - 4
准确率的账单,用数字说话
在 Kev 没见过的任务上,9B 模型 dev 0.822、test 0.852,4B 是 0.797 和 0.837,对位托管 Jev 的 0.883 参考线——图上还画着 0.50 的抛硬币线作对照。校准度同样随体量提升:Brier 分数(越低置信越诚实)从 0.8B 的 0.468-0.499,降到 4B 的 0.255-0.299、9B 的 0.237-0.286。硬件方面,Palmer 表示 4B 和 9B 都塞得进 32GB Mac;实际操作里,中端卡上的 4B 就是干活甜点位。其他开源方案补齐其余空档:OpenJev(Alex Wartega)加了视觉——它的 4B 通过 entailment 训练能读截图和照片;Laya 小巧且说 100 种语言,但开箱接近随机(36%),在你的任务上微调后能跳到约 77%。

未见任务:9B Kev 0.852、4B 0.837,对位托管 Jev 0.883——接近,但不等。跳转至 6:10 - 5
SemIf:不训新模型,直接给你已有的模型打分
Theo Lee 开发的 SemIf 证明了这套技巧根本不需要专用模型。它的标语就是全部精神:在家里的 3090 上,用开源模型做语义 if。SemIf 拿一个你本来就有的开源模型——一个 4B Qwen——直接在它身上跑 logit 打分:不微调、不训练。共享基准上,它在 102 行对齐样本里拿到 81.3%,对位 Jev 的 88.3%;同时比让同一个模型把答案写成 JSON 快 5.21 倍(1.023 秒对 5.332 秒)——因为「生成 JSON」正是它删掉的那个慢环节。Lee 的严谨姿态也值得学:对比只覆盖约 100 个对齐问题而非全集,并且明说你必须在自己的负载上复核校准度。

SemIf 81.3% 对 Jev 88.3%——而且比同一模型写 JSON 快 5.21 倍。跳转至 7:30 - 6
Von:没有 GPU 时的 CPU 答案
Kev 和 SemIf 需要一块像样的 GPU,Von 不需要:它构建在 ModernBERT 之上——一个「读文本是为了判断而不是续写」的编码器,恰好就是决策的形态——在 2 万亿 token 上预训练,顶部接了三个决策头(选一个选项、是非判断、量表评分)。整个模型 395M 参数,磁盘上约 1.5GB,小到哪都能跑:CPU、旧笔记本、手机级芯片,不需要显卡,单次决策不到 15 毫秒。代价是锐度:干净的 20 桶路由任务上 Von 能到 83.4%,但铺到 49 个任务的杂烩套件就掉到 71.5%——指哪打哪,没指到的地方就晃。

395M 参数、约 1.5GB、单次决策不到 15ms——不需要 GPU。跳转至 8:35
常见问题(FAQ)
Jev 本体能本地跑吗?
不能——Jev 是托管闭源服务,每次调用都会把程序 state 发到 TypeSafe 服务器。能本地跑的是复刻同一套 System One 技巧(读允许答案的 logit)的开源模型:Kev(接口级 drop-in,基于 Qwen 3.5)、SemIf(给你已有的开源模型做 logit 打分)、Von(395M 编码器,CPU 可跑)、OpenJev(支持图片输入)和 Laya(小巧、100 种语言,需微调)。
本地 Jev 系模型该选哪一个?
视频给大多数人的首选是 4B Kev——真 drop-in,代码不动、base URL 指向 localhost,还有公开评测可查。如果更想给已在运行的模型打分、不想多托管一份权重,选 SemIf。完全没有 GPU?Von 在 CPU 上单次决策不到 15ms。想要最后几个点的准确率,9B Kev 需要工作站卡或 32GB Mac。
本地跑要牺牲多少准确率?
在已测任务上,本地方案落在低到中 80 分段,对位 Jev 的高 80 分段——比如 Kev-4B 的 0.837、SemIf 的 81.3%,对托管 0.883。给工单分类这个差距微不足道,给贷款审批就不是了。选项清晰、样本充足的封闭判断是甜点位;开放式判断、超长混乱上下文或有人刻意对抗的场景,仍然该留一个人在环上。
本地跑的成本是多少?
单次决策几乎零成本:没有按 token 计费,没有计量 API——GPU 一次买断(或用你已有的),一百万次决策只花电费。Von 在 CPU 上单次不到 15ms;4B Kev 或 SemIf 需要 8-12GB 显存的游戏卡;9B 要工作站卡或 32GB Mac。跑起来毫无仪式感:下权重、起一个本地小服务、把代码指向 localhost。
相关推荐
开源 Jev 模型全景
更完整的开源生态:JevBench 天梯、Laya 微调等。
阅读Jev Model Router 实战
真实部署:带 PII 门控,在本地 MiniCPM 与云端 DeepSeek 间路由。
阅读Jev 价格
托管 Jev 的单次决策成本——你本地方案对位的基线。
阅读更多视频攻略
- Jev 极速分类实战:从 API 调用到 Choice/Score/Noul 三大原子类型
- 7 分钟透析 Jev 架构:为什么 70ms 决策模型颠覆了 LLM 自动化工作流?
- Jev 赋能极速浏览器 Agent:178ms DOM 决策循环与双模型协作实战
- OpenJevs 开源 Jev 模型全景:Semif、Nimble、Decider、DiffusionGemma 与 Laya 实测
- Jev 会取代 LLM 吗?Krish Naik 白板图解 Jev vs LLM 与混合架构
- Jev Trader 教程:在 Monad 上搭建亚秒级 AI 交易机器人
- Jev Model Router 实战:用 Jev 搭建带隐私门控的本地模型路由器
- Jev 入门教程:State、三类问题与 TypeScript SDK 实操