Guides / 视频转图文攻略

Jev vs Ollama:本地跑 AI 决策,数据不出门真的可行吗?

逐帧拆解 CloudAICode 的 14:26 对比:托管 Jev 每百万输入 token 约 $0.042,本地决策模型——Qwen 3.5 上的 Kev、零训练读分数的 SemIf、CPU 可跑的 Von——精度差多少、延迟如何、置信度还准吗,以及什么时候值得把数据留在自己机器上。

速览结论

CloudAICode 这支 14 分 26 秒的视频只回答一个问题:带概率、带类型的 AI 决策,能不能不出你的机器?开场先立云端基线——托管 Jev 每百万输入 token $0.042、每次决策约 $0.0004、输出芯片标注 70–500 ms——随后点出真正的拦路虎:当 state 里装着客户邮件、病历、内部文档或财务明细时,「最便宜的云端决策也可能根本不可行」。你要替代的不是一个聊天模型:类型化决策只能从 refund、escalate、reply、ignore 里选,结构上不可能冒出第五个选项——这正是用 Ollama 跑聊天 LLM 无法平替 Jev 的原因:提示词能逼出 JSON,却逼不出决策头和每个选项背后的校准概率。视频演示的本地路线是 Kev(Jared Palmer 基于阿里巴巴 Qwen 3.5 的 Apache-2.0 适配器):KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009 一条命令起服务,官方 Python SDK 只改一行——address 从 TypeSafe cloud 换成 http://127.0.0.1:8009,「同一套 System One 接口,只有地址变了」。在视频的对比测试里,新来源测试 Kev-0.8B 拿 68.4%、4B 拿 83.7%、9B 拿 85.2%,对托管 Jev 的 85.7%(dev);校准随规模变好(Brier 分数 0.8B 为 0.460、9B 为 0.237,test split,越低越好);Apple M5 上单次决策 0.8B 用 329 ms、4B 用 779 ms、9B 约 2,000 ms。SemIf(Theo Lee)走零训练路线:直接从你已托管的压缩版 Qwen 3.5 4B 里读分数,同一子集(102 行、20 个案例)上与托管 Jev 已公布结果 78.5% 的 modal agreement 达到 75.1%。Von 不需要显卡、CPU 就能跑,OpenJev 补上读图的视觉判断。收尾是一张天平卡:本地增益是不按 token 计费、上下文留在你的可控环境里;换来的是硬件电力、部署监控、校准安全三座山。高频、答案固定、容忍复核的场景——支持路由、垃圾过滤、反馈打标、线索打分——是本地的甜点区;输出无法预先穷举时(从支持队列到信贷审批再到医疗)本地剧本逐渐失灵。由于大部分公开基准都来自项目方自己、数据集各异,视频的最后一条命令是:从你自己的工作流里取约 100 条真实样本,测精度、看代价最大的错误、验证「90% 置信度是否真能对九次」,再决定把什么自动化。

视频来源

CloudAICode

14:26jxnywXprJQw

分步图文攻略

  1. 1

    先算云端基线:每百万输入 token $0.042

    对比从云端那张卡开始,而不是本地。TypeSafe 服务器上的 Jev 定价 $0.042/百万输入 token——每次决策约 $0.0004——输出芯片标注 70–500 ms。单次四百分之美分,视频的态度很明确:成本几乎从来不是离开云端的理由。真正推你走向本地的是别的东西,下一张卡就点破了。

    Jev 托管定价卡:每百万输入 token 0.042 美元、每次决策约 0.0004 美元,输出芯片标注 70–500 毫秒
    云端基线几乎免费——光看价格,没必要转本地。跳转至 1:02
  2. 2

    找到真正的拦路虎:是隐私规则,不是价格

    第二张卡把屏幕一分为二。左边是你的组织:客户邮件、病历、内部文档、财务明细。右边是 Hosted Jev:TypeSafe 的服务器、几乎免费——但中间立起一道「state 不能出门」的红色屏障后,它被标成 Unusable。这就是 Jev vs Ollama 式本地之争诚实的核心:最便宜的云端决策也可能根本不可行,因为合规规则一旦禁止数据出门,任何精度和价格数字都救不了它。

    Your organization 卡片列出客户邮件、病历、内部文档与财务明细,中间隔着「state 不能出门」屏障,右侧 Hosted Jev 标注 Unusable
    state 出不了门,再便宜的决策也用不了。跳转至 1:22
  3. 3

    想清楚你要替代的是什么:类型化决策,不是聊天

    伸手去拿本地 LLM 之前,先分清 Jev 到底做什么。对比卡一侧是自由生成——逐 token 续写、「可能冒出预料之外的第五个选项」;另一侧是类型化决策——只能在 refund、escalate、reply、ignore 里选,未列出的可能性直接被丢弃。这就是 Ollama 上的聊天模型靠提示词补不上的差距:让生成式 LLM 吐 JSON,得到的是形状像的文本,不是每个选项背后带校准概率的决策头。接口看起来像,保证不在。

    自由生成与类型化决策对比卡:前者逐 token 续写,后者只能从 refund、escalate、reply、ignore 中选择,未列出的可能性被丢弃
    类型安全意味着模型不可能返回第五个选项。跳转至 2:22
  4. 4

    跑通本地路线:在 127.0.0.1 上起 Kev-4B

    视频演示的本地路径是 Kev——Jared Palmer 基于阿里巴巴 Qwen 3.5 的 Apache-2.0 决策适配器。终端里一条命令起 4B 服务:KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009。应用侧的 diff 只有一行,官方 Python SDK 里 address = TypeSafe cloud 改成 address = http://127.0.0.1:8009。同一套 System One 接口,只有地址变了——这次替换就是全部迁移成本。这是大家期待「Ollama 式」本地体验的部分,只不过端口后面的模型说的是决策,不是聊天。

    终端以 KEV_DTYPE=bf16 uv run 启动 kev.serve 于 8009 端口,SDK 地址从 TypeSafe cloud 改为 http://127.0.0.1:8009
    同一套 System One 接口,只有地址变了。跳转至 5:22
  5. 5

    量一量转本地要接受的精度差

    视频的对比表给精度差标了价。训练同类任务上,本地适配器约 87%,托管 Jev 约 88%。换到新来源测试——模型没见过的材料——这一轮跑出 Kev-0.8B 68.4%、Kev-4B 83.7%、Kev-9B 85.2%,对托管 Jev 的 85.7%(dev)。趋势和数字一样重要:Kev 越大泛化越好,最小的那个在未见来源上让出十七个百分点。9B 落在云端半个百分点以内;0.8B 落不下。

    新来源测试表:Kev 0.8B 得 68.4%、Kev 4B 得 83.7%、Kev 9B 得 85.2%,托管 Jev 为 85.7%
    未见来源上,9B 与托管 Jev 只差半个百分点。跳转至 5:42
  6. 6

    掂量延迟:Apple M5 上单次 329 毫秒到 2 秒

    延迟这一项,本地模型分裂成两种产品。Apple M5 上,视频测得 0.8B 单次决策 329 ms、4B 779 ms——纸面上都快过云端卡片的 70–500 ms——而 9B 需要约 2,000 ms,是云端往返的四倍以上。把这张图和精度表放在一起看,交换关系就摆在桌面上了:快到「无感」的模型,正是未见来源掉到 68.4% 的那个;追平云端的那个,要么等一秒,要么插独显。

    Apple M5 单次决策延迟条形图:0.8B 为 329 毫秒、4B 为 779 毫秒、9B 约 2,000 毫秒
    小的本地模型跑赢云端芯片;准的那个掉了队。跳转至 6:42
  7. 7

    不想训练:直接从已有的模型里读分数

    SemIf(Theo Lee)是这个领域里的零训练选项:不做微调,直接从压缩版 Qwen 3.5 4B 里读分数,把一个未改动的开放模型变成决策引擎——最接近「用你已经下载好的模型文件」的路线。在视频的测量里,零微调拿到 75.1% 的 modal agreement,对托管 Jev 同一子集——102 行、20 个案例的 TypeSafe 精选集——已公布的 78.5%。零训练换三个百分点的一致度,硬件只要 RTX 3090 这个级别。

    SemIf 本地卡以压缩 Qwen3.5 4B 零微调取得 75.1% 一致度,对照托管 Jev 同一子集已公布结果 78.5%
    零训练、约三个百分点的一致度差——最便宜的本地实验。跳转至 7:42
  8. 8

    选之前先看清本地生态的全貌

    没有哪一个项目独占「本地 Jev」。对比表里并排四个:Von 基于 ModernBERT-Large,硬件触达面最宽,没有显卡、CPU 就能跑;Kev 基于 Qwen 3.5,带着 Jev 兼容接口;SemIf 在你已托管的未改动开放模型上跑这套技术;OpenJev 基于 Qwen 3.5,能读图做视觉判断。它们都不是 Ollama——Ollama 服务聊天式生成模型,这些暴露的是决策输出。按约束选:没显卡选 Von,已有 SDK 集成选 Kev,零训练选 SemIf,截图和票据选 OpenJev。

    开源项目表:Von 基于 ModernBERT-Large 无需显卡,Kev 基于 Qwen 3.5 提供 Jev 兼容接口,SemIf 复用未改动开放模型,OpenJev 负责视觉判断
    四个开源项目,四种上手的理由。跳转至 11:12
  9. 9

    判断什么时候本地真的划算

    收尾的天平卡给「Jev vs 本地」下了结论。本地增益:不按 token 计量计费、上下文留在你的可控环境里。换来的问题:硬件和电费、部署和监控、校准和安全。视频的场景卡把甜点区标成「高频、答案固定、容忍复核」——支持路由、垃圾过滤、反馈打标、线索打分;而输出无法预先穷举时剧本失灵,风险谱从支持队列(差几个点可接受)经信贷审批一路划到医疗(不可接受)。最后一条指令对本页每个模型都适用:从自己的工作流里收约 100 条真实样本,测精度、盯代价最大的错误、验证 90% 置信度是否真能十次对九次,然后再把任何环节交给自动化。

    天平卡:本地增益是无计量计费、上下文留在可控环境,代价是硬件电力、部署监控与校准安全
    本地赢在计量与数据驻留——运维也归了你。跳转至 12:42

常见问题(FAQ)

Jev 本体能放进 Ollama 里跑吗?

不能。Jev 是托管、闭权重的决策模型,Ollama 服务的是聊天式开源生成模型——没有 Jev 类型化决策头的等价物,也没有它的校准概率。视频里的本地替代品同样不走 Ollama:Kev 从 Qwen 3.5 适配器暴露 Jev 兼容的 System One 接口,SemIf 直接从你托管的模型里读分数,Von 在 CPU 上跑小型编码器。如果你想要的「Ollama」其实是本地掌控,真正保住类型化决策行为的是这几条路线。

本地决策模型真的比托管 Jev 便宜吗?

托管 Jev 按每百万输入 token $0.042 计费、单次决策约 $0.0004,在真正有量的场景里电表转速很低。转本地省掉 token 计费,但换来视频天平卡上的三座山:硬件与电力、部署与监控、校准与安全。在这个价位,单靠成本几乎撑不起迁移理由;真正撑得起的是禁止数据出门的隐私合规。

本地模型的精度差和校准差到底多大?

视频这一轮的数字:新来源测试 Kev-4B 83.7%、Kev-9B 85.2%,对托管 Jev 85.7%(dev),0.8B 只有 68.4%。校准随规模改善——test split 上 Brier 分数 0.8B 为 0.460、9B 为 0.237,越低越好。零训练的 SemIf 路线在同一 102 行子集上拿到 75.1% 一致度,对已公布的 Jev 结果 78.5%。视频自己也提醒:大部分公开基准来自项目方、数据集各异,当指示物看,别当排名看。

什么时候应该留在托管 Jev,不上本地?

隐私规则允许数据出门时,托管在视频测的每条轴上都赢:70–500 ms 响应、最好的校准、零硬件运维。本地剧本在「输出无法预先穷举」时开始失灵——风险谱从支持队列(差几个点可接受)到信贷审批,再到医疗(不可接受)。高频、答案固定、容忍复核的场景留给本地;其余默认回云端。

相关推荐

更多视频攻略