Guides / 视频转图文攻略
Ollaya 实操指南:装好「决策模型界的 Ollama」,看清每一个厂商口径数字,再亲手补上它留白的 CPU 实测
把 LocalLayer 的 Ollaya 上手实测视频整理成分步图文:这个 Rust CLI + 常驻 daemon 到底是什么(以及为什么它不是 Ollama)、一行安装、/v1/systemone 与托管 Jev 客户端的线级兼容、HN 热度与质疑段、模型清单、benchmarkheaven 榜单的正确读法、MCP 工具调用——所有延迟数字一律标注 vendor-reported,CPU 数字按视频本意留白给你亲手测。
速览结论
这是 LocalLayer 对 Ollaya——本地决策模型运行器——的九分半钟上手实测,而第一件要修正的事就是名字。Ollaya 不是 Ollama:Ollama 是你熟悉的通用 LLM 运行时;Ollaya 是一个决策模型运行器,自称「决策模型界的 Ollama」(repo 描述原文:拉取并提供 Laya、decider、NLI 和 GliClass,藏在一个 TypeSafe 兼容 API 背后)。这种混淆是可以测量的——本视频的机翻转写稿把品牌名渲染成「Ollama」「O LLaMA」甚至「Ought to lie」——所以下面每个事实都来自卡面,不来自转写稿。架构:Rust CLI 加常驻后台 daemon;CLI 把请求发给 daemon,daemon 用本地 HTTP API 暴露一切;运行时 Apache-2.0;自带模型分持 MIT(llama.cpp、NLI)与 Apache-2.0(Laya、Decider、Kev)两档许可证。录制时点 repo 显示 main 上 105 个 commit、386 stars、14 forks、6 个 open issue,统计口径 as of Sep 27, 2026(转写稿里的「September 26, 2024」年份是讹误)。安装:curl -fsSL https://ollaya.dev/install.sh | sh——一条脚本,零编译。首跑:ollaya run laya --preset triage "I was charged twice for my subscription this month and want a refund." 返回 department: billing (confidence 0.78)。数字部分——全部 vendor-reported,视频自己就打了这个标签:RTX 4090 上 laya:en 8-10ms 含完整 HTTP 往返(未预热首查 8.1ms);同配置下 decider 2B 平均约 190ms——模型体量本身就是变量;对照组 TypeSafe 托管 Jev API 报价 236-276ms 每次计费调用。迁移只是改个 URL:现有托管 API 客户端原样指向本地 daemon,因为 streaming 格式完全一致——原生端点 /v1/systemone,/v1/decisions 是文档写明的精确别名,鉴权头 Bearer local(转写稿把这些讹成 chat-completions 路径;以卡面为准)。2026 年 10 月 1 日起出现了第二条本地路线:Ollama 0.35 宣布原生支持 Jev 型决策模型,通过自己的 /v1/systemone 提供 tev1 和 Nimble(我们的 Ollama 决策模型指南已实测)。两边在线协议上正在收敛;差别在身份——Ollaya 是决策优先,带策划好的决策模型菜单和 OLLAYA_DEVICE 设备切换,Ollama 是长出决策端点的通用运行时——所以按模型菜单和运行器手感选;如果还在犹豫「该不该本地」,先读我们的托管-本地对比,再看这篇怎么装。热度:Hacker News 一个帖子(item 49848269,提交人 Ardakilic)直播快照 586 分 / 139 评,18 小时口径 489 分 / 122 评——同一帖两个时点,计数仍在爬——同周第三方 Web UI 帖停在 5 分。质疑:HN 用户 hbrn——「决策模型只是营销话术。决策模型 = 分类器。」视频的回应是开箱:nli 435M 和 qwen3guard 600M 是纯分类器;kev 9B 和 winnow 12B 是被改造来给选项打分而非写句子的 decoder;罩在上面的是同一份契约——书面问题加输入状态,单次前向,输出校准概率图,没有解码循环——laya router 按请求在 laya:en 和 laya:multilingual 之间挑选,文档称不增加可测延迟,因为它不碰模型本身。基准:benchmarkheaven.com 第三方、未审计、分数漂移——Jev 1.13.0 capability 64.7 居首、composite 63.3 居次;Laya(ModernBERT-Large、421M 参数、榜单卡署名 Convai Innovations;Ollaya 打包发行、并未训练、表格标注为 Jev 的 reconstruction)双榜 #41:49.9 / 30.3,每千次决策约 $0.0029——用低一截的能力换近零成本和个位数毫秒的延迟。HN 帖引的是 63.29 / 30.25,事后 live 复查 63.3 / 30.3——舍入内吻合,没人挑数字。工作流红利:一个 daemon 覆盖工单分诊(工单文本 → 部门、紧急度、退款)、shell 命令过滤(命令 → allow/block 标签——真实 HN 评论员因为标签集变化太快、不值得微调专用分类器而在用)和 agent 工具调用(路由问题 → 类型化选择),再加 MCP——agent 框架如 Claude Code 可以用一次 MCP 工具调用顶替一整次 LLM 调用,拿到的是类型化选项而不是要解析的文本。端到端 demo 把重复扣费工单打一次,同一个 JSON 返回 department billing 置信 0.78 外加 urgency 和 refund 字段,以及纳秒级耗时字段:eval_duration、load_duration、total_duration。结尾刻意留白:因为没有任何厂商发布 CPU-only 数字,视频镜头前用 OLLAYA_DEVICE=cpu ollaya run laya:en 重跑同一工单,然后拒绝读出数字——收尾卡写着「Run the CPU test. What's your eval_duration?」本页保持同样的纪律:这里也不出现任何 CPU 数值。补上这个缺口的,只能是你机器上的那一个数。
分步图文攻略
- 1
认识 Ollaya——先说清楚:它不是 Ollama
动手之前先把身份钉死,因为这个名字承载了太多。Ollaya 是一个决策模型运行器:Rust 写的 CLI 加一个常驻后台 daemon——daemon 呆在你机器上,接 CLI 发来的请求,用本地 HTTP API 暴露一切。它的 README 一句话自我定位——「Open decision models locally, the way Ollama runs LLMs」——repo 描述更进一步:拉取并提供 Laya、decider、NLI 和 GliClass,藏在 TypeSafe 兼容 API 背后。决策模型界的 Ollama。这句口号正是本页存在的原因:本视频的机翻转写稿把品牌名渲染成「Ollama」「O LLaMA」甚至「Ought to lie」,搜索结果也经常把两者混为一谈。所以直说:Ollama 是通用 LLM 运行时;Ollaya 是本指南要装的工具,它说的是决策,不是聊天。运行时 Apache-2.0,项目在 github.com/ollaya-dev/ollaya,官网 ollaya.dev;录制时点 repo 显示 main 上 105 个 commit、386 stars、14 forks、6 个 open issue,统计口径 as of Sep 27, 2026——对一个这么年轻的工具来说,够新、还在动。

混淆的源头就是这句 README——它故意拿 Ollama 来定位自己。跳转至 1:28 - 2
卖点:236-276ms 托管延迟变 8-10ms 本地——每个数字都是厂商口径
开场卡用一行讲完了全部论证。左边:TypeSafe 托管 Jev API,每次调用报价 236-276ms。右边:Ollaya 在 RTX 4090 上跑 laya:en,8-10ms——注意卡片下方的芯片:云端数字和本地数字都是完整往返耗时,所以这个对比诚实到把 HTTP 开销也算进去了,不是只算卡上算力。两个限定条件让它朝另一个方向也保持诚实。第一,未预热的首次查询是 8.1ms——稳定区间只在 daemon 热起来之后成立。第二,不是所有模型都这么快:同配置下 decider 2B 平均约 190ms(转写稿讹成「Mistral 7B」;卡面写的是 decider 2B),所以 8-10ms 属于小型分类器级模型,不属于整个菜单。最重要的是视频自己盖的章:「Every number here is vendor-reported。」这些数字没有一个出自频道实测,也没有一个出自我们——它们来自 Ollaya 自己的网站,对照组是托管 API 的按次计费报价。

一张卡讲完全部卖点——8-10ms 连 HTTP 往返都算进去了。跳转至 0:30 - 3
一行安装,跑通第一个决策
没有编译器、没有虚拟环境、没有模型寻宝:视频终端里整条上山路就是一条脚本——curl -fsSL https://ollaya.dev/install.sh | sh——紧接着一条真实查询:ollaya run laya --preset triage "I was charged twice for my subscription this month and want a refund." 下一行直接出答案:department: billing (confidence 0.78)。看清楚这次交互的形状,因为形状就是产品本身:一条本地命令吃进一段状态文本加一个任务 preset,吐出一个带置信度的类型化决策——没有聊天补全、没有提示词工程、没有要解析的流式文本。这也是你的第一道体检:装完脚本后这条命令能打印出部门和置信度,就说明 daemon 已起、laya:en 权重就位,后面的所有步骤不过是向同一个 daemon 要决策的更讲究的花样。

一行安装脚本、一条命令、一个带置信度的类型化答案。跳转至 8:46 - 4
把现有托管 API 客户端改指本地 daemon
迁移故事是这里低调的超能力。为 TypeSafe 托管 Jev API 写的现有客户端代码可以直接指向本地 Ollaya daemon,因为 streaming 格式完全一致——视频的原话是「现有集成里什么都不用改」。端点卡把契约写明:原生端点是 /v1/systemone;/v1/decisions 是文档写明的精确别名,走哪条路都命中同一个 handler;鉴权头是 Bearer local——一个占位 token,含义是「网络跳数如今是回环」。(本页特意按卡面引用:机翻转写稿把路径讹成了 v1/chat/completions——这又是一条「信帧不信稿」的理由。)实操上:改 base URL,保 payload,保响应解析器。迁移到此为止,这也是 repo 自述里「TypeSafe-compatible API」那半句的分量所在。

原生端点加精确别名——托管 API 客户端一行代码不用改。跳转至 2:40 - 5
Ollaya vs Ollama 0.35:运行器与运行时
2026 年 10 月 1 日之后,这场对比多了一位选手:Ollama 0.35 宣布原生支持 Jev 型决策模型,通过自己的 /v1/systemone 提供 tev1 和 Nimble——所以「Ollama 到底能不能跑决策」已经不是问题,这一节必须诚实面对。Ollaya 仍然立得住的是它的形状,不是线协议。它是决策优先的:整个表面——CLI preset、daemon、模型菜单——都为决策而生,而 Ollama 是长出了决策端点的通用 LLM 运行时。它的菜单从头到尾决策原生:repo 描述写明 Laya、decider、NLI、GliClass,下面的许可证表就是发货清单。它暴露设备切换(OLLAYA_DEVICE=cpu,最后一步的主角)、支持 MCP 让 agent 把决策当工具调。Ollama 0.35 相比之下带来的是成熟运行时生态的分量和自己的模型名册。许可证这边:Ollaya 运行时(CLI + daemon)Apache-2.0;部分模型 MIT(llama.cpp、NLI);多数模型 Apache-2.0(Laya、Decider、Kev)——两边都利于商用。怎么选?如果还在犹豫「该不该本地」,先读我们的 Jev vs Ollama 对比——那是「要不要」的问题——再回来照这篇装;Ollama 原生轴看我们的 Ollama 0.35 决策模型实测,两篇正好互补。

Apache-2.0 运行时 + 分开的模型许可——视频用它回答「能不能上生产」。跳转至 1:55 - 6
Hacker News 热度:一个帖子,两个时点
热度段和延迟段用同一把诚实的尺子。卡面是直播画面:「Ollaya – Ollama for open-source, Jev-style decision models」,提交人 Ardakilic,item 49848269——浏览器地址栏里清晰可读。录制时的直播快照:586 分、139 条评论;更早一次截取、18 小时口径:489 分、122 条评论。同一个帖子、两个时点——不是两个可以平均的信源,是一个高速爬升的讨论被抓拍了两次,本帧里计数器(580)还在肉眼可见地涨。视频还主动交待了留白处:同周另一个帖子——Ollaya 的第三方 Web 界面——停在 5 分,没能起飞。所以诚实的读法是:恰好一个爆发帖,实时增长中,属于运行器本身——没有首页连环轰,站内也没有第二处露面。是信号,不是饱和。

录制的瞬间计数还在涨——本帧 580,报告快照 586。跳转至 2:50 - 7
质疑段:「决策模型 = 分类器」
帖子里并非人人都买账,而视频做了一件少见的事:把最响的反对意见放上屏幕,还留着不走。HN 用户 hbrn:「决策模型」只是营销话术。决策模型 = 分类器。另一条回复说它的营销语言有误导性——系统只是对固定选项集吐概率,不是开放生成;第三条把官方示例还原成普通的文本分类任务。视频的回应不是反驳,而是换了个框架——而且换得对:这些模型里有一些就是分类器,毫不掩饰,下一步开箱会告诉你具体是哪些。真正新的不是某个模型家族,而是罩在它们上面的那份契约——书面问题加输入状态进,校准概率图出,一次前向——至于这份契约能不能敌过手搓分类器,问题的答案在你的工作负载里,不在词汇表里。如果你要的只是固定选项集上的分数,质疑者大方向没错,而你照样会被服务得很好;如果你需要生成文本,再多包装也改变不了这不是那把锤子的事实。

视频把最响的质疑放上屏幕——然后用下一节正面回应。跳转至 3:50 - 8
开箱:两个模型家族,一份契约
菜单来了,照卡面念:nli 435M 和 qwen3guard 600M——分类器家族,NLI 风格、只给选项打分、零生成;kev 9000M(9B)和 winnow 12000M(12B)——完整 decoder,被改造成给选项打分而不是写句子。身体不同,底下的契约相同:书面问题加输入状态进,单次前向跑完,校准概率图出——解码循环被整个跳过。视频的示意概率图是 billing 0.85、technical 0.06、account 0.09,外加一个覆盖整个响应的置信分。语言间的路由交给 laya router,按请求在 laya:en 和 laya:multilingual 之间挑;文档写明它不增加可测延迟,因为它从不接触模型本身。这就是「8ms 凭什么」的完整答案:没有任何东西被逐 token 生成,所以没有解码循环要付账——状态只读一次,所有选项在同一次前向里打完分。

上面两个分类器级,下面两个改造的 decoder——一套契约罩住四个。跳转至 4:30 - 9
benchmarkheaven:live、未审计的榜单——按这个读法读
一位 HN 评论员贴出了 benchmarkheaven.com 上的 Jev 实时榜单,视频引用它时把注意事项重复到刻进脑子:第三方、未审计、分数随时间漂移——live 快照,不是认证基准。截取时的数字:Jev 1.13.0 以 64.7 领跑 capability(capability 平均了智力与校准),composite 63.3 居次。Laya——Ollaya 发行的那颗模型——双榜 #41:capability 49.9、composite 30.3。榜单卡把 Laya 署名给 Convai Innovations,底座是 ModernBERT-Large、421M 参数;Ollaya 打包并发行它,但没有训练它,表格自己也把它标注为 Jev 的 reconstruction。价格栏:每千次决策约 $0.0029,是榜内最便宜的一档——取舍写得明明白白:用低很多的能力换近零成本和个位数毫秒的延迟。视频还替你跑了一次一致性核对:HN 帖里引的是 63.29 和 30.25,事后 live 复查读数 63.3 和 30.3——舍入范围内吻合,没人挑数字。把这张表当天气看,别当气候。

四个数字讲清取舍:capability 64.7 对 49.9,composite 63.3 对 30.3。跳转至 6:35 - 10
三件活,一个 daemon——外加给 agent 的 MCP
用例卡读起来像同一个 daemon 的产品巡礼:工单分诊吃工单文本,返回部门、紧急度、退款;命令过滤吃一条 shell 命令,返回 allow/block 标签;agent 工具调用吃一个路由问题,返回类型化选择。中间那个带着真实世界的背书:一位 HN 评论员拿它过滤实时 shell 与命令历史,理由是标签集变得太快、不值得为它微调一个专用分类器——这正是「选项写在请求里」击败「冻结标签头」的典型失败模式。然后是让它成为 agent 原语的那层集成:Ollaya 说 MCP(Model Context Protocol)。流程图从 Claude Code → tool call → MCP → typed question → 决策模型:agent 框架可以把决策模型当工具调,而不是在任务中途为一次路由决策花掉一整次 LLM 调用。一次 MCP 调用顶替一次完整调用,返回值是类型化选项而不是要解析的段落——当 agent 循环的下一步是代码而不是一段文字时,你要的恰恰就是这个。

agent 路径:一次 MCP 工具调用,顶替过去一整次聊天补全。跳转至 8:00 - 11
端到端:一张工单、三个答案、一张纳秒级收据
demo 把闭环补完,用的还是安装那步的重复扣费工单,这次走本地 HTTP API 一发请求:响应返回部门——billing,置信 0.78——外加 urgency 和 refund 字段在同一个 JSON 里。没有第二次调用、没有链式拼接;「三个答案」之所以是一次响应,是因为问题们挂在同一份共享状态上、走同一次前向。标题为「The receipt is in eval_duration」的卡展示了 response.json 的形状:department: {"choice": "billing", "confidence": 0.78},后面跟着 eval_duration、load_duration、total_duration——以纳秒报告的耗时字段。这张收据不只是记账:eval_duration 是每次调用自带、自我报告的测量值,它让本指南里每个数字都能在你自己的硬件上复核——最后一步利用的正是这个性质。模型自带秒表的时候,谁的基准你都不用全信——包括厂商的。

billing 0.78 外加耗时收据——全片的戏眼就在 eval_duration 这个字段。跳转至 9:05 - 12
视频拒答的 CPU 测试——你来跑
到目前为止每个延迟数字背后都有一块 GPU,而且没有任何厂商发布过这些模型的 CPU-only 数字——视频把这个空缺做成了自己的结尾。方法就两行:同一条查询跑两遍,一遍 OLLAYA_DEVICE=cpu,一遍默认 GPU 路径——OLLAYA_DEVICE=cpu ollaya run laya:en "I was charged twice for my subscription this month and want a refund."——然后把两个 eval_duration 字段并排放,差值直接从上一步那张收据里读。视频刻意没做的事,是告诉你 CPU 结果。收尾卡写着:「Run the CPU test. What's your eval_duration?」——数字留给观众测,本页保持同样的纪律:这里也不出现任何 CPU 数值,因为印一个出来,不过是往未验证数字堆上再添一个。值得记住的换算:无论哪边边际成本都近零,延迟从个位数毫秒到几百毫秒不等,取决于模型体量和设备。所以跑那两条命令,读你的两个 eval_duration,你手里就有了这个故事里唯一一个厂商没发布过的数字。如果你的硬件本来就只有 CPU,我们的 Julia-1 教程覆盖了 CPU 优先路线,正好互补。

命令亮出来、数字留白——视频的收尾挑战,本页原样保留。跳转至 9:12
常见问题(FAQ)
Ollaya 是什么?
Ollaya 是一个本地决策模型运行器——自我描述为「决策模型界的 Ollama」。它是 Rust CLI 加常驻后台 daemon,暴露一个本地 HTTP API(原生端点 /v1/systemone,/v1/decisions 是精确别名,鉴权头 Bearer local)。你发一份书面问题加输入状态,它在单次前向里返回选项集上的校准概率——零文本生成。运行时 Apache-2.0,项目在 github.com/ollaya-dev/ollaya(官网 ollaya.dev),厂商口径 laya:en 在 RTX 4090 上 8-10ms 含 HTTP 往返。
Ollaya 和 Ollama 是同一个东西吗——Ollama 0.35 出来后它还有必要吗?
两个不同的工具,名字容易混(机翻转写稿经常把 Ollaya 写成「Ollama」甚至「Ought to lie」)。Ollama 是通用 LLM 运行时;Ollaya 是决策优先的运行器。2026 年 10 月 1 日起,Ollama 0.35 提供了原生 Jev 型决策模型支持,通过自己的 /v1/systemone 提供 tev1 和 Nimble——所以两边端点正在收敛,Ollaya 不再是唯一的本地选项。Ollaya 仍然不同的地方:策划好的决策模型菜单(Laya、decider、NLI、GliClass,外加 kev 和 winnow)、只做决策的 CLI 与 daemon、OLLAYA_DEVICE 设备切换、MCP 工具调用支持。按模型菜单和运行器手感来选;如果还在犹豫「该不该本地」,从我们的 Jev vs Ollama 对比起步,Ollama 原生轴看我们的 Ollama 0.35 决策模型指南。
8ms 这个数字有多真?
它是厂商口径(vendor-reported),视频和本页都保留这个标签:Ollaya 官网报告 laya:en 在 RTX 4090 上 8-10ms,且这个数字含完整 HTTP 往返,不只是卡上算力。未预热的首次查询实测 8.1ms。两条诚实的脚注:同配置下 decider 2B 平均约 190ms——个位数属于小模型,不属于整个菜单——对照目标 TypeSafe 托管 Jev API 报价 236-276ms 每次调用。这些没有一个是独立测量;视频在屏幕上明说了(「Every number here is vendor-reported」),这也正是响应里带 eval_duration 字段让你自己读的原因。
Ollaya 自带哪些模型?
视频的菜单卡列出 nli(435M)和 qwen3guard(600M)——纯分类器——加上 kev(9B)和 winnow(12B),被改造成给选项打分而非写句子的 decoder 模型。repo 描述补上服务集:「拉取并提供 Laya、decider、NLI 和 GliClass,藏在 TypeSafe 兼容 API 背后。」laya:en 是 ModernBERT-Large 底座、421M 参数,榜单卡署名 Convai Innovations——Ollaya 打包并发行它,但没有训练它。许可证:Ollaya 运行时(CLI + daemon)Apache-2.0;部分模型 MIT(llama.cpp、NLI);多数模型——包括 Laya、Decider、Kev——Apache-2.0。
Ollaya 能替代分类器吗?能替代 LLM 吗?
在特定方式上,两者都行。HN 质疑者说决策模型「就是分类器」加营销话术,他们说对了一半:菜单里确实有一部分本来就是 NLI 分类器。这份契约加的是——选项写在请求里:书面问题加输入状态,一次前向返回校准概率图——所以你的标签集每次变化时,不用再训练或微调一个专用模型也能拿到分类器形状的答案。这正是那位真实 HN 评论员拿它过滤 shell 命令的原因:标签变化太快,冻结的专用分类器不值得。它替代不了 LLM 的生成:开放式的输出一点都没有,只有概率和类型化选择。如果你的任务是给固定选项集打分——分诊、路由、审核、allow/block——它非常对口;如果你需要成段的文字,就留着 LLM,用 MCP 把 Ollaya 架在它前面。
Ollaya 在 CPU 上多快?
诚实回答:没有答案,而且是故意的。视频指出没有任何厂商发布过这些模型的 CPU-only 数字,镜头前演示了方法——同一条查询跑两遍,一遍 OLLAYA_DEVICE=cpu、一遍默认 GPU 路径,然后对比 JSON 收据里的两个 eval_duration 字段——却仍然拒绝把 CPU 结果读出来,收尾停在「Run the CPU test. What's your eval_duration?」。本页保持同样的纪律,不会代编一个数字。在你的机器上跑 OLLAYA_DEVICE=cpu ollaya run laya:en "I was charged twice for my subscription this month and want a refund.",读你的 eval_duration(纳秒口径),你就拿到了这个故事里唯一一个厂商没发布过的数字——欢迎带上硬件型号去评论区交卷。
相关推荐
Jev vs Ollama 对比指南
「该不该本地化」的选型问题——本篇安装指南默认它已有答案。先读它,再回来照这篇装。
阅读Ollama 决策模型指南
Ollama 原生轴:0.35 通过 /v1/systemone 提供 tev1 与 Nimble,亲手实测。
阅读Laya 教程指南
laya:en 背后的模型本身,不含运行器——pip 安装、问题方案与 laya-serve。
阅读Jev 本地运行指南
本地决策的第一方路线——这个社区运行器生态所模仿的官方基准。
阅读Julia-1 教程指南
CPU 优先的小模型路线——与一个只给了 GPU 数字、CPU 留白的运行器天然互补。
阅读开源 Jev 模型全景
开源决策模型全景(含 Laya)——看这个运行器的菜单在整个赛场里的位置。
阅读工单路由配方
把 demo 里的分诊形状搭出来——一张工单正文出部门、紧急度、退款三个答案。
阅读更多视频攻略
- Jev 极速分类实战:从 API 调用到 Choice/Score/Noul 三大原子类型
- 7 分钟透析 Jev 架构:为什么 70ms 决策模型颠覆了 LLM 自动化工作流?
- Jev 赋能极速浏览器 Agent:178ms DOM 决策循环与双模型协作实战
- OpenJevs 开源 Jev 模型全景:Semif、Nimble、Decider、DiffusionGemma 与 Laya 实测
- Jev 会取代 LLM 吗?Krish Naik 白板图解 Jev vs LLM 与混合架构
- Jev Trader 教程:在 Monad 上搭建亚秒级 AI 交易机器人
- Jev Model Router 实战:用 Jev 搭建带隐私门控的本地模型路由器
- Jev 入门教程:State、三类问题与 TypeScript SDK 实操
- 本地跑 Jev:Kev、SemIf 与 Von,自己的 GPU 就够了
- Jev RAG Reranker 实战:用可执行 criteria 打造策略化检索重排
- Jev 什么时候该用:工程视角核实宣传口径、守门与失败模式
- LangChain + Jev 集成实战:路由、护栏与评测
- Jev MCP Server 接入指南:把 Jev 决策层接进 Claude Code 与 Cursor
- Jev vs Luna 独立基准实测:「更快更准更便宜」是真是假?
- Jev Agent Harness 实战:决策闸门该装在 LLM 循环的哪个位置
- Jev Playground 实测攻略:热狗课程、criteria 校准与四平台 token 账单
- Jev 文本分类 API 实战:用 classifier.dev 打通零样本 CLI 与 REST 调用
- Jev API 实战示例:第一条 curl、载荷结构与三种问题类型
- 用 Expanso Edge 和 Jev 搭建日志分流流程
- Treg + Jev 线索丰富:ICP 分类与注册用户评分
- 在 Heym 中使用 Jev 决策节点:语言判断与模型路由
- Laya 上手教程:开源自托管决策引擎的安装、路由与概率校准(Laya vs Jev 实操)
- 训练自己的 Jev:花 $5–$17 微调一个 Jev 式决策模型(能训什么、不能训什么)
- Jev 实用技巧:拿到更好决策结果的 8 条最佳实践(state、questions、criteria 与阈值)
- Jev 上下文压缩实战:不用生成式摘要,直接剪枝 Agent 记忆
- Jev 当 LLM 评审:置信度级联,只要强模型 0.36% 的成本
- TypeSafe Computer Use 实操:用 Jev 做本地桌面自动化
- Jev 简历筛选实战:Express + Jev JavaScript SDK 搭一个 AI 简历评估器
- Jev + Claude Code 实战:语音控制浏览器,类型化决策全程接管
- Jev 接入 Codex 实操:typesafe-ai/skills 安装与 Gmail 30 封邮件分诊
- Jev vs Ollama:本地跑 AI 决策,数据不出门真的可行吗?
- 自己动手造一个 Jev:免费开源零样本分类器(还能打 Doom)
- CUA-S1-Forms:706K 参数的 Jev 型表单填写模型,CPU 就能跑
- 用 Jev 做 NOC/SOC 告警分诊:规则先行、一个类型化问题、一道策略闸门
- Ollama 决策模型实测:tev1 + nimble 跑在 8GB 显卡上
- Jev 生产环境护栏:五步接入实战手册
- Pi Agent 防跑偏插件实战:让 Jev 出概率,让代码做决定
- Tev1 用例实测:50 个任务看尽本地决策模型的能力边界
- Jev 实测:官方宣称与独立复测之间的距离
- Jev 工单分类实战:after-insert hook 与计算字段两种接法
- OpenJev RLCD 实操:开源校准决策模型本地部署全指南
- Clef-Flash vs Jev 实测:把 Cloudflare 决策模型装进 Ollama(Q4_K_M)
- Clef-Flash 实操教程:在 Ubuntu 上从零安装并本地运行 Cloudflare 9B 多模态决策模型
- CLM-8B 架构深潜:44 毫秒打分 1,024 个候选的对比决策模型(比 Jev 快 13 倍)
- Nox 4B 实测教程:本地跑通 Decision 2.0 决策模型,四道真实考题与一次诚实的失败
- Julia-1 实操教程:纯 Python 装上开源 Jev 替代品,10 条客服消息实测 9 比 2
- OpenJev 0.8B CPU 实战:用工单收件箱校准 NLI 路由阈值
- Jev n8n 集成实战:JevGate 社区节点分步攻略(附纯 HTTP 备选路线)
- NanoJev 实操教程:本地部署 0.6B 开源 Jev 复刻,亲眼看它以 47ms 跑迷宫、按概率做路由
- PPLX Decider 实操教程:Perplexity 开源 27B 决策模型、Decisions API 与 12 张工单的分诊实测
- AutoTrust JEV-27B 本地实测:四臂对照、72 道 held-out 题,和一个 0.969 高分的错误答案
- Clef 27B 本地实战:Cloudflare 多模态决策模型一次读懂图片、视频和乌兹别克语报纸
- Strands Decider 2B 实测:8GB 笔记本本地安装 AWS Strands 系决策模型,把失败段也留在这页里