Guides / 视频转图文攻略

Ollaya 实操指南:装好「决策模型界的 Ollama」,看清每一个厂商口径数字,再亲手补上它留白的 CPU 实测

把 LocalLayer 的 Ollaya 上手实测视频整理成分步图文:这个 Rust CLI + 常驻 daemon 到底是什么(以及为什么它不是 Ollama)、一行安装、/v1/systemone 与托管 Jev 客户端的线级兼容、HN 热度与质疑段、模型清单、benchmarkheaven 榜单的正确读法、MCP 工具调用——所有延迟数字一律标注 vendor-reported,CPU 数字按视频本意留白给你亲手测。

速览结论

这是 LocalLayer 对 Ollaya——本地决策模型运行器——的九分半钟上手实测,而第一件要修正的事就是名字。Ollaya 不是 Ollama:Ollama 是你熟悉的通用 LLM 运行时;Ollaya 是一个决策模型运行器,自称「决策模型界的 Ollama」(repo 描述原文:拉取并提供 Laya、decider、NLI 和 GliClass,藏在一个 TypeSafe 兼容 API 背后)。这种混淆是可以测量的——本视频的机翻转写稿把品牌名渲染成「Ollama」「O LLaMA」甚至「Ought to lie」——所以下面每个事实都来自卡面,不来自转写稿。架构:Rust CLI 加常驻后台 daemon;CLI 把请求发给 daemon,daemon 用本地 HTTP API 暴露一切;运行时 Apache-2.0;自带模型分持 MIT(llama.cpp、NLI)与 Apache-2.0(Laya、Decider、Kev)两档许可证。录制时点 repo 显示 main 上 105 个 commit、386 stars、14 forks、6 个 open issue,统计口径 as of Sep 27, 2026(转写稿里的「September 26, 2024」年份是讹误)。安装:curl -fsSL https://ollaya.dev/install.sh | sh——一条脚本,零编译。首跑:ollaya run laya --preset triage "I was charged twice for my subscription this month and want a refund." 返回 department: billing (confidence 0.78)。数字部分——全部 vendor-reported,视频自己就打了这个标签:RTX 4090 上 laya:en 8-10ms 含完整 HTTP 往返(未预热首查 8.1ms);同配置下 decider 2B 平均约 190ms——模型体量本身就是变量;对照组 TypeSafe 托管 Jev API 报价 236-276ms 每次计费调用。迁移只是改个 URL:现有托管 API 客户端原样指向本地 daemon,因为 streaming 格式完全一致——原生端点 /v1/systemone,/v1/decisions 是文档写明的精确别名,鉴权头 Bearer local(转写稿把这些讹成 chat-completions 路径;以卡面为准)。2026 年 10 月 1 日起出现了第二条本地路线:Ollama 0.35 宣布原生支持 Jev 型决策模型,通过自己的 /v1/systemone 提供 tev1 和 Nimble(我们的 Ollama 决策模型指南已实测)。两边在线协议上正在收敛;差别在身份——Ollaya 是决策优先,带策划好的决策模型菜单和 OLLAYA_DEVICE 设备切换,Ollama 是长出决策端点的通用运行时——所以按模型菜单和运行器手感选;如果还在犹豫「该不该本地」,先读我们的托管-本地对比,再看这篇怎么装。热度:Hacker News 一个帖子(item 49848269,提交人 Ardakilic)直播快照 586 分 / 139 评,18 小时口径 489 分 / 122 评——同一帖两个时点,计数仍在爬——同周第三方 Web UI 帖停在 5 分。质疑:HN 用户 hbrn——「决策模型只是营销话术。决策模型 = 分类器。」视频的回应是开箱:nli 435M 和 qwen3guard 600M 是纯分类器;kev 9B 和 winnow 12B 是被改造来给选项打分而非写句子的 decoder;罩在上面的是同一份契约——书面问题加输入状态,单次前向,输出校准概率图,没有解码循环——laya router 按请求在 laya:en 和 laya:multilingual 之间挑选,文档称不增加可测延迟,因为它不碰模型本身。基准:benchmarkheaven.com 第三方、未审计、分数漂移——Jev 1.13.0 capability 64.7 居首、composite 63.3 居次;Laya(ModernBERT-Large、421M 参数、榜单卡署名 Convai Innovations;Ollaya 打包发行、并未训练、表格标注为 Jev 的 reconstruction)双榜 #41:49.9 / 30.3,每千次决策约 $0.0029——用低一截的能力换近零成本和个位数毫秒的延迟。HN 帖引的是 63.29 / 30.25,事后 live 复查 63.3 / 30.3——舍入内吻合,没人挑数字。工作流红利:一个 daemon 覆盖工单分诊(工单文本 → 部门、紧急度、退款)、shell 命令过滤(命令 → allow/block 标签——真实 HN 评论员因为标签集变化太快、不值得微调专用分类器而在用)和 agent 工具调用(路由问题 → 类型化选择),再加 MCP——agent 框架如 Claude Code 可以用一次 MCP 工具调用顶替一整次 LLM 调用,拿到的是类型化选项而不是要解析的文本。端到端 demo 把重复扣费工单打一次,同一个 JSON 返回 department billing 置信 0.78 外加 urgency 和 refund 字段,以及纳秒级耗时字段:eval_duration、load_duration、total_duration。结尾刻意留白:因为没有任何厂商发布 CPU-only 数字,视频镜头前用 OLLAYA_DEVICE=cpu ollaya run laya:en 重跑同一工单,然后拒绝读出数字——收尾卡写着「Run the CPU test. What's your eval_duration?」本页保持同样的纪律:这里也不出现任何 CPU 数值。补上这个缺口的,只能是你机器上的那一个数。

视频来源

LocalLayer

9:43qxVtVBrCPK4

分步图文攻略

  1. 1

    认识 Ollaya——先说清楚:它不是 Ollama

    动手之前先把身份钉死,因为这个名字承载了太多。Ollaya 是一个决策模型运行器:Rust 写的 CLI 加一个常驻后台 daemon——daemon 呆在你机器上,接 CLI 发来的请求,用本地 HTTP API 暴露一切。它的 README 一句话自我定位——「Open decision models locally, the way Ollama runs LLMs」——repo 描述更进一步:拉取并提供 Laya、decider、NLI 和 GliClass,藏在 TypeSafe 兼容 API 背后。决策模型界的 Ollama。这句口号正是本页存在的原因:本视频的机翻转写稿把品牌名渲染成「Ollama」「O LLaMA」甚至「Ought to lie」,搜索结果也经常把两者混为一谈。所以直说:Ollama 是通用 LLM 运行时;Ollaya 是本指南要装的工具,它说的是决策,不是聊天。运行时 Apache-2.0,项目在 github.com/ollaya-dev/ollaya,官网 ollaya.dev;录制时点 repo 显示 main 上 105 个 commit、386 stars、14 forks、6 个 open issue,统计口径 as of Sep 27, 2026——对一个这么年轻的工具来说,够新、还在动。

    Ollaya README 引文卡,眉题写着 IT'S OLLAMA, FOR DECISION MODELS,正文是 Open decision models locally, the way Ollama runs LLMs 的定位宣言。
    混淆的源头就是这句 README——它故意拿 Ollama 来定位自己。跳转至 1:28
  2. 2

    卖点:236-276ms 托管延迟变 8-10ms 本地——每个数字都是厂商口径

    开场卡用一行讲完了全部论证。左边:TypeSafe 托管 Jev API,每次调用报价 236-276ms。右边:Ollaya 在 RTX 4090 上跑 laya:en,8-10ms——注意卡片下方的芯片:云端数字和本地数字都是完整往返耗时,所以这个对比诚实到把 HTTP 开销也算进去了,不是只算卡上算力。两个限定条件让它朝另一个方向也保持诚实。第一,未预热的首次查询是 8.1ms——稳定区间只在 daemon 热起来之后成立。第二,不是所有模型都这么快:同配置下 decider 2B 平均约 190ms(转写稿讹成「Mistral 7B」;卡面写的是 decider 2B),所以 8-10ms 属于小型分类器级模型,不属于整个菜单。最重要的是视频自己盖的章:「Every number here is vendor-reported。」这些数字没有一个出自频道实测,也没有一个出自我们——它们来自 Ollaya 自己的网站,对照组是托管 API 的按次计费报价。

    Ollaya 延迟对比卡「Cloud's 236-276ms becomes 8-10ms」:TypeSafe 托管 Jev API 卡与 Ollaya laya:en(RTX 4090)8-10ms 卡并排,右侧附云端与本地往返耗时芯片。
    一张卡讲完全部卖点——8-10ms 连 HTTP 往返都算进去了。跳转至 0:30
  3. 3

    一行安装,跑通第一个决策

    没有编译器、没有虚拟环境、没有模型寻宝:视频终端里整条上山路就是一条脚本——curl -fsSL https://ollaya.dev/install.sh | sh——紧接着一条真实查询:ollaya run laya --preset triage "I was charged twice for my subscription this month and want a refund." 下一行直接出答案:department: billing (confidence 0.78)。看清楚这次交互的形状,因为形状就是产品本身:一条本地命令吃进一段状态文本加一个任务 preset,吐出一个带置信度的类型化决策——没有聊天补全、没有提示词工程、没有要解析的流式文本。这也是你的第一道体检:装完脚本后这条命令能打印出部门和置信度,就说明 daemon 已起、laya:en 权重就位,后面的所有步骤不过是向同一个 daemon 要决策的更讲究的花样。

    Ollaya 终端卡「Install and run in one line」:ollaya run laya --preset triage 处理重复扣费工单,输出 department: billing(confidence 0.78)。
    一行安装脚本、一条命令、一个带置信度的类型化答案。跳转至 8:46
  4. 4

    把现有托管 API 客户端改指本地 daemon

    迁移故事是这里低调的超能力。为 TypeSafe 托管 Jev API 写的现有客户端代码可以直接指向本地 Ollaya daemon,因为 streaming 格式完全一致——视频的原话是「现有集成里什么都不用改」。端点卡把契约写明:原生端点是 /v1/systemone;/v1/decisions 是文档写明的精确别名,走哪条路都命中同一个 handler;鉴权头是 Bearer local——一个占位 token,含义是「网络跳数如今是回环」。(本页特意按卡面引用:机翻转写稿把路径讹成了 v1/chat/completions——这又是一条「信帧不信稿」的理由。)实操上:改 base URL,保 payload,保响应解析器。迁移到此为止,这也是 repo 自述里「TypeSafe-compatible API」那半句的分量所在。

    Ollaya 端点卡「Two endpoints, one alias」:高亮 /v1/decisions,旁边芯片列出原生端点 /v1/systemone、别名 /v1/decisions 与 Bearer local 鉴权头。
    原生端点加精确别名——托管 API 客户端一行代码不用改。跳转至 2:40
  5. 5

    Ollaya vs Ollama 0.35:运行器与运行时

    2026 年 10 月 1 日之后,这场对比多了一位选手:Ollama 0.35 宣布原生支持 Jev 型决策模型,通过自己的 /v1/systemone 提供 tev1 和 Nimble——所以「Ollama 到底能不能跑决策」已经不是问题,这一节必须诚实面对。Ollaya 仍然立得住的是它的形状,不是线协议。它是决策优先的:整个表面——CLI preset、daemon、模型菜单——都为决策而生,而 Ollama 是长出了决策端点的通用 LLM 运行时。它的菜单从头到尾决策原生:repo 描述写明 Laya、decider、NLI、GliClass,下面的许可证表就是发货清单。它暴露设备切换(OLLAYA_DEVICE=cpu,最后一步的主角)、支持 MCP 让 agent 把决策当工具调。Ollama 0.35 相比之下带来的是成熟运行时生态的分量和自己的模型名册。许可证这边:Ollaya 运行时(CLI + daemon)Apache-2.0;部分模型 MIT(llama.cpp、NLI);多数模型 Apache-2.0(Laya、Decider、Kev)——两边都利于商用。怎么选?如果还在犹豫「该不该本地」,先读我们的 Jev vs Ollama 对比——那是「要不要」的问题——再回来照这篇装;Ollama 原生轴看我们的 Ollama 0.35 决策模型实测,两篇正好互补。

    Ollaya 许可证表「One runtime, two license flavors」:CLI 与 daemon 运行时为 Apache-2.0,llama.cpp 与 NLI 模型为 MIT,Laya、Decider、Kev 为 Apache-2.0。
    Apache-2.0 运行时 + 分开的模型许可——视频用它回答「能不能上生产」。跳转至 1:55
  6. 6

    Hacker News 热度:一个帖子,两个时点

    热度段和延迟段用同一把诚实的尺子。卡面是直播画面:「Ollaya – Ollama for open-source, Jev-style decision models」,提交人 Ardakilic,item 49848269——浏览器地址栏里清晰可读。录制时的直播快照:586 分、139 条评论;更早一次截取、18 小时口径:489 分、122 条评论。同一个帖子、两个时点——不是两个可以平均的信源,是一个高速爬升的讨论被抓拍了两次,本帧里计数器(580)还在肉眼可见地涨。视频还主动交待了留白处:同周另一个帖子——Ollaya 的第三方 Web 界面——停在 5 分,没能起飞。所以诚实的读法是:恰好一个爆发帖,实时增长中,属于运行器本身——没有首页连环轰,站内也没有第二处露面。是信号,不是饱和。

    Ollaya Hacker News 浏览器卡「Live on Hacker News right now」:item 49848269 截帧瞬间 580 分、139 条评论,提交人标注为 Ardakilic。
    录制的瞬间计数还在涨——本帧 580,报告快照 586。跳转至 2:50
  7. 7

    质疑段:「决策模型 = 分类器」

    帖子里并非人人都买账,而视频做了一件少见的事:把最响的反对意见放上屏幕,还留着不走。HN 用户 hbrn:「决策模型」只是营销话术。决策模型 = 分类器。另一条回复说它的营销语言有误导性——系统只是对固定选项集吐概率,不是开放生成;第三条把官方示例还原成普通的文本分类任务。视频的回应不是反驳,而是换了个框架——而且换得对:这些模型里有一些就是分类器,毫不掩饰,下一步开箱会告诉你具体是哪些。真正新的不是某个模型家族,而是罩在它们上面的那份契约——书面问题加输入状态进,校准概率图出,一次前向——至于这份契约能不能敌过手搓分类器,问题的答案在你的工作负载里,不在词汇表里。如果你要的只是固定选项集上的分数,质疑者大方向没错,而你照样会被服务得很好;如果你需要生成文本,再多包装也改变不了这不是那把锤子的事实。

    Ollaya 引文卡「JUST MARKETING JARGON?」引用 HN 用户 hbrn 的质疑:决策模型只是营销话术,决策模型等于分类器。
    视频把最响的质疑放上屏幕——然后用下一节正面回应。跳转至 3:50
  8. 8

    开箱:两个模型家族,一份契约

    菜单来了,照卡面念:nli 435M 和 qwen3guard 600M——分类器家族,NLI 风格、只给选项打分、零生成;kev 9000M(9B)和 winnow 12000M(12B)——完整 decoder,被改造成给选项打分而不是写句子。身体不同,底下的契约相同:书面问题加输入状态进,单次前向跑完,校准概率图出——解码循环被整个跳过。视频的示意概率图是 billing 0.85、technical 0.06、account 0.09,外加一个覆盖整个响应的置信分。语言间的路由交给 laya router,按请求在 laya:en 和 laya:multilingual 之间挑;文档写明它不增加可测延迟,因为它从不接触模型本身。这就是「8ms 凭什么」的完整答案:没有任何东西被逐 token 生成,所以没有解码循环要付账——状态只读一次,所有选项在同一次前向里打完分。

    Ollaya 模型清单卡「9B to 12B, repurposed」:nli 435M、qwen3guard 600M、kev 9000M、winnow 12000M 四行参数规模。
    上面两个分类器级,下面两个改造的 decoder——一套契约罩住四个。跳转至 4:30
  9. 9

    benchmarkheaven:live、未审计的榜单——按这个读法读

    一位 HN 评论员贴出了 benchmarkheaven.com 上的 Jev 实时榜单,视频引用它时把注意事项重复到刻进脑子:第三方、未审计、分数随时间漂移——live 快照,不是认证基准。截取时的数字:Jev 1.13.0 以 64.7 领跑 capability(capability 平均了智力与校准),composite 63.3 居次。Laya——Ollaya 发行的那颗模型——双榜 #41:capability 49.9、composite 30.3。榜单卡把 Laya 署名给 Convai Innovations,底座是 ModernBERT-Large、421M 参数;Ollaya 打包并发行它,但没有训练它,表格自己也把它标注为 Jev 的 reconstruction。价格栏:每千次决策约 $0.0029,是榜内最便宜的一档——取舍写得明明白白:用低很多的能力换近零成本和个位数毫秒的延迟。视频还替你跑了一次一致性核对:HN 帖里引的是 63.29 和 30.25,事后 live 复查读数 63.3 和 30.3——舍入范围内吻合,没人挑数字。把这张表当天气看,别当气候。

    Ollaya 榜单卡「Laya ranks #41 on both」:Laya capability 49.9、composite 30.3,对照 Jev capability 64.7、composite 63.3。
    四个数字讲清取舍:capability 64.7 对 49.9,composite 63.3 对 30.3。跳转至 6:35
  10. 10

    三件活,一个 daemon——外加给 agent 的 MCP

    用例卡读起来像同一个 daemon 的产品巡礼:工单分诊吃工单文本,返回部门、紧急度、退款;命令过滤吃一条 shell 命令,返回 allow/block 标签;agent 工具调用吃一个路由问题,返回类型化选择。中间那个带着真实世界的背书:一位 HN 评论员拿它过滤实时 shell 与命令历史,理由是标签集变得太快、不值得为它微调一个专用分类器——这正是「选项写在请求里」击败「冻结标签头」的典型失败模式。然后是让它成为 agent 原语的那层集成:Ollaya 说 MCP(Model Context Protocol)。流程图从 Claude Code → tool call → MCP → typed question → 决策模型:agent 框架可以把决策模型当工具调,而不是在任务中途为一次路由决策花掉一整次 LLM 调用。一次 MCP 调用顶替一次完整调用,返回值是类型化选项而不是要解析的段落——当 agent 循环的下一步是代码而不是一段文字时,你要的恰恰就是这个。

    Ollaya MCP 流程图「One MCP call replaces a full call」:Claude Code 经 tool call 到 MCP、再经 typed question 到决策模型。
    agent 路径:一次 MCP 工具调用,顶替过去一整次聊天补全。跳转至 8:00
  11. 11

    端到端:一张工单、三个答案、一张纳秒级收据

    demo 把闭环补完,用的还是安装那步的重复扣费工单,这次走本地 HTTP API 一发请求:响应返回部门——billing,置信 0.78——外加 urgency 和 refund 字段在同一个 JSON 里。没有第二次调用、没有链式拼接;「三个答案」之所以是一次响应,是因为问题们挂在同一份共享状态上、走同一次前向。标题为「The receipt is in eval_duration」的卡展示了 response.json 的形状:department: {"choice": "billing", "confidence": 0.78},后面跟着 eval_duration、load_duration、total_duration——以纳秒报告的耗时字段。这张收据不只是记账:eval_duration 是每次调用自带、自我报告的测量值,它让本指南里每个数字都能在你自己的硬件上复核——最后一步利用的正是这个性质。模型自带秒表的时候,谁的基准你都不用全信——包括厂商的。

    Ollaya response.json 卡「The receipt is in eval_duration」:department choice billing、confidence 0.78,附带 eval_duration、load_duration、total_duration 三个耗时字段。
    billing 0.78 外加耗时收据——全片的戏眼就在 eval_duration 这个字段。跳转至 9:05
  12. 12

    视频拒答的 CPU 测试——你来跑

    到目前为止每个延迟数字背后都有一块 GPU,而且没有任何厂商发布过这些模型的 CPU-only 数字——视频把这个空缺做成了自己的结尾。方法就两行:同一条查询跑两遍,一遍 OLLAYA_DEVICE=cpu,一遍默认 GPU 路径——OLLAYA_DEVICE=cpu ollaya run laya:en "I was charged twice for my subscription this month and want a refund."——然后把两个 eval_duration 字段并排放,差值直接从上一步那张收据里读。视频刻意没做的事,是告诉你 CPU 结果。收尾卡写着:「Run the CPU test. What's your eval_duration?」——数字留给观众测,本页保持同样的纪律:这里也不出现任何 CPU 数值,因为印一个出来,不过是往未验证数字堆上再添一个。值得记住的换算:无论哪边边际成本都近零,延迟从个位数毫秒到几百毫秒不等,取决于模型体量和设备。所以跑那两条命令,读你的两个 eval_duration,你手里就有了这个故事里唯一一个厂商没发布过的数字。如果你的硬件本来就只有 CPU,我们的 Julia-1 教程覆盖了 CPU 优先路线,正好互补。

    Ollaya 终端卡「Read eval_duration side by side」:OLLAYA_DEVICE=cpu ollaya run laya:en 重跑重复扣费工单,画面停在尚未给出任何数值的命令行上。
    命令亮出来、数字留白——视频的收尾挑战,本页原样保留。跳转至 9:12

常见问题(FAQ)

Ollaya 是什么?

Ollaya 是一个本地决策模型运行器——自我描述为「决策模型界的 Ollama」。它是 Rust CLI 加常驻后台 daemon,暴露一个本地 HTTP API(原生端点 /v1/systemone,/v1/decisions 是精确别名,鉴权头 Bearer local)。你发一份书面问题加输入状态,它在单次前向里返回选项集上的校准概率——零文本生成。运行时 Apache-2.0,项目在 github.com/ollaya-dev/ollaya(官网 ollaya.dev),厂商口径 laya:en 在 RTX 4090 上 8-10ms 含 HTTP 往返。

Ollaya 和 Ollama 是同一个东西吗——Ollama 0.35 出来后它还有必要吗?

两个不同的工具,名字容易混(机翻转写稿经常把 Ollaya 写成「Ollama」甚至「Ought to lie」)。Ollama 是通用 LLM 运行时;Ollaya 是决策优先的运行器。2026 年 10 月 1 日起,Ollama 0.35 提供了原生 Jev 型决策模型支持,通过自己的 /v1/systemone 提供 tev1 和 Nimble——所以两边端点正在收敛,Ollaya 不再是唯一的本地选项。Ollaya 仍然不同的地方:策划好的决策模型菜单(Laya、decider、NLI、GliClass,外加 kev 和 winnow)、只做决策的 CLI 与 daemon、OLLAYA_DEVICE 设备切换、MCP 工具调用支持。按模型菜单和运行器手感来选;如果还在犹豫「该不该本地」,从我们的 Jev vs Ollama 对比起步,Ollama 原生轴看我们的 Ollama 0.35 决策模型指南。

8ms 这个数字有多真?

它是厂商口径(vendor-reported),视频和本页都保留这个标签:Ollaya 官网报告 laya:en 在 RTX 4090 上 8-10ms,且这个数字含完整 HTTP 往返,不只是卡上算力。未预热的首次查询实测 8.1ms。两条诚实的脚注:同配置下 decider 2B 平均约 190ms——个位数属于小模型,不属于整个菜单——对照目标 TypeSafe 托管 Jev API 报价 236-276ms 每次调用。这些没有一个是独立测量;视频在屏幕上明说了(「Every number here is vendor-reported」),这也正是响应里带 eval_duration 字段让你自己读的原因。

Ollaya 自带哪些模型?

视频的菜单卡列出 nli(435M)和 qwen3guard(600M)——纯分类器——加上 kev(9B)和 winnow(12B),被改造成给选项打分而非写句子的 decoder 模型。repo 描述补上服务集:「拉取并提供 Laya、decider、NLI 和 GliClass,藏在 TypeSafe 兼容 API 背后。」laya:en 是 ModernBERT-Large 底座、421M 参数,榜单卡署名 Convai Innovations——Ollaya 打包并发行它,但没有训练它。许可证:Ollaya 运行时(CLI + daemon)Apache-2.0;部分模型 MIT(llama.cpp、NLI);多数模型——包括 Laya、Decider、Kev——Apache-2.0。

Ollaya 能替代分类器吗?能替代 LLM 吗?

在特定方式上,两者都行。HN 质疑者说决策模型「就是分类器」加营销话术,他们说对了一半:菜单里确实有一部分本来就是 NLI 分类器。这份契约加的是——选项写在请求里:书面问题加输入状态,一次前向返回校准概率图——所以你的标签集每次变化时,不用再训练或微调一个专用模型也能拿到分类器形状的答案。这正是那位真实 HN 评论员拿它过滤 shell 命令的原因:标签变化太快,冻结的专用分类器不值得。它替代不了 LLM 的生成:开放式的输出一点都没有,只有概率和类型化选择。如果你的任务是给固定选项集打分——分诊、路由、审核、allow/block——它非常对口;如果你需要成段的文字,就留着 LLM,用 MCP 把 Ollaya 架在它前面。

Ollaya 在 CPU 上多快?

诚实回答:没有答案,而且是故意的。视频指出没有任何厂商发布过这些模型的 CPU-only 数字,镜头前演示了方法——同一条查询跑两遍,一遍 OLLAYA_DEVICE=cpu、一遍默认 GPU 路径,然后对比 JSON 收据里的两个 eval_duration 字段——却仍然拒绝把 CPU 结果读出来,收尾停在「Run the CPU test. What's your eval_duration?」。本页保持同样的纪律,不会代编一个数字。在你的机器上跑 OLLAYA_DEVICE=cpu ollaya run laya:en "I was charged twice for my subscription this month and want a refund.",读你的 eval_duration(纳秒口径),你就拿到了这个故事里唯一一个厂商没发布过的数字——欢迎带上硬件型号去评论区交卷。

相关推荐

更多视频攻略