Guides / 视频转图文攻略

Jev + Claude Code 实战:语音控制浏览器,类型化决策全程接管

逐帧拆解 Prompt Engineer 48 的 18 分 25 秒实战:在 Claude Code 里安装 TypeSafe Agent Skill,看 Jev 类型化决策路由 Stripe 工单,再看一句语音以 P=0.78 在 1176ms 内驱动 Chrome 完成点击。

速览结论

Prompt Engineer 48 这支 18 分 25 秒的视频分四步论证 Jev 的 Agent 集成价值。第一步是控诉:所有「拿 LLM 当决策引擎」的做法都是同一个循环——Prompt、Parse、Pray、Babysit——RLHF 讨好式训练留下模式丢失、过度自信,最后还是要人盯着自动化跑。第二步是契约:Jev System One 接收 state 加类型化问题,返回类型化答案、完整概率分布和置信度数字——「LLMs produce words for people. Jev produces typed decisions.」证据全在画面上:终端竞速里 uv run typesafe-race 在 0.114 秒内拿回 28 个类型化答案、成本 $0.000081,而自回归 OpenAI 模型还在等首 token;Playground 里「Hi, my stripe is failing」在 payment(86%,置信度 79%)上摇摆,补一个词「billing」后 choice 塌缩成 100%、置信度 99%;定价页给出 $0.042/百万输入 Token、输出免费,比 Claude Fable 5.1 便宜 238 倍。第三步是 Claude Code 集成:TypeSafe agent skill 用 claude plugin marketplace add typesafe-ai/skills 加 claude plugin install typesafe@typesafe-ai 两条命令装好,编码 Agent 从此掌握三种问题类型与架构模式。最后是收尾项目 voice-chrome:mic → faster-whisper(本地 GPU)→ Jev(~400ms)→ Command dataclass(typed, validated)→ Playwright → 真实 Chrome——没有 prompt 工程、没有 JSON 解析、没有重试循环——最终演示里一句「Click on videos」被 ADDRESSED TO BROWSER P=0.78 门禁放行,click_link 概率 0.62,1176ms 完成点击。

视频来源

Prompt Engineer 48

18:25rGNZxt8eUaI

分步图文攻略

  1. 1

    先看问题:文本模型当决策引擎,四步全是坑

    视频以一段现场演示开场——作者开口说话,Chrome 照做——然后花前两分钟解释为什么「直接问 LLM」行不通。1:35 的幻灯片给这个循环起了名:1. Prompt(「用英文求模型返回 JSON」)、2. Parse(「剥掉 markdown 围栏;模型道歉了就重试」)、3. Pray(「没有校准置信度,分不清确定答案和瞎猜」)、4. Babysit(「只好把人留在循环里——自动化永远上不了线」)。脚注是 TypeSafe 的核心论点:RLHF 把模型调教成讨好人类,带来模式丢失、过度自信和不可靠——聊天无妨,软件致命。

    Jev Claude Code 视频幻灯片:Prompt、Parse、Pray、Babysit 四步循环,批注 RLHF 讨好式训练导致模式丢失与过度自信
    Prompt、Parse、Pray、Babysit——Jev 生来就是要删掉的四步循环。跳转至 1:35
  2. 2

    一张幻灯片讲清 Jev:发 state 和类型化问题,拿类型化决策

    核心幻灯片定义了整个契约。你发送:一个 state——工单、邮件、表格行、页面、应用的当前事实——外加一组关于它的类型化问题。你拿回:类型化答案、完整概率分布、一个置信度数字。没有散文、没有推理轨迹、什么都不用解析。下面的引言一句话完成定位——「LLMs produce words for people. Jev produces typed decisions.」——代码掌控工作流,模型提供可编程的常识。作者把这定性为押注 Diogo Almeida 的 TypeSafe(1:57 章节):为校准决策而训练的模型,而非讨好式聊天,它打印的置信度数字是代码可以直接拿来分支的。

    System One 幻灯片:Jev 接收 state 加类型化问题,返回类型化答案、完整概率分布与置信度数字,并引用 LLMs produce words for people
    「LLM 为人生成文字,Jev 为人生成类型化决策」——定调整支视频的一页。跳转至 4:43
  3. 3

    看这场竞速:28 个类型化答案 0.114 秒到齐,LLM 还在等首 token

    视频中段播放的基准测试片段里,两个终端并排跑 uv run typesafe-race。左边问并行的 TypeSafe API,瞬间填满 28 个类型化答案——noul 门禁如「Revenue currently impacted?」0.85,choice 如「Which primary department?」= technical、置信度 1.0,score 如「Churn likelihood level?」1.6——以 $0.000081 的成本在 0.114 秒完成。右边指向自回归 OpenAI API(gpt-5.6-terra)的那格,还停在「Waiting for first token…」。这一帧就是 JSON 输出/置信度/延迟章节的全部:一整屏决策落地时,聊天模型还没吐出一个字符。

    终端竞速对比:uv run typesafe-race 以 $0.000081 成本 0.114 秒返回 28 个 Jev 类型化答案,右侧 gpt-5.6-terra 的 LLM 面板仍在等待首 token
    28 个决策、$0.000081、114ms——LLM 面板还在等第一个 token。跳转至 2:45
  4. 4

    整个 API 就三样:Choice、Noul、Score——顺手领个免费 key

    4:13 章节把全部 API 放上一页幻灯片。Choice 返回胜出选项、每个选项的概率和置信度——用于路由、分诊、意图。Noul 返回一个 0–1 的「条件成立」概率;没有单独的置信度,数字本身就是答案——用于护栏、开关、检查。Score 返回概率加权的位置,落在你用文字定义的有序 rubric 档位上——用于排序、质量、风险。幻灯片的选择法则:按答案的含义选原语,别按 prompt 好不好写——Noul 接近 0.5 的意思是「是与否各半」,永远不是「中等」。前一章节(3:06)是上车道:typesafe.ai 免费额度加控制台领一个 API key,足够复现视频里每个演示。

    Typesafe 幻灯片:Jev 三原语 Choice、Noul、Score 及各自适用场景,附 Noul 近 0.5 表示是与否各半而非中等的规则
    三原语就是全部 API 表面——按答案的含义来选。跳转至 4:52
  5. 5

    Playground:拿 Stripe 投诉问「这条消息紧急吗?」

    在 console.typesafe.ai 的 Playground 里,作者贴入 state——「Hi, my stripe is failing. Please help ASAP. I am losing numerous high value clients.」——并定义三道类型化问题:urgency(noul,「Does this message express urgency?」)、Problem Type(choice,选项 accounts / billing / payment)、Severity(score,档位 Low / Middle / High)。jev-latest 的响应:urgency 98% true;Problem Type payment 86%、billing 13%、accounts 1%——综合置信度 79%;Severity 2 of 2、置信度 100%。有意思的是那段摇摆:分布在 payment 和 billing 之间明显犹豫,而这份看得见的犹豫,恰恰是决策模型该有的样子。

    Typesafe AI Playground:Stripe 投诉 state 下 urgency noul 98% true,Problem Type choice 选 payment 86%、置信度 79%,Severity 2 of 2
    choice 分布在 payment 和 billing 之间摇摆——犹豫看得见。跳转至 6:35
  6. 6

    一个词翻转路由:「stripe billing is failing」

    重跑只加了一个词——「Hi, my stripe billing is failing…」——choice 立刻塌缩:Problem Type billing 100%、置信度 99%,urgency 96% true,Severity 仍是 2 of 2、置信度 100%。这就是 8:00 章节真实的 Stripe 工单路由:同样三道类型化问题给工单分队列,当 state 真的携带信号时,86/13/1 的摇摆锐化成 100/0/0。生产环境里置信度数字就是阈值——高就自动路由,低就升级人工,两个分支各是一个 if 语句。

    Typesafe Playground 重跑 Stripe billing 工单:Problem Type choice 塌缩为 billing 100%、置信度 99%,urgency noul 96% true
    补上「billing」,86/13 的摇摆变成 100% 的路由决策。跳转至 8:20
  7. 7

    成本账:$0.042/百万输入 Token,输出免费

    12:22 出现的定价页把 Jev(TypeSafe AI)标为 $0.042/百万输入 Token——即 $42/十亿——输出 Token 免费;同页 GPT-6 Astra 与 Claude Fable 5.1 标 $10.00 输入 / $50.00 输出每百万。幻灯片自己的标题:输入价格比 Claude Fable 5.1 低 238 倍。(视频简介口径为快 193 倍、省 244 倍;238 倍是屏上图表的说法。)11:07 章节把成本和诚实的局限放在一起讲:这是决策模型,不是写手——它以约 400ms 的节奏分类、路由、打分,动手的是你的代码。

    Jev 成本对比图:TypeSafe AI 输入 $0.042/百万 Token、输出免费,旁边 GPT-6 Astra 与 Claude Fable 5.1 标 $10,附 238x 标语
    决策 Token 按水电费定价,不按聊天定价——十亿输入只要 $42。跳转至 12:22
  8. 8

    在 Claude Code 里安装 TypeSafe agent skill

    13:01 章节是正题:接入 Claude Code。docs.typesafe.ai/agent-skill 提供适用于 Claude Code、Codex 及其他 Agent 环境的即插即用 skill——把 TypeSafe API 的完整上下文交给你的编码 Agent:三种问题类型、架构模式、组织评估的最佳实践。安装只要两条终端命令:claude plugin marketplace add typesafe-ai/skills,然后 claude plugin install typesafe@typesafe-ai(手动路线是把 skills/typesafe-ai 目录复制进 Agent 的 skills 文件夹——二选一,避免重复安装)。文档的「常见问题」列表值得开跑前读一遍:Agent 不用 skill、路由不符合预期、置信度阈值到处都是、Agent 凭空编造请求或响应字段。

    Typesafe agent skill 文档页:面向 Claude Code 展示 claude plugin marketplace add typesafe-ai/skills 与 claude plugin install typesafe@typesafe-ai 两条安装命令
    两条命令,让 Claude Code 掌握 TypeSafe API 全部上下文。跳转至 13:34
  9. 9

    架构:mic 到 Whisper 到 Jev 到 Playwright 到 Chrome

    15:06 展示的 voice-chrome README 一行画完整张蓝图:mic → faster-whisper(本地 GPU)→ Jev(~400ms)→ Command dataclass(typed, validated)→ Playwright → Chrome。「没有 prompt 工程。没有 JSON 解析。没有重试循环。Jev 返回一个枚举、一个概率分布和一个置信度数字,剩下的交给普通 if 语句。」README 的对比表把界限划清:典型 LLM tool-calling 给你「必须解析的自由文本」,这里给 Agent 循环的是「类型化的 Command」。Whisper 负责转写;Jev 决定这句话是哪条命令——以及它到底是不是对浏览器说的;Python 通过 DevTools 协议驱动真实 Chrome 执行。

    VS Code 打开 voice-chrome README:mic、faster-whisper、Jev、Command dataclass、Playwright、Chrome 流水线,以及类型化 Command 对比 LLM tool-calling 的表格
    一个类型化 Command dataclass,取代循环心脏里的 prompt 解析。跳转至 15:06
  10. 10

    验收:「Click on videos」——说出口,P=0.78 放行,1176ms 点中

    15:25 的完整演示里,作者正在逛 YouTube,随口一句——「Click on videos.」HUD 显示 Jev 的决策:这句话 ADDRESSED TO BROWSER、P=0.78(这道门禁防止 Agent 执行对人说的指令),动作概率 click_link 0.62、scroll_to_section 0.33、media 0.03、scroll 0.01、none 0.01——浏览器在 1176ms 内点开了「Claude Code + Ollama = FULL LOCAL AI AGENT」视频。收尾章节(17:01)用另外两个演示重复同一形状——一个试衣间流程、一个新闻过滤——然后进入结尾。全部都是:state 进,带概率的类型化决策出,代码执行。

    YouTube 页面上的语音命令 HUD:Click on videos,ADDRESSED TO BROWSER P 0.78,click_link 概率 0.62,底部显示 1176ms 完成点击
    门禁、动作分布、点击——一句语音,端到端。跳转至 15:55

常见问题(FAQ)

Jev 与 Claude Code 怎么集成?

视频演示的是官方路径 TypeSafe agent skill:在 Claude Code 里执行 claude plugin marketplace add typesafe-ai/skills,再执行 claude plugin install typesafe@typesafe-ai,编码 Agent 就获得三种 Jev 问题类型、架构模式与评估最佳实践——足够它把类型化决策接进任何要构建的东西,本视频里就是语音控制的浏览器 Agent。

Jev 决策有多快、多便宜?

视频里的终端竞速:28 个类型化答案 0.114 秒返回、成本 $0.000081,而自回归 LLM 还在等首 token。定价页列出输入 $0.042/百万 Token、输出免费——按屏上图表,输入价格比 Claude Fable 5.1 低 238 倍。所有数字均为视频画面所示,现价以 typesafe.ai 为准。

为什么不直接让 LLM 选浏览器动作?

因为文本模型会把你拉回 Prompt / Parse / Pray / Babysit 循环:没有校准置信度、畸形 JSON 要重试、每个运行都要人盯着。Jev 返回带概率分布和置信度的类型化 Command,普通 if 语句就能执行——而像 ADDRESSED TO BROWSER P=0.78 这样的 noul 门禁,还能阻止 Agent 执行本来是对人说的指令。

语音 HUD 里的 P=0.78 是什么意思?

它是模型对「这句话是对浏览器说的,而不是对房间里其他人说的」的概率估计——只有先过这道门禁,才会考虑动作概率(演示里 click_link 0.62、scroll_to_section 0.33)。数字是视频里的演示值,但模式是所有语音 Agent 都需要的护栏:低于阈值,什么都不做。

相关推荐

更多视频攻略