Guides / 视频转图文攻略
Tev1 用例实测:50 个任务看尽本地决策模型的能力边界
在一张 RTX 4060 8GB 笔记本显卡上,经 Ollama 0.35 用 tev1 连跑 50 个任务:工单与模型路由、内容审核与 PII 防护、97ms 日志分拣、简历核查、游戏 agent——每个任务都带命中数与延迟,单次请求成本 $0。
速览结论
这是一份本地决策模型的用例目录:通过 Ollama 0.35 在一张 8GB RTX 4060 笔记本上用 tev1(Together AI 出品)连跑五十个任务,单次请求 $0。44 项文本测试中,0.8B(812MB)平均 190ms 拿下约 73%,4B(4.5GB)以 360ms 拿下 91%——而且赢面都很具体:工单路由 7/8、约 290ms 且三个问题一次并行作答;内容审核 6/8、约 240ms;日志分拣 8/8、97ms;钓鱼邮件识别 6/6、约 200ms,数据全程不出本机。视频同样诚实地展示了边界:shell 命令风险门只拿 5/8(「不敢只靠它」);会议优先级过滤器 2/6,被特意保留下来展示模型哪里会错;「更大」有时反而更差——核查 commit 信息与内容一致性时,4B(3/6)输给了 0.8B(4/6)。而在意图模糊的场景(智能家居、语言识别、评论情感、凭据与 PII 检测),从 0.8B 升到 4B 就是失败与满分的差别。片尾一行字:50 次决策,$0.00。
分步图文攻略
- 1
开场主张:50 个任务、一张 8GB 显卡、单次 $0
标题卡在任何任务运行之前就把整个实验说完了:TEV1 LAB、50 个用例、「一个微型决策模型,跑在我自己的笔记本上」——硬件与成本直接印成规格芯片:0.8B 占 812MB、4B 占 4.5GB、RTX 4060 8GB 显存、单次调用 $0.00。Tev1 是 Together AI 出品的决策模型:你给它一段文本加几个类型化问题——选项里选一个、判断是非、或者打个分——它把每个答案连同概率一起返回。经 Ollama 0.35,它挂在 /v1/systemone 端点上,有 0.8B 和 4B 两个尺寸。五十个演示跑完,成本计数器始终停在零。

一张卡片讲完全部实验:0.8B 或 4B,8GB 显卡,单次 $0.00。跳转至 0:06 - 2
State 进、类型化答案出:50 个用例背后的同一种请求
目录开始之前,屏幕上先展示了全部五十个演示共用的请求形状:POST 到 /v1/systemone,model 填 "tev1",state 是一段文本("I was charged twice, please refund"),questions 对象混用全部三种题型——team 是 billing/tech/sales 三选一的 choice,refund 是 yes/no 的 noul,urgency 是 0 到 3 的 score。一个请求并行评完三个问题,返回 team billing 0.99、refund yes 0.97、urgency 1.2/3。模型不做任何生成——答案和概率在一次前向里直接算出,这正是全片每个演示都「一瞬间出结果」的原因。

一个 state、三个类型化问题、三个带概率的答案——billing 0.99、yes 0.97、urgency 1.2/3。跳转至 0:24 - 3
路由:五个不看关键词、只看意图的分诊台
目录从路由开跑——决策模型最经典的岗位。客服工单被分进 billing、technical、accounts 或 sales,同时并行两个问题:是否要求退款、紧急度打分——小模型 8 项对 7、约 290ms,每张工单三个答案一次拿齐。来信分拣把信件归入 for action、information、promotional 或 checks:6/8、约 225ms。当 LLM 路由器时,它为每个请求挑 small、medium 或 large——6/8,这一帧值得暂停:把大模型留给真正难的问题,正是这套东西的全部经济学。为 agent 挑技能(联网搜索、日历、代码、邮件)7/8、约 90ms;IT 支持路由(硬件、网络、软件、权限)7/8、约 210ms。用 yes/no 问题判断销售线索的预算与意向,6/6 满分。

模型路由:6/8、约 250ms——便宜的问题在到达大模型之前就被截下来了。跳转至 1:12 - 4
智能家居与语音:0.8B 会挂、必须上 4B 的那一组
全片最直观的尺寸课。「It's so dark in here」里没有任何指令词表,但模型必须把它映射成开灯——0.8B 只对了 8 句里的 3 句,于是作者切到 4B,同一张卡片 8 句全对。语音指令(播放、暂停、下一曲、加大音量)在小模型上 5/8,但每个答案都在 80 毫秒以内返回——快到可以塞进语音助手的循环里,让每句话都触发一次决策。这一组正好证明两个尺寸都该装着:812MB 的留给延迟与内存优先的场景,4.5GB 的留给映射模糊的场景。

「屋里太黑了」→ 开灯:0.8B 3/8,4B 同卡 8/8 全清。跳转至 1:34 - 5
安全防护:审核、注入检查、凭据与 PII 泄露
安全防护这一组里,本地推理不再只是省钱技巧,而是隐私特性。内容审核给评论打 okay、spam、insult 或 threat 标签外加毒性分:6/8、约 240ms。Prompt 注入检查——文本里有没有试图控制 AI 的隐藏指令——5/6,而且因为本地运行,什么都不出你的机器。凭据泄露检测和 PII 检测都出现了尺寸分化:0.8B 3/6,4B 干净的 6/6(PII 约 500ms)。钓鱼邮件鉴别 6/6、约 200ms——旁白说对一个不到 1GB 的模型来说这非常好。两条诚实的警示:在 agent 执行前把关 shell 命令的风险门只拿 5/8——「我不敢只靠它」;给模型输出打 skip/check/block 状态的输出防护栏 5/6。

审核 6/8(约 240ms)——一次前向同时给出标签和毒性数字。跳转至 2:06 - 6
文本分析:一条评论的四个问题装进一次请求
评论情感分析把多问题模式演示得最密:一条评论、一次请求、关于质量/价格/服务的四个问题一起作答——0.8B 拿 3/5,4B 全对 5/5,因为一次打包四个问题耗时约 780ms。语言识别是全片最大的尺寸落差:小模型 2/8,4B 8/8。新闻主题分类正好相反——0.8B 就能 8/8 满分、约 100ms。按「3 年 Python 经验」这类条件核查简历 6/6、约 240ms;标题党检测 6/8;发信前的语气与礼貌度检查 5/6;情绪标注(喜悦、愤怒、悲伤、恐惧)5/6、约 100ms。值得记下的一次平局:突发新闻是否推推送,两个尺寸都是 4/6——更大的模型毫无帮助。

一条评论、四个问题、一次请求——4B 以约 780ms 清盘 5/5。跳转至 3:06 - 7
检索与日志:全片最快的一次决策
速度纪录落在这组。把日志行分进 noise、warning 或 error 命中 8/8、每条决策 97 毫秒——旁白的重点是你可以用零成本扫海量日志;画面里 0.8B 把「FATAL: out of memory, killing worker 3」以 0.97 置信度判为 error。搜索重排(这段摘要能不能回答「如何重置路由器设置」)6/6;语义代码搜索——这段代码是不是在网络出错时重试,按含义而非关键词匹配——5/6。以「小语言模型跑在本地硬件上」这类摘要筛选论文,换 4B 后从 2/6 跳到 6/6。重复 bug 报告判同从 3/6 升到 5/6;笔记与书签自动打标干净的 8/8、约 118ms。

0.8B 每行 97ms、8/8 全对——日志分拣是全片性价比最高的一次决策。跳转至 4:31 - 8
游戏与 agent 治理:每一步移动都是一次类型化决策
最有画面感的段落把模型塞进游戏循环,每步移动就是一次决策。井字棋左侧面板给出每一格的概率,以 X 执子对阵随机玩家——战绩 10 胜 0 负。Snake 收到一段简短态势(食物在哪、哪些方向致命)然后选方向;吃豆人式迷宫躲两只幽灵;Pong 每步在 up、stand、down 里挑一个;恐龙跑酷按仙人掌或飞鸟选 run、jump、crouch;公路赛车——和 Ollama 官方演示一样——在左/直/右三条道里选,偶尔撞车但一直保持移动。Agent 治理测试则刻意冷静:为浏览器 agent 挑该点哪个编号元素 3/4(4B 反而只有 2/4——样本太小,存疑);agent 是否真完成任务两个尺寸同为 4/6;循环检测 4/6;上下文压缩只有 3/6(「我不假装它好用」);工具调用审批 4B 4/6——「不差,但我不敢依赖它」。

每格一个概率、每步一次决策:X 对随机玩家,10 比 0。跳转至 6:45 - 9
记分板:44 项文本测试、73% 对 91%、零美元
最终记分板把五十张卡片同时定格在一屏——路由、防护、文本分析、检索、agent 治理和游戏——总数写在页眉:44 项文本测试里,0.8B 以平均 190ms 拿下约 73%,4B 以 360ms 拿下 91%,总成本 $0.00。视频收在一张卡片上:「50 decisions. $0.00 —— tev1 by Together AI, running through Ollama」。三条经验比这次测试本身走得更远。第一,升级 4B 恰恰在意图模糊处起决定作用(智能家居、语言识别、情感、凭据与 PII 检测、论文筛选)。第二,更大不总是更好——核查 commit 信息与内容一致性时 4B(3/6)反而输给 0.8B(4/6),突发新闻推送上两者打平 4/6。第三,失败被刻意留在屏幕上:2/6 的会议优先级过滤器被保留,「就是为了展示模型哪里会错」——在把其中任何一环接进生产之前,这是正确的本能。

五十项同屏:0.8B 73% @ 190ms,4B 91% @ 约360ms,总计 $0.00。跳转至 9:05
常见问题(FAQ)
Tev1 是什么?
Tev1 是 Together AI 出品的决策模型,为类型化决策而非文本生成设计。你发送一段文本(state)加若干类型化问题——在命名选项里选一个的 choice、判断是否的 noul、打分数值的 score——它在一次前向里把每个答案连同概率一起返回。经 Ollama 0.35,它在 /v1/systemone 端点本地运行,有 0.8B(812MB)和 4B(4.5GB)两个尺寸。上面这部视频用它跑了 50 个真实任务;我们的 Ollama 决策模型指南覆盖安装、请求格式和正面对比基准。
Tev1 免费吗?
经 Ollama 本地运行,是的——视频里每一次请求都是 $0,整个 50 用例跑完总计 $0.00。你唯一的成本是硬件(4B 只需 8GB 显存)和电费。这正是本地路线对托管决策 API 的全部卖点:无按次计费、无 API key、数据不出机器——视频里的凭据泄露、PII、prompt 注入演示之所以能放心碰敏感数据,靠的正是这一点。
Tev1 对比 Nimble:本地决策模型该选哪个?
这部视频只测了 tev1,但我们的姊妹篇在同一频道的实验设置上对两者做了基准。那里 tev1 4B 在 30 张工单的团队路由上拿到 100%、470ms,且完整装进 4.7GB 显存;Nimble 9B(Bespoke Labs)拿到 96.7%,但单次约 1.5 秒——约 10GB 的占用让 8GB 显卡上约 40% 的计算溢出到 CPU。面向消费级硬件的实用结论:8GB 显卡默认选 tev1;Nimble 要 12GB 以上才值得考虑。
用 Ollama 决策模型(如 tev1)能做什么?
这 50 个用例可以归成五族。路由:客服工单(7/8、约290ms)、来信分拣、LLM 模型选择、agent 技能挑选(7/8、约90ms)、IT 支持路由。防护栏:评论审核(6/8、约240ms)、prompt 注入检查(5/6)、凭据/PII 检测(4B 6/6)、钓鱼邮件识别(6/6、约200ms)、shell 命令风险门(5/8——太弱,不能单独信任)。文本分析:评论情感、语言识别(4B 8/8)、新闻分类(8/8、约100ms)、简历核查(6/6、约240ms)。检索:搜索重排(6/6)、日志分拣(8/8、97ms)、笔记打标(8/8)。以及 agent/游戏循环:工具调用审批、循环检测,和从井字棋到公路赛车的「每步一决策」游戏。
Tev1 在本地硬件上有多快?
44 项测试记分板的平均值:0.8B 每次决策 190ms,4B 360ms——都跑在一张 RTX 4060 笔记本显卡上。单个任务差异很大:快的一端有语音指令 80ms 以内、日志行分拣 97ms、新闻分类约 100ms、agent 技能选择约 90ms;多问题打包更慢,四问的评论情感约 780ms、4B 的 PII 检测约 500ms。即便最慢的任务也远在「决策可以挂在热路径上」的范围之内——游戏组每步移动都在实时出决策。
什么时候该用本地决策模型——什么时候不该?
当答案空间可以预先定义、且隐私或成本重要时用它:视频里的安全演示(prompt 注入检查、凭据与 PII 检测、银行交易分类)只有在本地才让人放心,因为数据不出机器;单次 $0 让你敢在高体量数据(比如日志)上跑决策。视频自己存疑的地方你也要存疑:5/8 的 shell 命令风险门不足以自动执行;4/6 的工具调用审批「不敢依赖」;上下文压缩两个尺寸都只有 3/6;会议优先级过滤器 2/6 失败——被特意保留以展示失败模式。还要按任务核对尺寸取舍:延迟与内存优先选 0.8B,模糊意图(智能家居、语言识别)必须 4B——同时记住 4B 仍在 commit 信息核查上输给过 0.8B。在自动化任何环节之前,先拿你自己标注的数据做验证。
相关推荐
Ollama 决策模型:安装 tev1 并跑基准
本页的「装机与基准」姊妹篇:拉取 tev1 与 Nimble、学会 /v1/systemone 请求格式、30 张工单正面对比强制 JSON 的聊天模型。本页是用例广度轴,那页是安装实测轴。
阅读什么时候该用 Jev:选型决策框架
目录背后的选择逻辑:这 50 个形状里哪些属于类型化决策,哪些应该留在普通代码里。
阅读费用分类 Recipe
视频里路由形状的产品化落地:一条可以直接照抄的费用分类流水线,从 state 设计到阈值处理。
阅读Jev vs Ollama:本地与云端的类型化决策
这部视频全程本地、单次 $0——什么时候本地路线在精度、延迟与隐私上胜过托管 API,这里有完整框架。
阅读更多视频攻略
- Jev 极速分类实战:从 API 调用到 Choice/Score/Noul 三大原子类型
- 7 分钟透析 Jev 架构:为什么 70ms 决策模型颠覆了 LLM 自动化工作流?
- Jev 赋能极速浏览器 Agent:178ms DOM 决策循环与双模型协作实战
- OpenJevs 开源 Jev 模型全景:Semif、Nimble、Decider、DiffusionGemma 与 Laya 实测
- Jev 会取代 LLM 吗?Krish Naik 白板图解 Jev vs LLM 与混合架构
- Jev Trader 教程:在 Monad 上搭建亚秒级 AI 交易机器人
- Jev Model Router 实战:用 Jev 搭建带隐私门控的本地模型路由器
- Jev 入门教程:State、三类问题与 TypeScript SDK 实操
- 本地跑 Jev:Kev、SemIf 与 Von,自己的 GPU 就够了
- Jev RAG Reranker 实战:用可执行 criteria 打造策略化检索重排
- Jev 什么时候该用:工程视角核实宣传口径、守门与失败模式
- LangChain + Jev 集成实战:路由、护栏与评测
- Jev MCP Server 接入指南:把 Jev 决策层接进 Claude Code 与 Cursor
- Jev vs Luna 独立基准实测:「更快更准更便宜」是真是假?
- Jev Agent Harness 实战:决策闸门该装在 LLM 循环的哪个位置
- Jev Playground 实测攻略:热狗课程、criteria 校准与四平台 token 账单
- Jev 文本分类 API 实战:用 classifier.dev 打通零样本 CLI 与 REST 调用
- Jev API 实战示例:第一条 curl、载荷结构与三种问题类型
- 用 Expanso Edge 和 Jev 搭建日志分流流程
- Treg + Jev 线索丰富:ICP 分类与注册用户评分
- 在 Heym 中使用 Jev 决策节点:语言判断与模型路由
- Laya 上手教程:开源自托管决策引擎的安装、路由与概率校准(Laya vs Jev 实操)
- 训练自己的 Jev:花 $5–$17 微调一个 Jev 式决策模型(能训什么、不能训什么)
- Jev 实用技巧:拿到更好决策结果的 8 条最佳实践(state、questions、criteria 与阈值)
- Jev 上下文压缩实战:不用生成式摘要,直接剪枝 Agent 记忆
- Jev 当 LLM 评审:置信度级联,只要强模型 0.36% 的成本
- TypeSafe Computer Use 实操:用 Jev 做本地桌面自动化
- Jev 简历筛选实战:Express + Jev JavaScript SDK 搭一个 AI 简历评估器
- Jev + Claude Code 实战:语音控制浏览器,类型化决策全程接管
- Jev vs Ollama:本地跑 AI 决策,数据不出门真的可行吗?
- 自己动手造一个 Jev:免费开源零样本分类器(还能打 Doom)
- CUA-S1-Forms:706K 参数的 Jev 型表单填写模型,CPU 就能跑
- 用 Jev 做 NOC/SOC 告警分诊:规则先行、一个类型化问题、一道策略闸门
- Ollama 决策模型实测:tev1 + nimble 跑在 8GB 显卡上
- Jev 生产环境护栏:五步接入实战手册
- Pi Agent 防跑偏插件实战:让 Jev 出概率,让代码做决定
- Jev 实测:官方宣称与独立复测之间的距离
- Jev 工单分类实战:after-insert hook 与计算字段两种接法