Guides / 视频转图文攻略

自己动手造一个 Jev:免费开源零样本分类器(还能打 Doom)

逐帧拆解 Micah 的 4:54 实操:把一个大 45 倍的教师模型蒸馏进 Qwen3 0.6B 学生模型,用 1000+ 个 Doom 局面做两分钟训练,看未见回合的采纳率从约 50/100 涨到 93/100,再用置信度门控自动化——单卡跑到每秒 12 次决策。

速览结论

Typesafe 的 Jev 之所以能打 Doom,是因为它接收「局面 + 三个选项」,瞬间返回概率——完全不生成文本。Jev 本体闭源还要排队等位,但这个形状在家就能复刻:Micah 开源的 openjev 管道把一个大 45 倍的教师模型蒸馏进 Qwen3 0.6B 学生模型,训练集是 1000+ 个录制的 Doom 局面,训练只要约两分钟、一张显卡。训练前学生自称 95% 置信却和教师一半时间不一致;蒸馏后,未见回合的答案采纳率从约 50/100 涨到 93/100——置信度从此可以当自动化闸门:有把握的直接执行,存疑的交给更大的模型或人。教师每题要想约 9 秒,学生约百分之一秒(快约 900 倍),局内每秒 12 次决策。诚实边界:它只认识训练过的那一个 Doom 房间;开源复刻在 TypeSafe 自己公布的测试集上仍比 Jev 低几分。

视频来源

Micah

4:54JsVM4vgspEU

分步图文攻略

  1. 1

    先看清形状:类型化答案一次全回来,不是聊天流

    视频开场是分屏终端。TYPE 一侧,所有答案和概率在一次响应里全部到位——没有生成过程可等。LLM 一侧,客户端停在「waiting for first token」,一个字没吐出来之前什么都解析不了。这就是全部前提:决策模型接收局面和答案列表,给每个选项返回一个百分比——所以它能每秒做出 12 次决策,聊天循环做不到。

    分屏终端对比:TYPE 面板的答案一次性全部返回,LLM 面板还在等待首 token
    决策一次响应完整返回——没有 token,没有流。跳转至 0:10
  2. 2

    喂给模型的是 state 加一句自然语言写的策略

    模型读的不是 prompt,而是 state 数据块。绿色面板把 Doom 局面写成数据:敌人类型、武器有效射程、以地图单位计的玩家体积、移动上下文,还有一句自然语言策略("point blind ambushing, slow reload"——目标进视野前先瞄,够近才开火)。与 state 一起送进去的还有三个问题:瞄哪个敌人、该不该扣扳机、该不该闪避。模型一次前向给所有问题的所有选项打分。

    openjev 的 state 数据块:敌人类型、有效射程、移动上下文与「point blind ambushing, slow reload」自然语言策略行
    state 是数据,策略是一句话——和问题一起送入。跳转至 1:38
  3. 3

    用带标注的百分比教学生,而不是靠 prompt

    小模型答得快但答得烂——没训练过的版本从来不知道躲火球,半分钟就死。解法是蒸馏:一个大 45 倍的教师模型对 1000+ 个录制的 Doom 局面逐题作答,给每个选项标上置信度百分比;学生被训练去复现这些百分比。训练记录终端展示了一条标注样本的样子:问题、选中标签、教师的打分。整个训练在一张显卡上约两分钟,连同 Doom 本体全部可以免费下载。

    openjev 训练记录终端:一条带标注的 Doom 问题与教师 91% 的 hold-fire 打分,用于训练学生模型
    教师的概率就是标签——两分钟训练,全部免费下载。跳转至 1:43
  4. 4

    从 GitHub 上的开源复刻起步

    Jev 本体闭源——架构刻意保密,TypeSafe 的 CEO 只在网上确认过「叫它零样本分类器 absolutely true」。但这个形状可以复刻:Jev 发布后两天内,GitHub 上就出现了开源复刻。视频用的这版叫 TheoLeeCJ/openjev,仓库简介就是整个视频要回答的问题——「Can we run something like Jev on a 3060 at home?」,管道、基准和 demo 配置全都自带。

    GitHub 仓库页 TheoLeeCJ openjev,简介写着 can we run something like Jev on a 3060 at home
    openjev 是第三方开源复刻,不是 TypeSafe 官方产品。跳转至 1:45
  5. 5

    信任置信度之前,先做校准

    全片最有价值的一分钟在讲分数的诚实性。训练前,学生自称 95% 置信,却和教师一半时间不一致——幻灯片把这个说法划掉,旁边画着飞镖盘。蒸馏之后,学生说有把握时,和教师的一致率是 99/100;在训练时没见过的回合里,选中和教师相同答案的比例是 93/100(之前约一半)。校准才是置信度能当自动化闸门的原因:有把握的直接执行,存疑的交给更大的模型或人。

    白板幻灯片划掉「模型自称 95% 置信却只有一半时间正确」的说法,旁边是飞镖盘校准示意
    一致性没测过之前,置信度什么都不是——测过之后它就是闸门。跳转至 3:20
  6. 6

    诚实地给教师定价:每题 9 秒

    速度声明有值得细读的注脚。让大 45 倍的教师模型认真思考每个问题时,它一题要想约 9 秒;蒸馏出的学生在同一张地图上约百分之一秒作答——快约 900 倍,局内每秒 12 次决策。这就是整个模式的经济账:教师的成本只在线下付一次,用来给学生标好局面;学生在线上永远以毫秒级作答。

    幻灯片显示教师模型每道题需要 9 秒思考,之后由蒸馏学生接管作答
    教师花 9 秒思考,学生就不用再想。跳转至 4:22
  7. 7

    看它活下来:316 毫秒一次决策,30 个击杀

    结尾的实跑把数字打在了玻璃上:在更大模型答案上训练的 Qwen3 0.6B,以每次决策 316 毫秒的速度打了 453 次决策、拿下 30 个击杀。输入新策略「don’t shoot, just dodge」后,它停火开始侧移,完全不用重新训练——因为策略是输入,不是权重。诚实边界:这个学生只认识它训练过的那一个房间;最好的开源复刻在 TypeSafe 自己公布的测试用例上仍比 Jev 低几分。

    Doom 实跑画面叠加「Qwen3 0.6B, trained on a bigger model’s answers — 316 ms per decision | 453 decisions | kills 30」统计条
    单卡每秒 12 次决策——在它训练过的房间里。跳转至 4:28

常见问题(FAQ)

openjev 和 Jev 是同一个东西吗?

不是——视频对这一点很谨慎。Jev 是 Typesafe AI 的闭源托管决策模型,架构刻意保密;openjev 是复刻「使用形状」的第三方开源项目:state 加类型化问题进,每个选项的校准概率出,单次前向完成。TypeSafe 的 CEO 公开确认过「零样本分类器」这个描述对 Jev 成立,而这正是 openjev 所处的品类。最好的开源复刻在 TypeSafe 自己公布的测试用例上仍低几分。

自己造一个 Jev 型模型要花多少钱?

视频里的答案:除了电费和你已有的显卡,几乎为零。教师是免费的大模型,训练集是 1000+ 个录制的 Doom 局面,训练约两分钟,连同 Doom 本体都能免费下载。视频标题说的「一晚上造出来」是真的。真正的成本在于给你的业务领域标注局面——这也是任何蒸馏分类器都绕不开的数据工作。

为什么要蒸馏教师,而不是直接 prompt 小模型?

因为没训练的小模型快但错——它从不躲火球,半分钟就死。prompt 装不进判断力,蒸馏装得进。教师对 1000+ 个局面各答一次,线下输出校准百分比;学生把复现这些百分比学到位之后,未见回合与教师的一致率是 93/100。教师「每题 9 秒」的成本只付一次,之后线上永远是百分之一秒的作答。

置信度分数到底在门控什么?

门控自动化。校准之后,学生「有把握」的答案几乎总是教师的答案,程序可以直接执行;存疑的升级给更大的模型或人。这和托管 Jev 上的置信度门控是同一个模式——阈值之所以可用,是因为分数对着真值校验过,这也是视频花整整一分钟讲「自称 95% 置信、正确率一半」这个坑的原因。

学生能处理没训练过的局面吗?

基本不能——视频说得很直白。学生只认识训练过的那一个 Doom 房间;零样本指的是「答案在提问时现写它也能打分」,不是「理解新环境」。改策略(「don’t shoot, just dodge」)不用重训练,因为策略是输入;换房间、换游戏、换领域,就要重新录局面重新蒸馏。Jev 被宣传为能应对没人准备过的局面,你家自建的这个,诚实地讲是个专才。

跟着做需要什么硬件?

一张消费级显卡就够——仓库标题的问题就是「Can we run something like Jev on a 3060 at home?」,视频的回答是 yes:开源复刻在一张六年前的卡上每秒能答 21 个问题,训练好的学生局内每秒 12 次决策。在同样的卡上,对 1000+ 个教师标注局面做蒸馏训练只要约两分钟。

相关推荐

更多视频攻略