Guides / 视频转图文攻略

Jev Playground 实测攻略:热狗课程、criteria 校准与四平台 token 账单

Caffeinated Software 用 9 分钟走完 TypeSafe 控制台 Playground:热狗三明治 Noul 课程从 61% 校准到 76%,按立方体食物规则搭出 Choice 问题并全量排序,再把同一份提示词分别丢给 GPT-5.6 Luna、Sonnet 5 与 Gemini 3.7 Flash,逐家对 token 账单。

速览结论

一段录屏跑通整个 Playground。TypeSafe 控制台的热狗三明治 Noul 课程首答 61% true;补上两句 true/false 判据后到 76%;推倒重做的 Choice 问题——一个热狗 State 加八条立方体规则——把 Taco 排到 94%(Sushi 5%,confidence 93%),全程约 95 毫秒、543 个输入 token 加 84 个分文不收的输出 token。同一份提示词丢进三家对手的 Playground:GPT-5.6 Luna 用了 4.1 秒、为 132 个输出 token 付费(445 进);Sonnet 5 判 taco、confidence 88,674 进 → 173 出约合 $0.0031 一跑;Gemini 3.7 Flash 烧掉 495 进 / 100 出,还给了个 confidence 100。对手全都要为输出 token 付费、置信度全靠自报——这个差距就是 Jev 的整个卖点。

视频来源

Caffeinated Software

8:51eOmEu4T454E

分步图文攻略

  1. 1

    进控制台:三种原语、三节入门课

    先解决入场券。录制时 Jev 还是邀请制:在 Join Our Waitlist 表单留邮箱、做一份「我这辈子填过最长的问卷」,等几个小时邀请才到(等待期间可以去项目 Discord 蹲着)。视频引用的官方说法:ChatGPT 联合发明者造了个新模型,快 20–200 倍、便宜 40–400 倍——因为输出 token 免费。进了控制台,Playground 的「Select primitive type」面板就是全部词汇表:Noul 判断一件事有多真(0 到 1)、Score 设评分规则、Choice 出多选题,各自带 Docs 链接。Learn to TypeSafe 面板把同样的东西打包成入门课——Is hotdog a sandwich?(Noul)、What color is the sky?(Choice)、Can monkeys create art?(Score)——下面还有真实用例:简历筛选、客服对话审计、工单分诊。左下角的模型选择器写着 jev-latest。

    TypeSafe AI 控制台 Playground 截图:Learn to TypeSafe 面板并列 Noul、Choice、Score 三节入门课,旁边是简历筛选、客服审计、工单分诊等真实用例。
    控制台即课堂:三种原语、三节入门课。跳转至 1:25
  2. 2

    跑第一课:模型诚实地说 61%

    热狗课打开一个双栏编辑器。State 里是占位符 { "example_state": "Add context for TypeSafe to evaluate" },Questions 里是一个 Noul 问题:{ "is_sandwich": { "type": "noul", "instructions": "Is hotdog a sandwich?" } }。按 Run request(Ctrl+Enter),Response 面板回答「61% true」,落款 jev-latest 100ms · 118ms。课程的引导气泡把教学点挑明:「Hmm, the model’s rather unsure. Let’s clarify what a sandwich is in our question.」光秃秃的问题只会换来一个耸肩——不确定性不是缺陷,是下一步的引子。

    Jev 对 Is hotdog a sandwich 这条 Noul 问题给出 61% true 的判定,右下角的课程气泡提示模型并不确定。
    首跑 61% true——连课程自己都承认模型不确定。跳转至 2:12
  3. 3

    加 criteria:61% 变 76%

    criteria 就是挂在问题上的定义——主讲人的说法是「basically a definition」。课程加了两条:true = 「A sandwich is a food dish where a filling, such as meat, cheese, vegetables, or spread, is placed between structural starch」,false = 「The food has no bread enclosing a filling or uses only a single slice of bread, or uses a non-bread wrapper such as a tortilla, wafer, or cookie.」原样重跑,答案变成 76% true(jev-latest 135ms · 124ms)。State 没动、问题文本没动,只多了定义,判定就被重新校准。整个校准循环就一句话:Jev 不确定时,把边界描述给它。

    TypeSafe Playground 里给 Noul 问题补上 true/false 两条 criteria 定义后重跑,热狗三明治判定从 61% 涨到 76% true。
    两句定义,把判定拉到 76%。跳转至 2:26
  4. 4

    出正式题:一个 State、一道 Choice、八条立方体规则

    主讲人把 76% 的三明治截图发给朋友,对方不服:「这是塔可。」于是他推倒重来。State 里先定义主体:{ "hotdog": "A food with a starch on 3 sides and a cylindrical meat filling." }(他还提醒这里也能塞随机场景)。问题换成 Choice,instructions 是「What is a hotdog?」,criteria 把立方体食物图里的八个选项全部写清:Cake(淀粉做结构、横向分层)、Calzone(六面全包)、Quiche(五面、开口容器)、Taco(三面——底部加两侧墙,顶部和两端开口)、Salad(零面)、Toast(一面、开放式)、Sandwhich(相对两面)、Sushi(四面卷成筒)。把每个选项描述清楚,答案才可核。

    Jev Choice 出题编辑器:State 里定义了热狗是什么,criteria 按立方体食物规则写全 Cake 到 Sushi 八个选项。
    State 定义热狗,criteria 编码立方体规则。跳转至 3:24
  5. 5

    出分:八个选项全排序,附整体置信度

    响应面板把八个选项排成一列,而不是甩一段散文:Taco 94%、Sushi 5%、Sandwhich 1%,Cake、Toast、Salad、Calzone、Quiche 全是 0%,底部一行「Confidence: 93%」(这一跑落款 jev-latest 95ms + 186ms)。主讲人的原话:「这就是它和 LLM 不一样的地方——它给你一个扎实的格式。」重跑会有一两个点的抖动:他后面对比跑引的就是 96% taco。排序列表才是重点——你可以拿任何一条门槛做分支,不只看冠军。

    TypeSafe 控制台把 Choice 答案的八个选项全部排序:Taco 94% 居首、Sushi 5%、Sandwhich 1%,底部标出 93% 的 confidence。
    八个选项全排序,附一个整体置信度。跳转至 4:12
  6. 6

    打开 JSON:输入 543、输出 84,输出免费

    切到 JSON 视图,一次运行被拆得干干净净:"choice": "Taco"、"confidence": 0.93、八个选项的 "probabilities" 对象,然后是 "usage": { "input_tokens": 543, "output_tokens": 84 }、"request_id": "playground_…"、"evaluation_time_ms": 95.42。主讲人指出 token 数每次跑都一样——而账单结构才是卖点:「Jev 不收输出 token 的钱,这里也就是那 84 个。」整个判定约 95 毫秒。

    Jev Playground 运行结果的原始 JSON,usage 显示输入 543 token、输出 84 token,choice 为 Taco、confidence 0.93,evaluation_time_ms 约 95 毫秒。
    进 543 个 token,出 84 个——出的免费。跳转至 4:20
  7. 7

    同一份提示词,抄进三家对手的 Playground

    测速环节他把四个 Playground 铺在一屏——TypeSafe 左上、OpenAI 右上、Claude Console 左下、Google AI Studio 右下——把一模一样的提示词逐字粘进每家(他特别叮嘱「不能多一个空格」,还把提示词留在屏幕上供暂停抄写)。OpenAI 的 Configure 面板能看到提示词骨架:对每个选项的 criteria 逐一评估,所有选项概率之和必须等于 100,再报出最可能的单个选项和一个独立的 confidence(0–100)。模型选的是「默认、近乎免费」那档:GPT-5.6 Luna、Sonnet 5(claude-sonnet-5 下拉)、Gemini 3.7 Flash——后者还配了句 system instruction:「You are a classification engine, not a chatbot」。Jev 先跑:「我们都知道它多快——96% taco。」

    同一热狗提示词的四分屏对决:TypeSafe、OpenAI、Claude Console 与 Google AI Studio 同屏作答,画面里可见共享提示词的 Configure 面板和 claude-sonnet-5 模型下拉。
    一份提示词、四个控制台、一个多余空格都不能有。跳转至 5:52
  8. 8

    宣判:同一个决策在别家花多少钱

    GPT-5.6 Luna 拉着思维链想了 4.1 秒,花掉约 577 个 token(445 进 + 132 出)——那 132 个输出 token 要收钱,而且照主讲人的说法,它给的概率是编的。Claude Console 里的 Sonnet 5 也判 Taco、confidence 88——工作台页脚写着 ≈ $0.0031,对应 674 进 → 173 出,约合三分之一美分,挂钟停在 6.1s。Gemini 3.7 Flash 是三家里最快的(按他的读数约 3 秒),烧了 495 进 + 100 出(共 595),还给出一个完美得可疑的 confidence 100。Jev 的同题成绩:543 进、84 出、输出分文不收,判定加全量排序约 95 毫秒。他的算盘:一天做几百万次这种决策的公司,每一个输出 token 都记在账上。

    Claude Console 的运行账单:Sonnet 5 对热狗问题返回 choice Taco、confidence 88,页脚显示 674 输入加 173 输出 token 约合 $0.0031。
    Sonnet 5 的塔可判决:约三分之一美分。跳转至 7:00

常见问题(FAQ)

不会写代码也能用 Jev Playground 吗?

可以——这正是这支视频的意义。TypeSafe 控制台的 Playground 全程靠面板操作:选一个原语(Noul、Score、Choice),改 State 和 Questions 的 JSON,点 Run request(Ctrl+Enter),读带置信度的排序答案。不用 SDK、不用 curl——主讲人不打开任何代码编辑器就跑完了整个热狗三明治练习,连 JSON 用量视图都看了。

怎么拿到 TypeSafe 控制台的访问权?

录制时 Jev 是邀请制:在 Join Our Waitlist 表单提交邮箱,做一份很长的问卷,然后等——主讲人的邀请几小时后就到了。他还推荐等待期间去项目 Discord 蹲着。进来之后,Playground 区就是本攻略用到的入门课程和自由编辑器所在地。

Noul、Choice、Score 有什么区别?

这是 Playground 暴露的三种问题原语。Noul 判断一件事有多真,0 到 1(热狗三明治课);Choice 从你定义的列表里挑(八选一的热狗分类);Score 按你给的评分规则打分(第三课 Can monkeys create art? 用的就是它)。选哪种类型,答案的形状就定成哪种。

做分类,Jev 真的比 ChatGPT 或 Claude 便宜吗?

就视频里这道题,账单是肯定的。Jev:543 输入 token、84 输出 token——输出免费。GPT-5.6 Luna:445 进 + 132 出(要付费),4.1 秒。Claude Console 里的 Sonnet 5:674 进 → 173 出,一跑约 $0.0031(三分之一美分)。Gemini 3.7 Flash:495 进 + 100 出。单次差距是几美分;按主讲人的算法,一天几百万次决策时它就是预算科目。

热狗答案为什么从 61% 变 76%,又从 94% 变 96%?

两回事。61% → 76% 是校准:补上 true/false 判据等于给了模型可对照的定义。94% 与 96% 的抖动是运行间方差——主讲人把同一问题重跑了几次,看着最高概率挪动一两个点才稳定,所以他的建议是看排序列表和 confidence,别只盯着冠军。

相关推荐