Awesome Jev / 评测与观测
评测与观测
面向 Jev 决策模型与 System-1 架构的离线评测集、延迟监控、追踪与可观测性工具。
NiazMorshed2007
jev-review
供编码 Agent 使用的本地 MCP 代码质量检查器,返回多个维度的结构化评分。
Jev 对正确性、复杂度、测试和安全等维度评分,程序汇总优先改进项。
↳ 可比较两次检查的评分变化,代码修改仍由主 Agent 负责。
AbdelStark
jev-benchmarks
把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。
对固定文本和标签集合做分类,记录每个标签的概率、耗时和失败。
↳ 能看清模型在哪些任务上适合自动处理,在哪些任务上容易过度自信。
mizchi
jev-playground
MoonBit 与 TypeScript 的 Jev 实验集,覆盖棋类、浏览器、命令风险和小型语言。
不同实验把候选动作或判断题交给 Jev,再由对应程序执行或记录。
↳ 提供源码、实验记录和部分可离线重放的样例,便于比较决策设计。
y0usaf
jev-lm
把下一个词当选择题,试着用 Jev 拼出句子;也能让它挑选本地草拟的整段续写。
Choice 选词,Noul 判断候选续写能否接上以及是否该停止。
↳ 用一套小实验看清决策模型拿来生成文字时会遇到什么问题。
adhyaay-karnwal
jev-chat
实验性聊天解码器:让 Jev 反复选择词或短语,由代码把它们拼成回答。
在有限词表与候选回复中做 Choice,比较逐步解码和整句选择策略。
↳ 提供解码方法、实验轨迹和失败案例供研究。
TokenTrim
jev-agent-failure-benchmark
用 Jev 分析多 Agent 失败记录的评测项目,预测责任 Agent、关键步骤和错误类型。
把记录里的 Agent、步骤和错误分类作为选项,提交三组 choice 问题。
↳ 提供评测脚本和作者结果;部分基线生成答案而 Jev 选候选,比较条件不同。
omni-
ask-jev
Windows PowerShell 工具,在 Codex 中用 :jev 审视会话里已记录的执行证据。
把选定记录交给 Jev,判断执行结论和证据是否充分,输出概率。
↳ 显式触发才读取并发送记录;判断供参考,不替代实际测试。
anessbelbati
jev-rerank-bench
比较 Jev、专用 reranker 和聊天模型对同一批搜索片段的排序结果。
用 Choice、Noul 和分档评分给候选片段排序,再计算检索指标。
↳ 提供原始响应、评分代码和分数据集结果,便于检查比较条件。
Bud-ro
jev-demos
用迷宫测试 Jev 的空间判断,比较单步选择和一次预测多步的表现。
让 Jev 从方向候选中选择下一步或后续多步,再检查碰墙、绕路和到达情况。
↳ 保留实验设置和失败结果,便于研究判断边界。
Shifty-Eye-Games
foreman-jev
给 Codex 工人配一个 Jev 监督员。它评估进展,但完成前还必须跑程序员指定的验收命令。
对工作状态和证据做进展与完成判断,本地运行验收命令并检查源码在验证期间是否变化。
↳ 把模型判断和实际命令结果一并留档,方便检查任务是否真的收尾。
latitude-dev
latitude-llm
Latitude 的可选 Jev 预分类器为对话检查打分,并记录检查选择的依据。
判断各项检查的适用性,满足阈值与限流条件时补充检查任务。
↳ 记录模型、阈值、调用时间与选择原因,便于对照原流程。
ldbumble
taskuary
Taskuary 的可选 Jev 判断模块,对任务运行状态检查用户定义的条件。
把条件转成 yes/no 概率问题,按本地阈值返回布尔结果和原始概率。
↳ 可为任务结果增加结构化检查;不是整个消息系统都由 Jev 控制。
XieChengYuan
jev-gomoku
弈瞬:同时运行九盘 15×15 五子棋,让两位 Jev 玩家比较不同输入信息,并逐手检查请求与返回。
从本地规则生成的候选落点中做 Choice 判断,对比棋盘、战术事实等不同输入。
↳ 支持带明确标记的历史回放和自带密钥的实时对战,保留逐手实验记录。
abhixhek
jevcal
用自己的标注数据评估 Jev 概率、选择置信度阈值,并检查模型更新后的变化。
调用决策模型处理固定问题,计算准确率、校准、覆盖率和需要升级处理的比例。
↳ 把阈值选择与模型漂移检查接到报告和 CI 中。
wondertwins
jev-benchmark
通过国际象棋和游戏 NPC 对话对象识别,测试 Jev 的选择与判断边界。
在合法棋步中选择,或分别判断玩家话语是否在对某个 NPC 说。
↳ 公开标注数据、原始请求响应与评测代码。
Nainish-Rai
jev-frontend-qa
用 Jev 选择浏览器操作,再通过 DOM、HTTP 和数据库状态检查前端功能是否符合约定。
Jev 从已观察的控件和操作中做选择;预期值和通过条件由测试代码判断。
↳ 将模型探索过程与可验证的功能验收分开记录。
poponline63
hermes-jev-north-star
Hermes 的目标验收 skill,保存要求、生成运行提示词,并检查证据是否满足要求。
可机器检查的部分运行本地检查,Jev 对其余语义要求判断达成程度。
↳ 把目标与可检查条件放在一起;模型判断不替代真实验收证据。
PistachioAIHQ
jev-synergy-screening
用 Jev 筛选 ADHD 综述的论文标题和摘要,并与 Cohen Abstract Triage 标注比较。
围绕纳入标准回答 Choice 与 Noul 问题,本地规则组合成 include 或 exclude。
↳ 保留不同数据切片和问法的指标,便于检查漏筛与误筛。
SamuelSacco
jev-exploration
记录 Jev 能力与限制的研究仓库,包含主张审查、概率校准实验和可运行示例。
用固定问题与标注案例调用 Jev,保存回答并分析错误、校准及不同难度下的表现。
↳ 把研究结论与实验代码、数据和证据账本对应起来。
TheBous
jev-flash-review
供编码 Agent 调用的 MCP 代码审查引擎,对提交的 diff 按规则给出结构化判断。
Jev 按规则检查 diff,再从实际 hunk 中选证据位置并复核问题。
↳ 调用方提供 diff 与业务边界;引擎不会自行扫描仓库,评分仍需人工复核。
supercorp-ai
supercov
编程 Agent 的代码质量与覆盖率 CLI:Jev 检查源码属性,本地覆盖率工具帮助选择补测目标。
向 Jev 询问每个文件的质量属性,由程序汇总分数与优先顺序。
↳ 把分数拆成可对照源码的命名属性,并缓存按内容得到的结果。
doeixd
jev-pref
把 AGENTS.md 中的项目偏好整理为规则,再用 Jev 检查 hunk、暂存文件或 PR。
Jev 判断代码变更是否触及配置规则,程序将答案映射为检查结果。
↳ 可把语义规则反馈给编码 Agent,不能替代类型检查、测试或安全审计。
kavehmz
typesafe-playground
可交互的 Jev 实验集,展示客服工单分流预览和三维驾驶仿真。
给客服消息做多项判断,或根据结构化模拟传感器选择车道与目标速度。
↳ 把输入、概率和后续行为放在界面中对照观察。
alp82
goodwatch-monorepo
GoodWatch 仓库内的影视特征评分实验,比较 Jev 对情绪、情节等特征的不同问法和批量方式。
对固定影视样本询问特征是否存在或有多明显,记录分数、耗时和 Token。
↳ 便于对照问题尺度、输入内容与批处理设计,检查特征判断。
jujumilk3
jev-calibration-audit
通过公开 API 和数据测试 Jev 概率校准、选项措辞影响及韩文判断表现。
收集 Noul 与 Choice 输出,对照标签计算误差、准确率和稳定性。
↳ 保留逐次调用数据与实验说明,便于检查结论适用范围。
iammrduncan
typesafe-ai-benchmark
在共同的应用任务上对照 Jev 与其他结构化输出模型,记录错误、延迟、Token 与估算成本。
把同一任务转换成 Jev 的 Choice/Noul 问题,并把答案映射到统一的结果格式。
↳ 保留对照方法与结果,方便检查模型差异。
qkal
Canny
为 Claude Code 与 Codex CLI 记录执行账本,检查改动后是否有通过的验证。
Jev 可识别完成声明和语义规则问题;阻止结束依赖账本事实与本地规则。
↳ 区分执行证据与模型意见,Jev 不单独决定任务已通过验收。
RINNECODER
jev-behavior-study
针对 Jev 1.13.0 的独立行为研究,记录不同问题表述、输入条件及游戏任务下的成功与失败。
向固定任务发送受控变体,保存选择结果、概率和原始请求响应。
↳ 让读者按具体案例查看证据,区分小任务通过与复杂任务能力。