Awesome Jev / 评测与观测

评测与观测

面向 Jev 决策模型与 System-1 架构的离线评测集、延迟监控、追踪与可观测性工具。

返回全部开源项目29 个已审校开源项目
jev-review repository icon by NiazMorshed2007

NiazMorshed2007

jev-review

126
Evaluation & ObservabilityMITTypeScript

供编码 Agent 使用的本地 MCP 代码质量检查器,返回多个维度的结构化评分。

JEV 在这里做什么

Jev 对正确性、复杂度、测试和安全等维度评分,程序汇总优先改进项。

可比较两次检查的评分变化,代码修改仍由主 Agent 负责。

#coding-agents#mcp-integrations#evaluation-benchmarks
104 处源码证据
查看详情
jev-benchmarks repository icon by AbdelStark

AbdelStark

jev-benchmarks

9
Evaluation & ObservabilityApache-2.0Python

把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。

JEV 在这里做什么

对固定文本和标签集合做分类,记录每个标签的概率、耗时和失败。

能看清模型在哪些任务上适合自动处理,在哪些任务上容易过度自信。

#evaluation-benchmarks#classification-ranking
3 处源码证据
查看详情
Evaluation & ObservabilityMITTypeScript

MoonBit 与 TypeScript 的 Jev 实验集,覆盖棋类、浏览器、命令风险和小型语言。

JEV 在这里做什么

不同实验把候选动作或判断题交给 Jev,再由对应程序执行或记录。

提供源码、实验记录和部分可离线重放的样例,便于比较决策设计。

#evaluation-benchmarks#games-simulation#browser-automation
4 处源码证据
查看详情
jev-lm repository icon by y0usaf

y0usaf

jev-lm

5
Evaluation & ObservabilityMITTypeScript

把下一个词当选择题,试着用 Jev 拼出句子;也能让它挑选本地草拟的整段续写。

JEV 在这里做什么

Choice 选词,Noul 判断候选续写能否接上以及是否该停止。

用一套小实验看清决策模型拿来生成文字时会遇到什么问题。

#evaluation-benchmarks#typed-decisions
2 处源码证据
查看详情
jev-chat repository icon by adhyaay-karnwal

adhyaay-karnwal

jev-chat

3
Evaluation & ObservabilityMITTypeScript

实验性聊天解码器:让 Jev 反复选择词或短语,由代码把它们拼成回答。

JEV 在这里做什么

在有限词表与候选回复中做 Choice,比较逐步解码和整句选择策略。

提供解码方法、实验轨迹和失败案例供研究。

#evaluation-benchmarks#typed-decisions
3 处源码证据
查看详情
Evaluation & ObservabilityApache-2.0Python

用 Jev 分析多 Agent 失败记录的评测项目,预测责任 Agent、关键步骤和错误类型。

JEV 在这里做什么

把记录里的 Agent、步骤和错误分类作为选项,提交三组 choice 问题。

提供评测脚本和作者结果;部分基线生成答案而 Jev 选候选,比较条件不同。

#evaluation-benchmarks#classification-ranking
3 处源码证据
查看详情
ask-jev repository icon by omni-

omni-

ask-jev

1
Evaluation & ObservabilityMITPowerShell

Windows PowerShell 工具,在 Codex 中用 :jev 审视会话里已记录的执行证据。

JEV 在这里做什么

把选定记录交给 Jev,判断执行结论和证据是否充分,输出概率。

显式触发才读取并发送记录;判断供参考,不替代实际测试。

#coding-agents#cli-git-gates#evaluation-benchmarks
3 处源码证据
查看详情
jev-rerank-bench repository icon by anessbelbati

anessbelbati

jev-rerank-bench

1
Evaluation & ObservabilityMITTypeScript

比较 Jev、专用 reranker 和聊天模型对同一批搜索片段的排序结果。

JEV 在这里做什么

用 Choice、Noul 和分档评分给候选片段排序,再计算检索指标。

提供原始响应、评分代码和分数据集结果,便于检查比较条件。

#evaluation-benchmarks#search-retrieval#classification-ranking
2 处源码证据
查看详情
jev-demos repository icon by Bud-ro

Bud-ro

jev-demos

0
Evaluation & ObservabilityMITTypeScript

用迷宫测试 Jev 的空间判断,比较单步选择和一次预测多步的表现。

JEV 在这里做什么

让 Jev 从方向候选中选择下一步或后续多步,再检查碰墙、绕路和到达情况。

保留实验设置和失败结果,便于研究判断边界。

#games-simulation#evaluation-benchmarks
3 处源码证据
查看详情
foreman-jev repository icon by Shifty-Eye-Games

Shifty-Eye-Games

foreman-jev

0
Evaluation & ObservabilityMITPython

给 Codex 工人配一个 Jev 监督员。它评估进展,但完成前还必须跑程序员指定的验收命令。

JEV 在这里做什么

对工作状态和证据做进展与完成判断,本地运行验收命令并检查源码在验证期间是否变化。

把模型判断和实际命令结果一并留档,方便检查任务是否真的收尾。

#coding-agents#evaluation-benchmarks
2 处源码证据
查看详情
latitude-llm repository icon by latitude-dev

latitude-dev

latitude-llm

4,655
Evaluation & ObservabilityMITTypeScript

Latitude 的可选 Jev 预分类器为对话检查打分,并记录检查选择的依据。

JEV 在这里做什么

判断各项检查的适用性,满足阈值与限流条件时补充检查任务。

记录模型、阈值、调用时间与选择原因,便于对照原流程。

#evaluation-benchmarks#voice-conversation
3924 处源码证据
查看详情
taskuary repository icon by ldbumble

ldbumble

taskuary

105
Evaluation & ObservabilityMITPython

Taskuary 的可选 Jev 判断模块,对任务运行状态检查用户定义的条件。

JEV 在这里做什么

把条件转成 yes/no 概率问题,按本地阈值返回布尔结果和原始概率。

可为任务结果增加结构化检查;不是整个消息系统都由 Jev 控制。

#evaluation-benchmarks#typed-decisions
173 处源码证据
查看详情
jev-gomoku repository icon by XieChengYuan

XieChengYuan

jev-gomoku

1
Evaluation & ObservabilityMITJavaScript

弈瞬:同时运行九盘 15×15 五子棋,让两位 Jev 玩家比较不同输入信息,并逐手检查请求与返回。

JEV 在这里做什么

从本地规则生成的候选落点中做 Choice 判断,对比棋盘、战术事实等不同输入。

支持带明确标记的历史回放和自带密钥的实时对战,保留逐手实验记录。

#games-simulation#evaluation-benchmarks
3 处源码证据
查看详情
jevcal repository icon by abhixhek

abhixhek

jevcal

5
Evaluation & ObservabilityMITPython

用自己的标注数据评估 Jev 概率、选择置信度阈值,并检查模型更新后的变化。

JEV 在这里做什么

调用决策模型处理固定问题,计算准确率、校准、覆盖率和需要升级处理的比例。

把阈值选择与模型漂移检查接到报告和 CI 中。

#evaluation-benchmarks#typed-decisions
3 处源码证据
查看详情
jev-benchmark repository icon by wondertwins

wondertwins

jev-benchmark

2
Evaluation & ObservabilityMITTypeScript

通过国际象棋和游戏 NPC 对话对象识别,测试 Jev 的选择与判断边界。

JEV 在这里做什么

在合法棋步中选择,或分别判断玩家话语是否在对某个 NPC 说。

公开标注数据、原始请求响应与评测代码。

#evaluation-benchmarks#games-simulation
12 处源码证据
查看详情
jev-frontend-qa repository icon by Nainish-Rai

Nainish-Rai

jev-frontend-qa

2
Evaluation & ObservabilityMITPython

用 Jev 选择浏览器操作,再通过 DOM、HTTP 和数据库状态检查前端功能是否符合约定。

JEV 在这里做什么

Jev 从已观察的控件和操作中做选择;预期值和通过条件由测试代码判断。

将模型探索过程与可验证的功能验收分开记录。

#browser-automation#evaluation-benchmarks
3 处源码证据
查看详情
Evaluation & ObservabilityMITPython

Hermes 的目标验收 skill,保存要求、生成运行提示词,并检查证据是否满足要求。

JEV 在这里做什么

可机器检查的部分运行本地检查,Jev 对其余语义要求判断达成程度。

把目标与可检查条件放在一起;模型判断不替代真实验收证据。

#evaluation-benchmarks#mcp-integrations
13 处源码证据
查看详情
1
Evaluation & ObservabilityMITPython

用 Jev 筛选 ADHD 综述的论文标题和摘要,并与 Cohen Abstract Triage 标注比较。

JEV 在这里做什么

围绕纳入标准回答 Choice 与 Noul 问题,本地规则组合成 include 或 exclude。

保留不同数据切片和问法的指标,便于检查漏筛与误筛。

#domain-workflows#search-retrieval#evaluation-benchmarks
12 处源码证据
查看详情
jev-exploration repository icon by SamuelSacco

SamuelSacco

jev-exploration

1
Evaluation & ObservabilityMITPython

记录 Jev 能力与限制的研究仓库,包含主张审查、概率校准实验和可运行示例。

JEV 在这里做什么

用固定问题与标注案例调用 Jev,保存回答并分析错误、校准及不同难度下的表现。

把研究结论与实验代码、数据和证据账本对应起来。

#evaluation-benchmarks#typed-decisions
2 处源码证据
查看详情
Evaluation & ObservabilityMITTypeScript

供编码 Agent 调用的 MCP 代码审查引擎,对提交的 diff 按规则给出结构化判断。

JEV 在这里做什么

Jev 按规则检查 diff,再从实际 hunk 中选证据位置并复核问题。

调用方提供 diff 与业务边界;引擎不会自行扫描仓库,评分仍需人工复核。

#coding-agents#mcp-integrations#evaluation-benchmarks
3 处源码证据
查看详情
supercov repository icon by supercorp-ai

supercorp-ai

supercov

41
Evaluation & ObservabilityMITTypeScript

编程 Agent 的代码质量与覆盖率 CLI:Jev 检查源码属性,本地覆盖率工具帮助选择补测目标。

JEV 在这里做什么

向 Jev 询问每个文件的质量属性,由程序汇总分数与优先顺序。

把分数拆成可对照源码的命名属性,并缓存按内容得到的结果。

#coding-agents#cli-git-gates#evaluation-benchmarks
13 处源码证据
查看详情
jev-pref repository icon by doeixd

doeixd

jev-pref

2
Evaluation & ObservabilityMITJavaScript

把 AGENTS.md 中的项目偏好整理为规则,再用 Jev 检查 hunk、暂存文件或 PR。

JEV 在这里做什么

Jev 判断代码变更是否触及配置规则,程序将答案映射为检查结果。

可把语义规则反馈给编码 Agent,不能替代类型检查、测试或安全审计。

#coding-agents#cli-git-gates#evaluation-benchmarks
3 处源码证据
查看详情
Evaluation & ObservabilityMITJavaScript

可交互的 Jev 实验集,展示客服工单分流预览和三维驾驶仿真。

JEV 在这里做什么

给客服消息做多项判断,或根据结构化模拟传感器选择车道与目标速度。

把输入、概率和后续行为放在界面中对照观察。

#games-simulation#classification-ranking#evaluation-benchmarks
23 处源码证据
查看详情
Evaluation & ObservabilityMITPython

GoodWatch 仓库内的影视特征评分实验,比较 Jev 对情绪、情节等特征的不同问法和批量方式。

JEV 在这里做什么

对固定影视样本询问特征是否存在或有多明显,记录分数、耗时和 Token。

便于对照问题尺度、输入内容与批处理设计,检查特征判断。

#creative-multimedia#evaluation-benchmarks
22 处源码证据
查看详情
Evaluation & ObservabilityMITPython

通过公开 API 和数据测试 Jev 概率校准、选项措辞影响及韩文判断表现。

JEV 在这里做什么

收集 Noul 与 Choice 输出,对照标签计算误差、准确率和稳定性。

保留逐次调用数据与实验说明,便于检查结论适用范围。

#evaluation-benchmarks#classification-ranking
2 处源码证据
查看详情
Evaluation & ObservabilityMITTypeScript

在共同的应用任务上对照 Jev 与其他结构化输出模型,记录错误、延迟、Token 与估算成本。

JEV 在这里做什么

把同一任务转换成 Jev 的 Choice/Noul 问题,并把答案映射到统一的结果格式。

保留对照方法与结果,方便检查模型差异。

#evaluation-benchmarks#typed-decisions
52 处源码证据
查看详情
Canny repository icon by qkal

qkal

Canny

1
Evaluation & ObservabilityMITTypeScript

为 Claude Code 与 Codex CLI 记录执行账本,检查改动后是否有通过的验证。

JEV 在这里做什么

Jev 可识别完成声明和语义规则问题;阻止结束依赖账本事实与本地规则。

区分执行证据与模型意见,Jev 不单独决定任务已通过验收。

#coding-agents#cli-git-gates#evaluation-benchmarks
3 处源码证据
查看详情
Evaluation & ObservabilityMITPython

针对 Jev 1.13.0 的独立行为研究,记录不同问题表述、输入条件及游戏任务下的成功与失败。

JEV 在这里做什么

向固定任务发送受控变体,保存选择结果、概率和原始请求响应。

让读者按具体案例查看证据,区分小任务通过与复杂任务能力。

#evaluation-benchmarks#games-simulation
2 处源码证据
查看详情
Evaluation & ObservabilityMITPython

在有标签的分类任务上比较 Jev 与 OpenRouter 模型的准确率、校准、时延和成本。

JEV 在这里做什么

对相同任务收集模型判断,并计算置信区间及重复输入的稳定性。

发布数据处理、调用与统计代码,以及特定模型的结果。

#evaluation-benchmarks#classification-ranking
2 处源码证据
查看详情

探索其他架构分类

深入了解 Jev 决策工作流