goodwatch-monorepo GitHub avatar by alp82

alp82 /

Evaluation & Observability

goodwatch-monorepo

GoodWatch 仓库内的影视特征评分实验,比较 Jev 对情绪、情节等特征的不同问法和批量方式。

License: MITLanguage: Python最近提交:2026/9/17#creative-multimedia#evaluation-benchmarks

JEV 在该架构中的决策位置

对固定影视样本询问特征是否存在或有多明显,记录分数、耗时和 Token。

核心架构收益

便于对照问题尺度、输入内容与批处理设计,检查特征判断。

固定版本源码审校依据

本站人工核验过该仓库的以下固定 commit 源码文件,确认 Jev 决策逻辑的真实接入方式:

审校说明与基准口径:源码明确是独立评分实验,不证明线上推荐使用 Jev,也没有优于向量推荐的已核验依据。本站未重跑。
快速克隆仓库
git clone https://github.com/alp82/goodwatch-monorepo.git

在 GitHub 上查看源码

查阅该项目的 README、Issue 讨论与提交历史,了解该开源项目最新进展。

alp82/goodwatch-monorepo

所属架构分类

评测与观测

面向 Jev 决策模型与 System-1 架构的离线评测集、延迟监控、追踪与可观测性工具。

查看该分类下的全部项目 →

同分类相关项目推荐(评测与观测)

jev-review repository icon by NiazMorshed2007

NiazMorshed2007

jev-review

126
Evaluation & ObservabilityMITTypeScript

供编码 Agent 使用的本地 MCP 代码质量检查器,返回多个维度的结构化评分。

JEV 在这里做什么

Jev 对正确性、复杂度、测试和安全等维度评分,程序汇总优先改进项。

可比较两次检查的评分变化,代码修改仍由主 Agent 负责。

#coding-agents#mcp-integrations#evaluation-benchmarks
104 处源码证据
查看详情
jev-benchmarks repository icon by AbdelStark

AbdelStark

jev-benchmarks

9
Evaluation & ObservabilityApache-2.0Python

把 Jev 和 GLiNER 放到同一批分类题上,除了答对率,也检查概率靠不靠谱。

JEV 在这里做什么

对固定文本和标签集合做分类,记录每个标签的概率、耗时和失败。

能看清模型在哪些任务上适合自动处理,在哪些任务上容易过度自信。

#evaluation-benchmarks#classification-ranking
3 处源码证据
查看详情
Evaluation & ObservabilityMITTypeScript

MoonBit 与 TypeScript 的 Jev 实验集,覆盖棋类、浏览器、命令风险和小型语言。

JEV 在这里做什么

不同实验把候选动作或判断题交给 Jev,再由对应程序执行或记录。

提供源码、实验记录和部分可离线重放的样例,便于比较决策设计。

#evaluation-benchmarks#games-simulation#browser-automation
4 处源码证据
查看详情