jev-voice-browser GitHub avatar by moritzkremb

moritzkremb /

Browser & OS Action

jev-voice-browser

用语音控制 Playwright 浏览器,将逐步转写的口令交给 Jev 判断。

License: MITLanguage: TypeScript最近提交:2026/9/17#browser-automation#voice-conversation

JEV 在该架构中的决策位置

选择意图、元素、网址或原文片段,并判断口令是否完整、是否涉及敏感动作。

核心架构收益

界面显示概率、动作与请求时间,便于观察语音交互。

固定版本源码审校依据

本站人工核验过该仓库的以下固定 commit 源码文件,确认 Jev 决策逻辑的真实接入方式:

审校说明与基准口径:约 250–350 ms 是作者报告的单次请求时延,不是每条语音指令的端到端保证。 已核对固定版本 README 与集成源码。
快速克隆仓库
git clone https://github.com/moritzkremb/jev-voice-browser.git

在 GitHub 上查看源码

查阅该项目的 README、Issue 讨论与提交历史,了解该开源项目最新进展。

moritzkremb/jev-voice-browser

所属架构分类

浏览器与桌面

浏览器自动化与操作系统 UI 操作:将 DOM / 无障碍树状态转换为有界动作候选供 Jev 选择。

查看该分类下的全部项目 →

同分类相关项目推荐(浏览器与桌面)

jev-ultrafast repository icon by browser-use

browser-use

jev-ultrafast

6,031
Browser & OS ActionMITPython

给浏览器一个目标,让 Jev 选择操作和页面控件,需要输入文字时再调用文本模型。

JEV 在这里做什么

根据当前 DOM,在一次请求里选择操作和相应控件;文本模型负责生成输入内容。

把界面选择、文字生成与浏览器执行分开,方便查看每一步。

#browser-automation#typed-decisions
3843 处源码证据
查看详情
1,275
Browser & OS ActionApache-2.0Rust

把电脑里的按钮和菜单交给 Jev 来选。它读原生无障碍结构,一步步完成桌面操作。

JEV 在这里做什么

Jev 同时选择动作与目标,并评估置信度和操作风险;本地策略决定是否执行或停止。

让主 Agent 不必把整棵界面树塞进上下文。

#desktop-os#typed-decisions
862 处源码证据
查看详情
117
Browser & OS ActionMITTypeScript

给定任务与网址后驱动浏览器,返回最终页面、截图和逐步操作记录。

JEV 在这里做什么

从 DOM 控件选择点击、输入、选择或滚动,并判断目标是否完成、流程是否卡住。

把动作建议、实际执行与停止原因留在可检查的轨迹中。

#browser-automation#typed-decisions
62 处源码证据
查看详情