Guides / 视频转图文攻略

Jev 赋能极速浏览器 Agent:178ms DOM 决策循环与双模型协作实战

Jev Ultrafast GitHub 如何用过滤式 DOM Snapshot 取代 VLM 截图轮询,Parallel Sampler 零幻觉动作映射、RLCD 校准概率与 System 1/System 2 双模型编排。

速览结论

视觉语言浏览器 Agent 在生产中失败,因为截图轮询与自回归 JSON 生成既慢又易幻觉。Jev Ultrafast 捕获过滤后的 DOM 快照,Parallel Sampler 将输出映射到索引动作(Google Flights 决策循环 178ms),RLCD 校准置信度,文本生成交给 System Two LLM,Jev 负责点击与滚动。

视频来源

Alex Hitt

8:48NFKHLhAvj1g

分步图文攻略

  1. 1

    基准测试:顺序 VLM 循环 vs Jev Ultrafast

    苏黎世→伦敦 Google Flights 任务测得旧顺序感知-生成循环端到端 9.45 秒。迁移到 Jev 并行决策后总时间降 25% 至 7.09 秒,内部 AI 决策循环仅 178ms。协议调用减少约 90%,Token 成本降至每次动作几分之一美分——支持连续事件驱动监控,而非每小时批处理。

    Google Flights 浏览器 Agent 基准叠加层显示从顺序 VLM 截图轮询迁移到并行结构化采样后 Jev 决策循环时间为 178 毫秒。
    Google Flights 基准:178ms 决策循环,协议调用减少 90%。跳转至 0:30
  2. 2

    用过滤式原子 DOM 快照取代截图轮询

    传统 Agent 每轮 base64 编码截图,触发重布局。Jev Ultrafast 运行 JavaScript 工具捕获单一原子 DOM 快照——可操作元素、ARIA 标签、状态值——截断屏外节点以保留 context window。快照保留浏览器内存节点引用,消除脆弱 XPath/CSS 选择器生成。代价:WebGL 画布与复杂可视化对此读取路径不可见。

    过滤后的原子 DOM 快照数组高亮可操作 Aria 标签与屏上元素索引,屏外节点被截断以优化 Jev Token 效率。
    结构化 DOM 数组:索引化目标 + 屏外截断控制 Token 预算。跳转至 1:55
  3. 3

    Parallel Sampler 映射有效动作——零幻觉目标

    自回归 JSON 易发明选择器与畸形类型。Jev 单次并行读取 state 数组,跨 decision head 输出约束于预定操作(click、scroll、type_text)。每个动作绑定快照中的有效索引——在输出层结构上不可能幻觉不存在的目标。亚 20ms 推理用生成自由换取 type-safe 状态转移。

    Jev Parallel Sampler 架构将 decision head 映射到 click 与 scroll 动作,索引绑定有效 DOM 快照目标以防止幻觉 CSS 选择器。
    Parallel Sampler:动作 head + DOM 索引,无自由格式选择器字符串。跳转至 3:35
  4. 4

    双模型编排与物理执行防护栏

    System One Jev 无法生成开放式文本——若选择 type_text,循环暂停,System Two LLM 合成「Zurich」后恢复执行。生产防护包括点击遮挡验证(模态/粘性头遮挡则阻止点击)与 stale-page 指纹(React hydration 中途变异 DOM 则重试)。本地 Inspector 在可交互元素上叠加 live 概率百分比,实现认知透明调试。

    双模型浏览器 Agent 循环中 System One Jev 选择 type_text 动作后暂停,System Two LLM 生成 Zurich 文本再恢复 ultrafast 执行周期。
    双模型:Jev 决定动作类型;System Two LLM 填充文本字段。跳转至 6:05

常见问题(FAQ)

为何不为浏览器 Agent 直接用更大的视觉模型?

堆参数无法消除自回归生成延迟。航班搜索基准表明亚秒循环需要对 DOM state 做 structured sampling,而非每轮发送更重的截图编码器。

DOM 快照过滤有哪些盲区?

WebGL 场景、HTML5 canvas 游戏与标准 HTML 层级外的富可视化可能不可见。架构有意用全面视觉上下文换取 ingest 速度——适合表单密集的企业门户,不适合纯 canvas UI。

RLCD 如何改变浏览器自动化的置信度阈值?

RLCD 使报告置信度与 empirical 成功率对齐。Jev 对目标按钮输出 90% 置信度时,aggregate 准确率应接近 90%——可制定确定性规则:高于阈值自动点击,低于则升级人工或 Fallback 模型。

模态框遮挡目标按钮会怎样?

点击遮挡验证在 dispatch 前检查几何布局。若粘性头或广告模态重叠节点,主动阻止执行,而非向错误层 firing click——在充满异步 API、React hydration 与广告的现代网页上,速度与物理安全并重。