Guides / 视频转图文攻略
图像决策模型实战 RPA:Imajev-4B 与 Jev-Omni 无 OCR 直读 W-8BEN 税表,90% 置信阈值以下转人工审核
把 Sam Witteveen 的 RPA 表单审查演示整理成分步图文:流程图「矩形是步骤、菱形是决策」的框架,UiPath 兴衰时间线,ImageJevBench 榜单逐帧放大抄录(Imajev-4B 76.39、Jev-Omni 73.10、NeoHorse Jev 4B 71.94),再到 Form Decision Inspector 双模型并跑审查一份未签名的 W-8BEN——unknown 概率、90% 自动采纳阈值、自信答错的真实分歧、改写成多选后双双答对、纯条件逻辑的追问邮件,以及「加一问=加一个文本框」的问题工程。
速览结论
本系列第一支非文本输入的页面:两个开源图像决策模型——Imajev-4B(mohit67890/imajev-4b)与 Jev-Omni(akhilaaa3/Jev-Omni)——在 Form Decision Inspector 应用里并跑审查扫描表单,整条管道没有 OCR。为什么值得看:RPA 自动化的是流程图里的矩形(复制、点击、归档),但旗舰 UiPath 从 2021 年约 300-400 亿美元的 IPO 估值(股价高位 70 美元档)跌到每股 13-14 美元、市值不足 65 亿美元,因为按任务调参的深度学习始终给不出能覆盖菱形——人工判断节点——的通用分类器。图像决策模型正瞄准这些菱形:把原始图像(截图、扫描件、照片)当 state 喂进去,问类型化问题(应用把是否题标为 noul、选择题标为 choice),每个允许选项都拿到概率——还带一个训练出来的 unknown 选项,模型要么笃定要么弃答。基准是 ImageJevBench v0.1.3:684 个计分项(228 公开 + 456 封存、93 项退役;333 个新封存项为合成图像已在卡面声明),综合榜 49 个系统。放大帧抄下的前五名:Imajev-4B 76.39、Jev-Omni 73.10、NeoHorse Jev 4B 71.94、Visual-Jev 4B Answer-SFT 69.81、JPT-4B 69.55——转写稿里讹成的「Neo Horse」实为 NeoHorse Jev 4B。Imajev-4B 的出身是本年度最精简的建模故事:一人、15 天、1,200 美元 GPU 租金,作者是一位退款/客服方向业务流程顾问,在 Reddit 发帖说歧义让每个决策节点都落到人头上。演示表单:未签名的 W-8BEN,打印名 Oliver Bennett、日期 03-25-2026、出生日期栏已填(11-16-1964)、签名行为空并被红框高亮。第 1 轮(r20261002-195810-e908):7 个问题、共 3.3 秒,Imajev-4B 单页 3,159 毫秒 vs Jev-Omni 1,072 毫秒;表单判定 Imajev 为 Return(failed: missing)、Jev-Omni 为 Human(below 90% or abstained: signed, missing)。签名题的核心分歧:Imajev-4B True 91.5%(unknown 1.0%)越过 90% 自动采纳阈值——但错了;Jev-Omni False 73.2% 低于阈值、被打 Human 旗——但对了。Auto 是置信徽章,不是正确徽章。dated 一栏双模型一致(True 98.1% / 98.6%)。把签名题改写成选择题「What is on the signature line?」(handwritten signature / blank / typed name only)后,双方都答 typed name only——74.2% 对 75.1%、agree 标记,Jev-Omni 的 P(handwritten signature) 被钉在 3.92%——双双低于下调到 89% 的阈值、双带 Human 旗,但答案都对:只有打印名,没有手写签名。追问邮件是纯条件逻辑——「Action needed: your tax form… could you please sign the form in the signature field」——挂在 Imajev 的 missing 行(page 1、signature、92.5%、Auto)上;无 LLM、无 OCR。问题工程:给 missing 加一个 date of birth 选项就是加一个文本框、无需重训。复跑(3.4 秒):Imajev-4B 不为所动——仍答 signature 94.5%(nothing missing 3.1%、date of birth 0.6%);Jev-Omni 崩了——nothing missing 45.3%、date of birth 以 30.7% 居次,且在 dob 一题上答 False 88.1%(Imajev 答 True 99.4%)。第二份有签名、缺 DOB 的表单里,双模型一致确认手写签名、一致抓出缺失的出生日期(置信度不同)——模型间一致才是真信号。方法论收束:先测哪些题型适配你的目的、再测哪个模型适配这些题型;按问题各自设置信阈值;低于阈值的转另一个模型确认或转人工审核。用例:RPA、快速图像分类、大规模图像处理。
分步图文攻略
- 1
把任何流程画成流程图:矩形是步骤,菱形是决策
任何业务流程画成流程图都会出现两种形状。矩形是步骤——复制这个、点那个、存档——菱形是决策:这样对吗?这是发票吗?这是付款吗?多年来 RPA 工具自动化的都是矩形:机器人流程自动化,软件机器人像人一样点屏幕、在系统之间搬数据,全按固定规则走。菱形却始终要人来拍板,因为规则没法「看一眼页面」判断上面有没有签名。深度学习有进展,但每家公司、每个场景都得自训模型——这正是视频后半场要用图像决策模型去填的坑。

一行图形讲完全部论点:矩形可以自动化,菱形一直是人。跳转至 0:08 - 2
认识两个开源模型:Imajev-4B 与 Jev-Omni,没有 OCR 环节
演示的架构一张图讲完:PDF 和 JPG 文档流进一个 inspector,再并行送给两个小型开源模型——Imajev-4B(Hugging Face:mohit67890/imajev-4b)和 Jev-Omni(akhilaaa3/Jev-Omni)——收回是否答案。两个模型都在图像 Jev 基准榜的前列,图下方那句手写注释才是架构头条:no OCR step。原始图像直接进模型,前面没有任何文字识别环节。顺带一个时间点:录制当时连 Jev 本体都还不能吃图像输入,所以图像决策这条轴完全属于这类开源模型。

一个 inspector 带两个开源模型:原始图像进、是否出——OCR 这个环节压根不存在。跳转至 1:13 - 3
UiPath 的警世故事:约 300-400 亿美元估值跌到不足 65 亿
这件事在商业上为什么重要:RPA 长成了一个巨大的产业,UiPath 是旗舰——作者 2018 年第一次接触时觉得真了不起。到 2021 年,它成了上市公司,估值约 300-400 亿美元,股价高位在 70 美元档。卡面上那条橙色曲线随后一路弯向当下:每股 13-14 美元,市值不足 65 亿美元(横轴还标注了「not to scale」)。访谈过 UiPath 从业者之后得到的诊断是:产品不烂,而是那个年代的深度学习要按任务重度调参——没有一个通用分类器能在多类决策节点上同时保住高准确率。图像决策模型就是视频要拿来压力测试的候选解药。

一张图装下 RPA 的兴衰:IPO 时约 300-400 亿美元,如今不足 65 亿——菱形从来没被自动化。跳转至 3:24 - 4
ImageJevBench v0.1.3:684 个计分项、49 个系统
基准卡全文:ImageJevBench v0.1.3,「面向图像决策系统的 held-out 对比,从界面目标到日常场景」。冻结基准共 684 个计分项——228 个公开、456 个封存——另有 93 项退役不计分。卡面有一格方法论自曝:333 个新封存项是基准自制的合成图像与渲染图,对前沿 API 模型而言比老的真实来源项更容易。综合分覆盖 49 个系统,粉色条是托管 API;Cost 或 Calibration 任一轴触发 gate 的系统直接记 0 分。演示用的两个模型就是从这个榜上选的。

榜单自己的小字:684 个计分项、456 个封存、合成项警示自曝、49 个系统同台。跳转至 5:10 - 5
把榜读明白:Imajev-4B 76.39——转写稿里的「Neo Horse」是 NeoHorse Jev 4B
放大综合榜顶部,行行可读:第 1 名 Imajev-4B 76.39(金色条),第 2 名 Jev-Omni 73.10,第 3 名 NeoHorse Jev 4B 71.94,第 4 名 Visual-Jev 4B Answer-SFT 69.81,第 5 名 JPT-4B(kirp / llm2jev)69.55。自动转写讹成的「Neo Horse」就是 NeoHorse Jev 4B,71.94 分。冠军的出身是本页最值得转述的故事:Imajev-4B 由一个人在 15 天里训成,GPU 租金只花了 1,200 美元——而且这个人并非来自研究实验室,下一帧会把这一点拍得更直白。

综合榜前五:Imajev-4B 76.39、Jev-Omni 73.10、NeoHorse Jev 4B 71.94——「Neo Horse」这个转写讹误,逐帧定谳。跳转至 5:24 - 6
冠军为什么存在:一位流程顾问的 Reddit 帖
卡片把 Imajev-4B 指向它的作者——一位流程顾问(process consultant)——以及他在 Reddit 上那篇不只讲「怎么做」、更讲「为什么做」的帖子。他的背景是退款、产品和客服流程,他的论点是:这类流程图里几乎每个决策节点最终都依赖人,因为歧义很难纯靠代码处理。这就是这个品类的需求侧:无数个流程图菱形,现在都由某个人盯着文档做判断。演示从榜上挑了前两名——Imajev-4B 和 Jev-Omni——让它们去啃最普通的那颗菱形:表单签了没有?

作者的路径:流程顾问、退款与客服流程,然后是一篇讲「决策节点为何都落在人身上」的 Reddit 帖。跳转至 5:35 - 7
与文本 Jev 同一套问题——state 换成了原始图像
心智模型从文本决策模型原样平移,只换一处。文本 Jev 拿文本当 state、配类型化问题;图像 Jev 拿图像当(部分)state,问题形状不变——signed?yes | no;date filled?yes | no;doc type?form | invoice。前面没有 OCR 环节喂转写文本,模型自己判断图上是什么、直接从像素作答。值得注意的增量:图像 Jev 模型被训练过连 unknown 选项的概率一起输出,所以它要么笃定、要么承认不知道——把瞎猜从系统里赶出去。答案随后驱动与文本模型同一套「聪明 if」条件,外加一个升级:设一条置信阈值,低于阈值的结果转给另一个模型确认、或转人工审核。

图像当 state、问题形状照旧:是否题与选择题——外加一个模型被允许选的 unknown。跳转至 6:45 - 8
表单本体:一份未签名、有打印名有日期的 W-8BEN
演示把一份美国税表 PDF 拖进 Form Decision Inspector——「Inspect tax PDFs or JPGs. Run two image models, review disagreements.」扫描件是一张 W-8BEN(外国受益人身份声明):Bristol BS1 9XA(英国)地址、出生日期栏已填(11-16-1964)、Sign Here 区块里有打印名 Oliver Bennett 和日期 03-25-2026——打印名上方那行签名栏是空的,查看器用红框把它高亮出来。问题集覆盖表单团队关心的每颗菱形:签了吗、签名旁的日期填了吗、邮寄地址在吗、出生日期填了吗、缺哪个必填项、这是什么表、字迹清晰度如何。DPI 可调,两个模型同时跑。

考卷本体:处处填好,唯独最要紧的签名栏空着。跳转至 8:28 - 9
首轮:7 个问题 3.3 秒——自信的那个答案错了
结果栏写着总计 3.3 秒、1 页、7 个问题;Imajev-4B 单页耗时 3,159 毫秒,Jev-Omni 只用 1,072 毫秒。签名题——「The form has a handwritten signature in the signature field」——Imajev-4B 答 True 91.5%(false 8.5%、unknown 1.0%),越过设在 90% 的自动采纳滑杆,拿到绿色 Auto 徽章;Jev-Omni 答 False 73.2%(true 26.8%),因低于阈值吃了黄色 Human 旗。表单没签名:被打旗的答案才是对的,被自动采纳的那个错了——Auto 的意思是自信,不是正确。表单判定同一步分裂:Imajev-4B 判 Return(failed: missing),Jev-Omni 判 Human(below 90% or abstained: signed, missing)。dated 一栏双模型一致——True 98.1% 对 98.6%——出生日期一栏又起分歧:一个说填了,一个说没填。

诚实之帧:True 91.5% Auto 是错的,False 73.2% Human 才是对的——置信与正确是两根轴。跳转至 9:30 - 10
改写这颗菱形:判断题变选择题,双模型立刻一致
解法是问题工程,不是换模型。把 signed 改成选择题——「What is on the signature line?」,选项 handwritten signature、blank、typed name only——再跑一遍。两个模型现在都答 typed name only:Imajev-4B 74.2%(blank 24.7%、handwritten signature 1.1%、unknown 0.2%),Jev-Omni 75.1%、其手写签名概率被钉在 3.92%(查看器 tooltip 实拍)——两张卡中间是 agree 标记。两个答案都低于自动采纳阈值(此时已调到 89%),所以都带着 Human 旗,但答案都对上了事实:只有打印名,没有手写签名。作者的规则可以推广:在这类任务上,这个模型做分类题比做判断题稳——先测哪些题型适配你的目的,再测哪个模型适配这些题型。

同一颗菱形、更好的题型:typed name only 74.2% ≡ 75.1%——一次改写把分歧变成一致。跳转至 11:20 - 11
追问邮件:纯条件逻辑——无 LLM、无 OCR
Follow-up email 面板零生成地拼出催办邮件:主题「Action needed: your tax form」,Imajev-4B’s answers 与 Jev-Omni’s answers 两个切换页签,Copy 和 Open in mail app 按钮,正文模板——「Thanks for sending your tax form. Before we can process it, could you please: • Sign the form in the signature field. You can reply to this email with the corrected form attached.」没有一个字出自 LLM;它就是挂在模型答案上的条件逻辑,下方还附上推理依据(missing、page 1、signature、92.5%、Auto)。作者再次强调:整个闭环里没有任何光学字符识别——图像按图像传输、按图像处理,邮件只是把决策格式化而已。

让寄件人去修:一条答案触发一封模板邮件——工作流里不耗 LLM 的那一半。跳转至 12:10 - 12
加一问=加一个文本框——然后每个模型都要重测
给 missing 问题加一个新选项就是在选项列表里加一项:date、address、nothing missing——再加一个 date of birth。全程无需重训。复跑(总计 3.4 秒)里 Imajev-4B 毫不含糊:缺哪项依旧答 signature 94.5%(nothing missing 3.1%、date of birth 0.6%)。Jev-Omni 崩了:nothing missing 45.3%、date of birth 以 30.7% 居次——嘴上说「什么都不缺……也许是出生日期缺了」——而且 dob 一题上它答 False 88.1%,Imajev-4B 答 True 99.4%。第二份表单这次有签名、缺出生日期:双模型一致确认手写签名,又各自以不同置信度抓出缺失的 DOB。这才是双模型并跑的真课:一致是信号,分歧是路由条件,每加一问都要把适配性重测一遍。按问题各自设置信阈值、加多选题、加打分题——全都是多加一个文本框的事,按用例定制即可:RPA、快速图像分类、大规模图像处理。

一个新选项、零重训:Imajev 稳在 signature 94.5%,Jev-Omni 漂成「什么都不缺」45.3%——每改一次都要重测。跳转至 13:03
常见问题(FAQ)
RPA 还值得学吗?
值得——但要认清这份工作里哪一半能自动化。视频里那张 UiPath 曲线是真的:2021 年 IPO 估值约 300-400 亿美元、股价高位 70 美元档,如今每股 13-14 美元、市值不足 65 亿美元。崩掉的不是自动化本身,而是「按任务调参的深度学习给决策节点做通用分类器」这条路——流程图里的矩形(复制、点击、归档)十年前就是机器人的地盘;菱形才是没被攻下的那一半。带置信阈值和人工审核路由的图像决策模型,是第一批正对菱形去的像样武器。
什么是图像决策模型?
state 是原始图像——截图、扫描件或照片——而非文本的 Jev 系决策模型。把图像和一组类型化问题(应用把是否题标为 noul、选择题标为 choice)一起交给它,它一次前向为每个问题的每个允许选项返回概率。模型前面不跑 OCR:直接读像素。这类模型还被训练过连 unknown 选项的概率一起输出,遇到含混表单可以弃答而不是硬猜——答案接进与文本决策模型相同的条件逻辑,由置信阈值决定什么转人工审核。
为什么要双模型并跑?
因为它们错的方式不同,而一致是你能免费拿到的唯一信号。演示首轮里,Imajev-4B 说未签名的 W-8BEN 签了——True 91.5%,越过 90% 自动采纳线,但错了;Jev-Omni 说 False 73.2%,低于阈值、被打人工审核旗,但对了。给 missing 加新选项后的复跑里,Imajev-4B 稳在 signature 94.5%,Jev-Omni 漂成 nothing missing 45.3%。把签名题改写成多选后,双方都答 typed name only(74.2% 和 75.1%)。结论不是谁更好,而是各自擅长不同题型——并跑把「分歧」从静默失败变成一条路由规则。
unknown 选项到底值在哪?
它把「无声瞎猜」变成「显式弃答」。这些模型在每个真实选项之外还输出 unknown 的概率——Imajev-4B 签名题上 1.0%、改写后的多选题上 0.2%——于是「我判断不了」成为可度量的结果,而不是需要你反推的低置信猜测。配合置信阈值(首轮 90%、后续复跑 89%,可按问题各自设定),一切不确定或低于阈值的结果转另一个模型确认、或转人工审核。表单审查工作流要的正是这个行为:有把握的自动化,没把握的升级。
Imajev-4B 和 Jev-Omni 是什么?
Hugging Face 上的两个社区开源权重图像决策模型——mohit67890/imajev-4b 与 akhilaaa3/Jev-Omni——分别占据 ImageJevBench v0.1.3 综合榜的第一和第二(76.39 与 73.10,49 个系统中领先第三名 NeoHorse Jev 4B 的 71.94)。Imajev-4B 的出身最出名:一人、15 天、1,200 美元 GPU 租金训成,作者是一位业务流程顾问,在 Reddit 发帖说歧义让他客户工作流里的每个决策节点都落在人头上。两个模型都接受无 OCR 的原始图像输入。录制当时 Jev 本体尚不能吃图像输入——这正是图像轴属于这类开源模型的原因。
这和文本表单填写有什么区别?
state 不同,分工就不重叠。文本表单填写(见本站 Jev 表单填写指南)处理的是你已持有的结构化文本:state 是字符串、问题走 API、模型从不见像素。本页的工作流从「根本没有文本层」的地方起步——扫描 PDF、手机照片、界面截图——模型直读原始图像,所以「有没有手写签名」「缺哪个必填项」这类问题不需要 OCR 环节就能回答。实践中两者是组合关系:文本决策模型驱动结构化的填写与路由,图像决策模型核验页面上真正落了什么——两边最终接的是同一套条件化追办逻辑。
相关推荐
Jev 表单填写指南
文本 state 的孪生页:用结构化文本经 API 填表与核表——像素那一半,看本页。
阅读开源 Jev 模型全景
开源决策模型全景——本页实测的图像输入家族(Imajev-4B、Jev-Omni)就在它的最前线。
阅读Jev Computer Use 指南
截图当 state 的 agent 决策——不看 OCR 审表单和界面这件事的屏幕侧亲戚。
阅读TEV1 用例集指南
文本轴的用例目录——正好对照「只存在于图像里」的决策。
阅读文档分类 Recipe
按类型路由文档包——演示里 form-type 一问直接接入的工作流。
阅读更多视频攻略
- Jev 极速分类实战:从 API 调用到 Choice/Score/Noul 三大原子类型
- 7 分钟透析 Jev 架构:为什么 70ms 决策模型颠覆了 LLM 自动化工作流?
- Jev 赋能极速浏览器 Agent:178ms DOM 决策循环与双模型协作实战
- OpenJevs 开源 Jev 模型全景:Semif、Nimble、Decider、DiffusionGemma 与 Laya 实测
- Jev 会取代 LLM 吗?Krish Naik 白板图解 Jev vs LLM 与混合架构
- Jev Trader 教程:在 Monad 上搭建亚秒级 AI 交易机器人
- Jev Model Router 实战:用 Jev 搭建带隐私门控的本地模型路由器
- Jev 入门教程:State、三类问题与 TypeScript SDK 实操
- 本地跑 Jev:Kev、SemIf 与 Von,自己的 GPU 就够了
- Jev RAG Reranker 实战:用可执行 criteria 打造策略化检索重排
- Jev 什么时候该用:工程视角核实宣传口径、守门与失败模式
- LangChain + Jev 集成实战:路由、护栏与评测
- Jev MCP Server 接入指南:把 Jev 决策层接进 Claude Code 与 Cursor
- Jev vs Luna 独立基准实测:「更快更准更便宜」是真是假?
- Jev Agent Harness 实战:决策闸门该装在 LLM 循环的哪个位置
- Jev Playground 实测攻略:热狗课程、criteria 校准与四平台 token 账单
- Jev 文本分类 API 实战:用 classifier.dev 打通零样本 CLI 与 REST 调用
- Jev API 实战示例:第一条 curl、载荷结构与三种问题类型
- 用 Expanso Edge 和 Jev 搭建日志分流流程
- Treg + Jev 线索丰富:ICP 分类与注册用户评分
- 在 Heym 中使用 Jev 决策节点:语言判断与模型路由
- Laya 上手教程:开源自托管决策引擎的安装、路由与概率校准(Laya vs Jev 实操)
- 训练自己的 Jev:花 $5–$17 微调一个 Jev 式决策模型(能训什么、不能训什么)
- Jev 实用技巧:拿到更好决策结果的 8 条最佳实践(state、questions、criteria 与阈值)
- Jev 上下文压缩实战:不用生成式摘要,直接剪枝 Agent 记忆
- Jev 当 LLM 评审:置信度级联,只要强模型 0.36% 的成本
- TypeSafe Computer Use 实操:用 Jev 做本地桌面自动化
- Jev 简历筛选实战:Express + Jev JavaScript SDK 搭一个 AI 简历评估器
- Jev + Claude Code 实战:语音控制浏览器,类型化决策全程接管
- Jev 接入 Codex 实操:typesafe-ai/skills 安装与 Gmail 30 封邮件分诊
- Jev vs Ollama:本地跑 AI 决策,数据不出门真的可行吗?
- 自己动手造一个 Jev:免费开源零样本分类器(还能打 Doom)
- CUA-S1-Forms:706K 参数的 Jev 型表单填写模型,CPU 就能跑
- 用 Jev 做 NOC/SOC 告警分诊:规则先行、一个类型化问题、一道策略闸门
- Ollama 决策模型实测:tev1 + nimble 跑在 8GB 显卡上
- Jev 生产环境护栏:五步接入实战手册
- Pi Agent 防跑偏插件实战:让 Jev 出概率,让代码做决定
- Tev1 用例实测:50 个任务看尽本地决策模型的能力边界
- Jev 实测:官方宣称与独立复测之间的距离
- Jev 工单分类实战:after-insert hook 与计算字段两种接法
- OpenJev RLCD 实操:开源校准决策模型本地部署全指南
- Clef-Flash vs Jev 实测:把 Cloudflare 决策模型装进 Ollama(Q4_K_M)
- Clef-Flash 实操教程:在 Ubuntu 上从零安装并本地运行 Cloudflare 9B 多模态决策模型
- CLM-8B 架构深潜:44 毫秒打分 1,024 个候选的对比决策模型(比 Jev 快 13 倍)
- Nox 4B 实测教程:本地跑通 Decision 2.0 决策模型,四道真实考题与一次诚实的失败
- Julia-1 实操教程:纯 Python 装上开源 Jev 替代品,10 条客服消息实测 9 比 2
- OpenJev 0.8B CPU 实战:用工单收件箱校准 NLI 路由阈值
- Jev n8n 集成实战:JevGate 社区节点分步攻略(附纯 HTTP 备选路线)
- NanoJev 实操教程:本地部署 0.6B 开源 Jev 复刻,亲眼看它以 47ms 跑迷宫、按概率做路由
- PPLX Decider 实操教程:Perplexity 开源 27B 决策模型、Decisions API 与 12 张工单的分诊实测
- AutoTrust JEV-27B 本地实测:四臂对照、72 道 held-out 题,和一个 0.969 高分的错误答案
- Clef 27B 本地实战:Cloudflare 多模态决策模型一次读懂图片、视频和乌兹别克语报纸
- Ollaya 实操指南:装好「决策模型界的 Ollama」,看清每一个厂商口径数字,再亲手补上它留白的 CPU 实测
- Strands Decider 2B 实测:8GB 笔记本本地安装 AWS Strands 系决策模型,把失败段也留在这页里
- Liquid AI Open d1 本地实测:d1-3B 与 d1-omni-600M 跑进 MacBook Air M5
- GLiNER2.5-Decide (340M) 对比 Jev (4B):决策模型到底谁赢?逐帧核对选型指南