Guides / 视频转图文攻略

图像决策模型实战 RPA:Imajev-4B 与 Jev-Omni 无 OCR 直读 W-8BEN 税表,90% 置信阈值以下转人工审核

把 Sam Witteveen 的 RPA 表单审查演示整理成分步图文:流程图「矩形是步骤、菱形是决策」的框架,UiPath 兴衰时间线,ImageJevBench 榜单逐帧放大抄录(Imajev-4B 76.39、Jev-Omni 73.10、NeoHorse Jev 4B 71.94),再到 Form Decision Inspector 双模型并跑审查一份未签名的 W-8BEN——unknown 概率、90% 自动采纳阈值、自信答错的真实分歧、改写成多选后双双答对、纯条件逻辑的追问邮件,以及「加一问=加一个文本框」的问题工程。

速览结论

本系列第一支非文本输入的页面:两个开源图像决策模型——Imajev-4B(mohit67890/imajev-4b)与 Jev-Omni(akhilaaa3/Jev-Omni)——在 Form Decision Inspector 应用里并跑审查扫描表单,整条管道没有 OCR。为什么值得看:RPA 自动化的是流程图里的矩形(复制、点击、归档),但旗舰 UiPath 从 2021 年约 300-400 亿美元的 IPO 估值(股价高位 70 美元档)跌到每股 13-14 美元、市值不足 65 亿美元,因为按任务调参的深度学习始终给不出能覆盖菱形——人工判断节点——的通用分类器。图像决策模型正瞄准这些菱形:把原始图像(截图、扫描件、照片)当 state 喂进去,问类型化问题(应用把是否题标为 noul、选择题标为 choice),每个允许选项都拿到概率——还带一个训练出来的 unknown 选项,模型要么笃定要么弃答。基准是 ImageJevBench v0.1.3:684 个计分项(228 公开 + 456 封存、93 项退役;333 个新封存项为合成图像已在卡面声明),综合榜 49 个系统。放大帧抄下的前五名:Imajev-4B 76.39、Jev-Omni 73.10、NeoHorse Jev 4B 71.94、Visual-Jev 4B Answer-SFT 69.81、JPT-4B 69.55——转写稿里讹成的「Neo Horse」实为 NeoHorse Jev 4B。Imajev-4B 的出身是本年度最精简的建模故事:一人、15 天、1,200 美元 GPU 租金,作者是一位退款/客服方向业务流程顾问,在 Reddit 发帖说歧义让每个决策节点都落到人头上。演示表单:未签名的 W-8BEN,打印名 Oliver Bennett、日期 03-25-2026、出生日期栏已填(11-16-1964)、签名行为空并被红框高亮。第 1 轮(r20261002-195810-e908):7 个问题、共 3.3 秒,Imajev-4B 单页 3,159 毫秒 vs Jev-Omni 1,072 毫秒;表单判定 Imajev 为 Return(failed: missing)、Jev-Omni 为 Human(below 90% or abstained: signed, missing)。签名题的核心分歧:Imajev-4B True 91.5%(unknown 1.0%)越过 90% 自动采纳阈值——但错了;Jev-Omni False 73.2% 低于阈值、被打 Human 旗——但对了。Auto 是置信徽章,不是正确徽章。dated 一栏双模型一致(True 98.1% / 98.6%)。把签名题改写成选择题「What is on the signature line?」(handwritten signature / blank / typed name only)后,双方都答 typed name only——74.2% 对 75.1%、agree 标记,Jev-Omni 的 P(handwritten signature) 被钉在 3.92%——双双低于下调到 89% 的阈值、双带 Human 旗,但答案都对:只有打印名,没有手写签名。追问邮件是纯条件逻辑——「Action needed: your tax form… could you please sign the form in the signature field」——挂在 Imajev 的 missing 行(page 1、signature、92.5%、Auto)上;无 LLM、无 OCR。问题工程:给 missing 加一个 date of birth 选项就是加一个文本框、无需重训。复跑(3.4 秒):Imajev-4B 不为所动——仍答 signature 94.5%(nothing missing 3.1%、date of birth 0.6%);Jev-Omni 崩了——nothing missing 45.3%、date of birth 以 30.7% 居次,且在 dob 一题上答 False 88.1%(Imajev 答 True 99.4%)。第二份有签名、缺 DOB 的表单里,双模型一致确认手写签名、一致抓出缺失的出生日期(置信度不同)——模型间一致才是真信号。方法论收束:先测哪些题型适配你的目的、再测哪个模型适配这些题型;按问题各自设置信阈值;低于阈值的转另一个模型确认或转人工审核。用例:RPA、快速图像分类、大规模图像处理。

视频来源

Sam Witteveen

16:22L8YxigQoLaM

分步图文攻略

  1. 1

    把任何流程画成流程图:矩形是步骤,菱形是决策

    任何业务流程画成流程图都会出现两种形状。矩形是步骤——复制这个、点那个、存档——菱形是决策:这样对吗?这是发票吗?这是付款吗?多年来 RPA 工具自动化的都是矩形:机器人流程自动化,软件机器人像人一样点屏幕、在系统之间搬数据,全按固定规则走。菱形却始终要人来拍板,因为规则没法「看一眼页面」判断上面有没有签名。深度学习有进展,但每家公司、每个场景都得自训模型——这正是视频后半场要用图像决策模型去填的坑。

    业务流程图动画:三个带斜纹的矩形被标注为步骤,中间隔着三个问号菱形——视频用它区分机器人能干的活和必须人来判断的活。
    一行图形讲完全部论点:矩形可以自动化,菱形一直是人。跳转至 0:08
  2. 2

    认识两个开源模型:Imajev-4B 与 Jev-Omni,没有 OCR 环节

    演示的架构一张图讲完:PDF 和 JPG 文档流进一个 inspector,再并行送给两个小型开源模型——Imajev-4B(Hugging Face:mohit67890/imajev-4b)和 Jev-Omni(akhilaaa3/Jev-Omni)——收回是否答案。两个模型都在图像 Jev 基准榜的前列,图下方那句手写注释才是架构头条:no OCR step。原始图像直接进模型,前面没有任何文字识别环节。顺带一个时间点:录制当时连 Jev 本体都还不能吃图像输入,所以图像决策这条轴完全属于这类开源模型。

    OpenJev 示意图:PDF 与 JPG 文档经过 inspector 方框分流给 Imajev-4B 和 Jev-Omni,终点是一个 yes no 菱形,下方手写标注 no OCR step。
    一个 inspector 带两个开源模型:原始图像进、是否出——OCR 这个环节压根不存在。跳转至 1:13
  3. 3

    UiPath 的警世故事:约 300-400 亿美元估值跌到不足 65 亿

    这件事在商业上为什么重要:RPA 长成了一个巨大的产业,UiPath 是旗舰——作者 2018 年第一次接触时觉得真了不起。到 2021 年,它成了上市公司,估值约 300-400 亿美元,股价高位在 70 美元档。卡面上那条橙色曲线随后一路弯向当下:每股 13-14 美元,市值不足 65 亿美元(横轴还标注了「not to scale」)。访谈过 UiPath 从业者之后得到的诊断是:产品不烂,而是那个年代的深度学习要按任务重度调参——没有一个通用分类器能在多类决策节点上同时保住高准确率。图像决策模型就是视频要拿来压力测试的候选解药。

    UiPath 时间线图:2021 年 IPO 点标注约 300-400 亿美元估值、股价高位 70 美元档,橙色曲线一路下弯到现在——每股 13-14 美元、市值不足 65 亿美元。
    一张图装下 RPA 的兴衰:IPO 时约 300-400 亿美元,如今不足 65 亿——菱形从来没被自动化。跳转至 3:24
  4. 4

    ImageJevBench v0.1.3:684 个计分项、49 个系统

    基准卡全文:ImageJevBench v0.1.3,「面向图像决策系统的 held-out 对比,从界面目标到日常场景」。冻结基准共 684 个计分项——228 个公开、456 个封存——另有 93 项退役不计分。卡面有一格方法论自曝:333 个新封存项是基准自制的合成图像与渲染图,对前沿 API 模型而言比老的真实来源项更容易。综合分覆盖 49 个系统,粉色条是托管 API;Cost 或 Calibration 任一轴触发 gate 的系统直接记 0 分。演示用的两个模型就是从这个榜上选的。

    ImageJevBench v0.1.3 卡片:684 个计分项分为 228 公开与 456 封存、93 项退役,警示框说明 333 个新封存项为合成图像,49 个系统的综合榜由 Imajev-4B 以 76.39 领跑。
    榜单自己的小字:684 个计分项、456 个封存、合成项警示自曝、49 个系统同台。跳转至 5:10
  5. 5

    把榜读明白:Imajev-4B 76.39——转写稿里的「Neo Horse」是 NeoHorse Jev 4B

    放大综合榜顶部,行行可读:第 1 名 Imajev-4B 76.39(金色条),第 2 名 Jev-Omni 73.10,第 3 名 NeoHorse Jev 4B 71.94,第 4 名 Visual-Jev 4B Answer-SFT 69.81,第 5 名 JPT-4B(kirp / llm2jev)69.55。自动转写讹成的「Neo Horse」就是 NeoHorse Jev 4B,71.94 分。冠军的出身是本页最值得转述的故事:Imajev-4B 由一个人在 15 天里训成,GPU 租金只花了 1,200 美元——而且这个人并非来自研究实验室,下一帧会把这一点拍得更直白。

    ImageJevBench 前五行放大截图:Imajev-4B 76.39、Jev-Omni 73.10、NeoHorse Jev 4B 71.94、Visual-Jev 4B Answer-SFT 69.81、JPT-4B 69.55。
    综合榜前五:Imajev-4B 76.39、Jev-Omni 73.10、NeoHorse Jev 4B 71.94——「Neo Horse」这个转写讹误,逐帧定谳。跳转至 5:24
  6. 6

    冠军为什么存在:一位流程顾问的 Reddit 帖

    卡片把 Imajev-4B 指向它的作者——一位流程顾问(process consultant)——以及他在 Reddit 上那篇不只讲「怎么做」、更讲「为什么做」的帖子。他的背景是退款、产品和客服流程,他的论点是:这类流程图里几乎每个决策节点最终都依赖人,因为歧义很难纯靠代码处理。这就是这个品类的需求侧:无数个流程图菱形,现在都由某个人盯着文档做判断。演示从榜上挑了前两名——Imajev-4B 和 Jev-Omni——让它们去啃最普通的那颗菱形:表单签了没有?

    Imajev-4B 标签指向一个标注 process consultant 的人形图标,再指向 Reddit 徽标,下方挂着 REFUNDS 标签。
    作者的路径:流程顾问、退款与客服流程,然后是一篇讲「决策节点为何都落在人身上」的 Reddit 帖。跳转至 5:35
  7. 7

    与文本 Jev 同一套问题——state 换成了原始图像

    心智模型从文本决策模型原样平移,只换一处。文本 Jev 拿文本当 state、配类型化问题;图像 Jev 拿图像当(部分)state,问题形状不变——signed?yes | no;date filled?yes | no;doc type?form | invoice。前面没有 OCR 环节喂转写文本,模型自己判断图上是什么、直接从像素作答。值得注意的增量:图像 Jev 模型被训练过连 unknown 选项的概率一起输出,所以它要么笃定、要么承认不知道——把瞎猜从系统里赶出去。答案随后驱动与文本模型同一套「聪明 if」条件,外加一个升级:设一条置信阈值,低于阈值的结果转给另一个模型确认、或转人工审核。

    STATE 框内是 form_page.png,旁边 QUESTIONS 框列出 signed、date filled、doc type 的选项,共同指向 ImageJev 决策菱形,手写标注 same questions。
    图像当 state、问题形状照旧:是否题与选择题——外加一个模型被允许选的 unknown。跳转至 6:45
  8. 8

    表单本体:一份未签名、有打印名有日期的 W-8BEN

    演示把一份美国税表 PDF 拖进 Form Decision Inspector——「Inspect tax PDFs or JPGs. Run two image models, review disagreements.」扫描件是一张 W-8BEN(外国受益人身份声明):Bristol BS1 9XA(英国)地址、出生日期栏已填(11-16-1964)、Sign Here 区块里有打印名 Oliver Bennett 和日期 03-25-2026——打印名上方那行签名栏是空的,查看器用红框把它高亮出来。问题集覆盖表单团队关心的每颗菱形:签了吗、签名旁的日期填了吗、邮寄地址在吗、出生日期填了吗、缺哪个必填项、这是什么表、字迹清晰度如何。DPI 可调,两个模型同时跑。

    演示用的 W-8BEN 税表,Sign Here 区块被红框高亮:打印名 Oliver Bennett 和日期 03-25-2026 之上的签名栏空无一物。
    考卷本体:处处填好,唯独最要紧的签名栏空着。跳转至 8:28
  9. 9

    首轮:7 个问题 3.3 秒——自信的那个答案错了

    结果栏写着总计 3.3 秒、1 页、7 个问题;Imajev-4B 单页耗时 3,159 毫秒,Jev-Omni 只用 1,072 毫秒。签名题——「The form has a handwritten signature in the signature field」——Imajev-4B 答 True 91.5%(false 8.5%、unknown 1.0%),越过设在 90% 的自动采纳滑杆,拿到绿色 Auto 徽章;Jev-Omni 答 False 73.2%(true 26.8%),因低于阈值吃了黄色 Human 旗。表单没签名:被打旗的答案才是对的,被自动采纳的那个错了——Auto 的意思是自信,不是正确。表单判定同一步分裂:Imajev-4B 判 Return(failed: missing),Jev-Omni 判 Human(below 90% or abstained: signed, missing)。dated 一栏双模型一致——True 98.1% 对 98.6%——出生日期一栏又起分歧:一个说填了,一个说没填。

    Form Decision Inspector 的 signed 题结果:Imajev-4B 答 true 91.5% 挂 Auto 徽章,Jev-Omni 答 false 73.2% 挂 Human 旗,上方是设在 90% 的自动采纳滑杆。
    诚实之帧:True 91.5% Auto 是错的,False 73.2% Human 才是对的——置信与正确是两根轴。跳转至 9:30
  10. 10

    改写这颗菱形:判断题变选择题,双模型立刻一致

    解法是问题工程,不是换模型。把 signed 改成选择题——「What is on the signature line?」,选项 handwritten signature、blank、typed name only——再跑一遍。两个模型现在都答 typed name only:Imajev-4B 74.2%(blank 24.7%、handwritten signature 1.1%、unknown 0.2%),Jev-Omni 75.1%、其手写签名概率被钉在 3.92%(查看器 tooltip 实拍)——两张卡中间是 agree 标记。两个答案都低于自动采纳阈值(此时已调到 89%),所以都带着 Human 旗,但答案都对上了事实:只有打印名,没有手写签名。作者的规则可以推广:在这类任务上,这个模型做分类题比做判断题稳——先测哪些题型适配你的目的,再测哪个模型适配这些题型。

    改写为「签名栏上是什么」之后,两个模型都答 typed name only——Imajev-4B 74.2%、Jev-Omni 75.1%,两卡之间是 agree 标记。
    同一颗菱形、更好的题型:typed name only 74.2% ≡ 75.1%——一次改写把分歧变成一致。跳转至 11:20
  11. 11

    追问邮件:纯条件逻辑——无 LLM、无 OCR

    Follow-up email 面板零生成地拼出催办邮件:主题「Action needed: your tax form」,Imajev-4B’s answers 与 Jev-Omni’s answers 两个切换页签,Copy 和 Open in mail app 按钮,正文模板——「Thanks for sending your tax form. Before we can process it, could you please: • Sign the form in the signature field. You can reply to this email with the corrected form attached.」没有一个字出自 LLM;它就是挂在模型答案上的条件逻辑,下方还附上推理依据(missing、page 1、signature、92.5%、Auto)。作者再次强调:整个闭环里没有任何光学字符识别——图像按图像传输、按图像处理,邮件只是把决策格式化而已。

    Follow-up email 面板起草「Action needed: your tax form」,请寄件人在签名栏签名,依据是 missing 一行 92.5% Auto。
    让寄件人去修:一条答案触发一封模板邮件——工作流里不耗 LLM 的那一半。跳转至 12:10
  12. 12

    加一问=加一个文本框——然后每个模型都要重测

    给 missing 问题加一个新选项就是在选项列表里加一项:date、address、nothing missing——再加一个 date of birth。全程无需重训。复跑(总计 3.4 秒)里 Imajev-4B 毫不含糊:缺哪项依旧答 signature 94.5%(nothing missing 3.1%、date of birth 0.6%)。Jev-Omni 崩了:nothing missing 45.3%、date of birth 以 30.7% 居次——嘴上说「什么都不缺……也许是出生日期缺了」——而且 dob 一题上它答 False 88.1%,Imajev-4B 答 True 99.4%。第二份表单这次有签名、缺出生日期:双模型一致确认手写签名,又各自以不同置信度抓出缺失的 DOB。这才是双模型并跑的真课:一致是信号,分歧是路由条件,每加一问都要把适配性重测一遍。按问题各自设置信阈值、加多选题、加打分题——全都是多加一个文本框的事,按用例定制即可:RPA、快速图像分类、大规模图像处理。

    missing 问题加入 date of birth 选项后,Imajev-4B 仍答 signature 94.5%,Jev-Omni 漂成 nothing missing 45.3%、date of birth 以 30.7% 居次。
    一个新选项、零重训:Imajev 稳在 signature 94.5%,Jev-Omni 漂成「什么都不缺」45.3%——每改一次都要重测。跳转至 13:03

常见问题(FAQ)

RPA 还值得学吗?

值得——但要认清这份工作里哪一半能自动化。视频里那张 UiPath 曲线是真的:2021 年 IPO 估值约 300-400 亿美元、股价高位 70 美元档,如今每股 13-14 美元、市值不足 65 亿美元。崩掉的不是自动化本身,而是「按任务调参的深度学习给决策节点做通用分类器」这条路——流程图里的矩形(复制、点击、归档)十年前就是机器人的地盘;菱形才是没被攻下的那一半。带置信阈值和人工审核路由的图像决策模型,是第一批正对菱形去的像样武器。

什么是图像决策模型?

state 是原始图像——截图、扫描件或照片——而非文本的 Jev 系决策模型。把图像和一组类型化问题(应用把是否题标为 noul、选择题标为 choice)一起交给它,它一次前向为每个问题的每个允许选项返回概率。模型前面不跑 OCR:直接读像素。这类模型还被训练过连 unknown 选项的概率一起输出,遇到含混表单可以弃答而不是硬猜——答案接进与文本决策模型相同的条件逻辑,由置信阈值决定什么转人工审核。

为什么要双模型并跑?

因为它们错的方式不同,而一致是你能免费拿到的唯一信号。演示首轮里,Imajev-4B 说未签名的 W-8BEN 签了——True 91.5%,越过 90% 自动采纳线,但错了;Jev-Omni 说 False 73.2%,低于阈值、被打人工审核旗,但对了。给 missing 加新选项后的复跑里,Imajev-4B 稳在 signature 94.5%,Jev-Omni 漂成 nothing missing 45.3%。把签名题改写成多选后,双方都答 typed name only(74.2% 和 75.1%)。结论不是谁更好,而是各自擅长不同题型——并跑把「分歧」从静默失败变成一条路由规则。

unknown 选项到底值在哪?

它把「无声瞎猜」变成「显式弃答」。这些模型在每个真实选项之外还输出 unknown 的概率——Imajev-4B 签名题上 1.0%、改写后的多选题上 0.2%——于是「我判断不了」成为可度量的结果,而不是需要你反推的低置信猜测。配合置信阈值(首轮 90%、后续复跑 89%,可按问题各自设定),一切不确定或低于阈值的结果转另一个模型确认、或转人工审核。表单审查工作流要的正是这个行为:有把握的自动化,没把握的升级。

Imajev-4B 和 Jev-Omni 是什么?

Hugging Face 上的两个社区开源权重图像决策模型——mohit67890/imajev-4b 与 akhilaaa3/Jev-Omni——分别占据 ImageJevBench v0.1.3 综合榜的第一和第二(76.39 与 73.10,49 个系统中领先第三名 NeoHorse Jev 4B 的 71.94)。Imajev-4B 的出身最出名:一人、15 天、1,200 美元 GPU 租金训成,作者是一位业务流程顾问,在 Reddit 发帖说歧义让他客户工作流里的每个决策节点都落在人头上。两个模型都接受无 OCR 的原始图像输入。录制当时 Jev 本体尚不能吃图像输入——这正是图像轴属于这类开源模型的原因。

这和文本表单填写有什么区别?

state 不同,分工就不重叠。文本表单填写(见本站 Jev 表单填写指南)处理的是你已持有的结构化文本:state 是字符串、问题走 API、模型从不见像素。本页的工作流从「根本没有文本层」的地方起步——扫描 PDF、手机照片、界面截图——模型直读原始图像,所以「有没有手写签名」「缺哪个必填项」这类问题不需要 OCR 环节就能回答。实践中两者是组合关系:文本决策模型驱动结构化的填写与路由,图像决策模型核验页面上真正落了什么——两边最终接的是同一套条件化追办逻辑。

相关推荐

更多视频攻略