你花大价钱调用的AI,可能连一个复选框都点不对。
AI Agent操控浏览器、自动填表的赛道,最近炸出来一条完全反常识的技术路线。Cua团队拿出一个仅仅2.8MB、70万参数的专精小模型CUA‑S1‑FORMS,在表单自动填写任务上直接把几十亿参数的大语言模型按在地上摩擦。99.7%的决策准确率,本地CPU推理延迟低至7毫秒,对比托管版Jev的280毫秒,速度直接拉开将近四十倍差距。
这件事最震撼的地方,根本不是“小模型赢了大模型”,而是它撕开了当下绝大多数电脑使用智能体的底层通病:让擅长写作文、擅长开放式推理的通用大模型,去做每一次点击、每一次勾选这种高频、简单的选择动作,本质就是用诺贝尔文学奖得主来填快递单,大模型一直在思考人生隐喻,而用户只想要一个快速、准确的勾选动作。
大模型填表单的大型翻车现场
想象一下,你雇来了一个精通法律、能写长文的大模型Agent帮你填表。网页上明明已经填好了手机号,它非要重新覆盖一遍;眼前明晃晃的复选框需要勾选,它犹豫半天直接跳过。Cua团队实测托管版Jev在表单决策任务准确率仅有83.6%,换算下来,每填6个字段,就大概率会错一次。
这就是现在Claude Computer Use这类端到端电脑操控方案的真实痛点。Agent每一次点击鼠标、输入文字,都要把整张屏幕截图打包发给云端大模型。大模型识别画面之后,生成一段工具调用代码,输出点击坐标,整套网络往返至少260毫秒。人眼能够清晰感受到明显卡顿。
更致命的是幻觉风险。通用大模型在输出操作指令的时候,很容易凭空捏造不存在的按钮坐标、无效函数。它说要点击关闭按钮,坐标稍微偏移几十个像素,一不小心就点到删除账户,这种风险在自动化业务流程里完全不可接受。
大模型的强项是开放式理解、复杂规划、处理未知弹窗,但是面对填表这种重复、标准化的高频操作,高算力、高延迟、高幻觉的短板暴露无遗。
卡尼曼的快思考,被直接写进AI代码里
这套新范式的理论源头,来自丹尼尔·卡尼曼经典著作《思考,快与慢》。人的大脑分成两套思考系统。系统一,毫秒级直觉反应,不需要深度思考,看见障碍物立刻躲闪。系统二,慢速审慎推理,用来做复杂运算、深度逻辑推演。
TypeSafe把这套思想搬进AI领域,推出Jev,全球第一款System One系统一决策模型。它从根源上放弃了ChatGPT最核心的能力:开放式文本生成。Jev不会写文章、不会写代码,它只做三件事。
Choice,从预先给出的候选选项里面选出最合适一项。
Score,按照既定标准给目标打分。
Noul,针对是非问题输出概率判断。
输入给到Jev之前,程序就已经把全部合法选项全部列好。模型只能在菜单里面挑选,没有自创动作的空间。幻觉直接被从源头掐断,它根本没有机会编造不存在的按钮坐标。
Cua团队没有止步于直接调用通用的Jev,他们继续向下深挖,专门针对表单填写场景,训练出更极致的专精模型CUA‑S1‑FORMS。
2.8MB极小模型的暴力美学
CUA‑S1‑FORMS参数量只有706048,权重文件压缩完仅仅2.8MB。一张随手拍摄的手机照片,体积都比这个模型大。放在多年前,这种体量的模型连手写数字识别都很难做好,现在却专门用来搞定网页表单填写。
它的工作流程简单粗暴,没有花里胡哨的多模态图像理解。应用层提前做完全部脏活:扫描网页,提取页面上全部输入框、下拉菜单、复选框等交互控件的结构化信息,再把从PDF、文档抽取出来的待填入数据打包成JSON,一并喂给模型。
模型的输出空间极度收敛,只返回四种动作:填入指定数值、勾选、点击、跳过。
整套前向传播跑在本地CPU上面,只需要7到9毫秒,完全不需要云端来回传输截图,省去了网络往返巨大开销。
Cua放出的实测对比数据冲击力很强:CUA‑S1‑FORMS表单决策准确率99.7%,托管版Jev仅83.6%。当然这个对比算不上完全公平,CUA‑S1‑FORMS是专门针对表单场景微调,学会了“已经填充完毕的字段直接跳过”这类专属规则,托管版Jev没有做表单专项优化。即便如此,70万参数小模型在单一任务上碾压大模型的事实,依然推翻了很多人的固有认知:不是越巨大的模型,做所有任务都越强。
核心架构变革:让AI点菜,而不是让AI做菜
传统Claude Computer Use一类架构,是大模型全包式做菜。从读懂用户指令、识别屏幕全部元素、规划操作路径、生成点击坐标,全部交给通用大模型一手包办。优势是足够灵活,遇到从未见过的弹窗、报错页面,大模型临场发挥可以处理。代价就是贵、慢、随时有幻觉误操作风险。
Cua提出的菜单式决策架构,直接把做菜和点菜拆开。
做菜这件事由应用程序全权完成。程序扫描浏览器页面,识别全部可交互控件,分配唯一ID,生成一份完整合法操作菜单。所有操作全部提前校验,危险操作根本不会放进菜单。
CUA‑S1‑FORMS或者Jev,仅仅负责点菜。读取菜单,返回选中控件ID。驱动层拿到ID,翻译成点击、填入等动作交给Cua Driver执行,执行之后再重新读取页面状态验证操作是否生效。
模型全程不碰像素坐标,不会生成任何代码,不能创造菜单以外的动作。这带来一个巨大安全红利。就算模型决策出错,它最多只是选错菜单里的合法操作,破坏性选项根本不在候选列表,误删、高危操作直接被隔离在外。
视觉感知层:截图转文字菜单的魔术,也是最大坑点
很多人会产生疑问,既然CUA‑S1‑FORMS是纯文本模型,看不懂图片,网页截图怎么变成结构化菜单?
整套流水线拆成两层独立模块:感知层 + 决策层。感知层负责看懂屏幕画面,Cua团队在方案里重点提及微软OmniParser。它接收网页截图,识别页面控件,输出边界框、文字、图标语义,标注控件是否支持交互,把像素画面翻译成结构化文字清单,交付给决策模型。
两层解耦的好处非常突出,两边可以独立升级互不干扰。微软更新更强的屏幕解析模型,直接替换感知层,填表决策模型一行代码不用改动;表单模型迭代出新版本,感知层也完全不需要改动。对比端到端大模型黑箱架构,工程迭代灵活度高出一大截。
但Cua团队也坦诚说出这套方案的短板。感知层本身就是新的故障来源。如果OmniParser识别漏了控件、把下拉菜单标签识别错误,给到决策模型的菜单本身就是错的,哪怕CUA‑S1‑FORMS打分准确率99.7%,最后的操作依然会失败。感知层的推理耗时,也会叠加到整套自动化链路延迟之中。这条路前景广阔,但远远算不上完美。
大小模型接力跑:系统一和系统二交接班的临界点
Cua构想的终极AI Agent流水线,是大小模型接力的混合架构。
通用大语言模型充当系统二。负责理解模糊的人类指令、导航网页、从PDF文档抽取待填写信息,处理突如其来的验证码弹窗、异常报错。
一旦页面跳转至目标表单、全部待填数据准备就绪,控制权立刻移交到CUA‑S1‑FORMS这类系统一专精模型手中,以7毫秒的极速批量完成表单字段填写。
一旦填表途中碰到专精模型无法识别的异常场景,控制权再次上交回通用大模型处置。
这个设想非常美好,但是有一个绕不开的硬难题:系统一模型什么时候力不从心,该什么时候主动交还控制权给大模型,很难精准判断。99.7%准确率,大约三百多次字段操作就会出现一次失误。而这一次失误,刚好有可能落在银行转账金额、医疗表单这类最关键字段上。单纯高准确率数字,无法实时告诉系统:当前这一步,模型已经超出能力边界。
Cua已经将CUA‑S1‑FORMS权重、代码、合成数据集全部采用MIT协议开源上传GitHub与Hugging Face,开发者可以直接部署本地运行。目前还留有一个巨大悬念没有答案:这套70万参数填表模型,面对动态渲染React组件、非标准HTML表单的时候,还能不能稳住99.7%的高准确率,这个答案要等待Cua下一轮实验放出。
对AI Agent行业的深层启示
很长一段时间,行业默认的思路就是:把更大更强的多模态大模型塞进电脑智能体,依靠大模型的通用能力搞定全部屏幕操作。Cua与Jev带来的System One系统一模型路线,给出完全不同的答案。
AI操控电脑这件事,不需要每一次鼠标点击都动用几十亿参数大模型。把高频、标准化、选项固定的决策剥离出来,交给极小、本地、低延迟的专精决策模型,大模型只保留复杂规划、异常处理这类高阶任务。一快一慢分工协作,成本、延迟、幻觉风险同时得到大幅优化。
菜单式决策,很可能是下一代浏览器自动化、电脑Agent落地最关键的范式转变。大模型不用再干所有脏活累活,只负责掌控全局,大量简单重复操作交给轻量化系统一小模型快速完成。
当然这不是全盘否定通用大模型。它更像是分工重构:大模型负责动脑规划,小模型负责毫秒级精准点击。当我们不再执着于一个万能大模型包办全部电脑操作,AI自动化落地的成本与稳定性,才会真正迎来质变。