Cua 开源 Jev 范式复现:70.6 万参数小模型填表单胜 Jev API
aigclink · x · 2026-09-21
OpenAI 前研究员 Diogo Almeida(做过 ChatGPT 指令遵循研究)发布 Jev,提出「System One 模型」新范式:大模型聊天早已超过人类,但自动化迟迟未到,因为模型输出的是人类可读的「文字」,程序使用前还得解析校验、防跑偏。System One 模型反过来——放弃生成文字,只做决策:状态输入,带概率的结构化选择输出,全部并行计算而非逐 token 生成。一句话:AI 版的 if 语句。
一天后,做 computer use 的 Cua 团队按此思路开源了场景化复现 cua-s1-forms(专填表单):
- 70.6 万参数、2.8MB、2 层 Transformer、字节级编码
- 23 万条合成数据,故意掺入「长得像」的干扰项(电话 vs 紧急联系人电话、邮箱 vs 街道地址)
- 同类任务对比 Jev 官方 API:99.7% vs 83.6%(Jev 是零微调直接上,对比意在说明给具体场景专训一个小模型更好)
作者判断:未来每个重复性电脑任务最终都会拥有自己的小型专家;过去靠写死规则、录坐标的 RPA 工作(表单、CRM 更新、数据录入、浏览器操作、文档路由、UI 决策)都可以用这套范式重写——大模型负责动脑,System One 负责动手。
所属事件:前 OpenAI 研究员开源 70.6 万参数填表单模型 cua-s1(2 条相关)→
「模型」频道最新
- $200 套餐 48 小时烧掉 33%,用户吐槽 OpenAI 额度大缩水 — AIandDesign · 2026-09-21
- DeepSeek 网页版文风被指遭安全对齐「脑叶切除」 — Old_Let6328 · 2026-09-21
- JEV 取消 waitlist 开放:5 美元额度、输入仅 0.042 美元且输出免费 — op7418 · 2026-09-21
- Stefano Ermon 做客 No Priors:扩散 LLM 并行生成是对 scaling 时代的回应 — saranormous · 2026-09-21
- 实测决策模型 Jev:两条 prompt 工程经验与本地 27B 对比 — colinmcnamara · 2026-09-21
- 决策模型 Jev 校准误差约 0.09:对得准但「自信度」仍失真 — colinmcnamara · 2026-09-21