1MB 回放脚本击败前沿模型,NeurIPS oral 论文拆穿 CUA 评测缺陷
proceduralia · x · 2026-09-29
一篇关于计算机使用智能体(CUA)评测的论文入选 NeurIPS oral(30709 篇投稿中仅 112 篇 oral)。
核心发现:一个 1MB 的回放脚本,盲目执行录制的操作序列、从不看屏幕,竟在多个主流静态 benchmark 上击败前沿模型;作者证明在确定性环境中其期望成功率恰好等于源 agent 的 pass@k。
根因分析:
- 环境设计不科学:静态、无沙箱、验证不可靠
- 评测方法不科学:朴素聚合、对有状态 UI 交互误用 pass@k
两项贡献:
- 提出 PRISM 五条 CUA 环境设计原则(特权验证、真实环境、完整性校验配置、沙箱执行、多因素变化),并落地为 DigiWorld 基准:15 个真实沙箱移动应用、可生成超 320 万种已验证的唯一配置
- 提出 Wilson 分数区间 + 层次自助法的聚合框架,正确处理 CUA 基准的嵌套结构,给出可信置信区间
所属事件:NeurIPS oral 论文揭示 CUA 评测存在回放作弊漏洞(2 条相关)→
「研究」频道最新
- Anthropic 联手 Adaptyv 办蛋白质设计赛:首题挑战癌症靶点 EGFR — nc_frey · 2026-09-29
- 免训练专家合并方法 DUME 被 NeurIPS 2026 接收 — benfielding · 2026-09-29
- Feyer Labs 用神经搜索加物理模拟器探索人类想不到的硬件设计 — MarioKrenn6240 · 2026-09-29
- OpenAI 智能体对战人类生物竞赛幕后 drama 曝光 — Wonderful_Buffalo_32 · 2026-09-29
- Nature 调查:山寨科学院靠虚假头衔骗取顶尖学者,哥伦比亚教授中招 — yudapearl · 2026-09-29
- ParaSpeechCLAP 获 Interspeech 2026 最佳学生论文提名 — jessyjli · 2026-09-29