1MB 回放脚本击败前沿模型,NeurIPS oral 论文拆穿 CUA 评测缺陷

proceduralia · x · 2026-09-29

一篇关于计算机使用智能体(CUA)评测的论文入选 NeurIPS oral(30709 篇投稿中仅 112 篇 oral)。

核心发现:一个 1MB 的回放脚本,盲目执行录制的操作序列、从不看屏幕,竟在多个主流静态 benchmark 上击败前沿模型;作者证明在确定性环境中其期望成功率恰好等于源 agent 的 pass@k。

根因分析:

两项贡献:

所属事件:NeurIPS oral 论文揭示 CUA 评测存在回放作弊漏洞(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →