30709 投稿中 112 篇 oral:NeurIPS 论文揭 CUA 评测「回放作弊」漏洞
proceduralia · x · 2026-09-29
一项关于计算机使用智能体(CUA)评测的研究入选 NeurIPS oral(30709 篇投稿中仅 112 篇 oral),由 Meta Superintelligence Labs 团队完成,横跨实验、理论、统计框架与工程设计多个层面:
- 反直觉实验:在常见 CUA 基准上,一个只「回放」前沿模型成功轨迹的 replay agent 就能达到 SOTA 成绩,暴露评测协议漏洞;
- 理论证明:数学上证明该 replay agent 正是社区常用的 pass@k 指标的「agent 化」,指出该指标的缺陷;
- PRISM 原则:提出一套设计 agent 基准的通用原则,避免回放攻击等常见问题;
- Digiworld 基准:将原则落地为大规模移动端使用基准,自动生成并校验数百万个任务变体来防御回放攻击;
- 统计框架:借鉴强化学习评测方法,利用基准结构精确估计 agent 表现;
- 模型评测:用新环境测得现有前沿模型 CUA 相当脆弱,对 UI 颜色等人类无感的微小变化就大幅掉分。
结论:当前主流 agent 基准成绩可能被记忆式作弊虚高,真实泛化能力远弱于榜单表现。
所属事件:NeurIPS oral 论文揭示 CUA 评测存在回放作弊漏洞(2 条相关)→
「模型」频道最新
- ElevenLabs v4 语音模型上线 Runway,Narration 表现力再升级 — runwayml · 2026-09-29
- 曝 Anthropic 发布 Sonnet 5.5:逼近 Opus 5.5 性能,价格仅一半 — oran_ge · 2026-09-29
- 小米 MiMo-V2.6 蒸馏版 9B 开源量化模型登上 Hugging Face 热榜 — bartowski · 2026-09-29
- 曝 OpenAI 因安全争议取消 GPT-6.1 Astra 十月发布计划 — Polymarket · 2026-09-29
- 实测 5 个 Qwen3.6-35B 微调版:几乎全被原版基座碾压 — returnity · 2026-09-29
- GPT-6 Sol 跑分出炉:ARC-AGI-2 得 89.6%,ARC-AGI-3 仅 23% — fchollet · 2026-09-29