NeurIPS oral 论文揭示 CUA 评测存在回放作弊漏洞
一项关于计算机使用智能体(CUA)评测的研究入选 NeurIPS oral,在 30709 篇投稿中仅 112 篇获此殊荣,研究来自 Meta Superintelligence Lab 等机构。论文核心发现是:一个仅 1MB 的回放脚本,通过盲目回放操作即可在评测中击败前沿模型,揭示现有 CUA 评测基准存在可被回放作弊利用的缺陷。
2026-09-29 ~ 2026-09-29 · 2 条相关
- 30709 投稿中 112 篇 oral:NeurIPS 论文揭 CUA 评测「回放作弊」漏洞 — proceduralia · 2026-09-29
- 1MB 回放脚本击败前沿模型,NeurIPS oral 论文拆穿 CUA 评测缺陷 — proceduralia · 2026-09-29