NeurIPS oral 论文揭示 CUA 评测存在回放作弊漏洞

一项关于计算机使用智能体(CUA)评测的研究入选 NeurIPS oral,在 30709 篇投稿中仅 112 篇获此殊荣,研究来自 Meta Superintelligence Lab 等机构。论文核心发现是:一个仅 1MB 的回放脚本,通过盲目回放操作即可在评测中击败前沿模型,揭示现有 CUA 评测基准存在可被回放作弊利用的缺陷。

2026-09-29 ~ 2026-09-29 · 2 条相关