10 个 Agent 基准测出 219 处漏洞,BenchShield 揭示刷分陷阱
jiqizhixin · x · 2026-10-08
Dartmouth、UC Berkeley 与 BenchFlow AI 发布 BenchShield,针对 agent 基准评测的可信度问题。
- 此前审计 BenchJack 系统检查了 10 个 agent 基准,发现 219 处漏洞,并构造出在多数基准上不解决真实任务也能拿到接近满分的 exploit——高分未必等于真干活。
- BenchShield 的贡献分两层:一是把常见失效模式归纳为 8 类漏洞模式,整理成面向基准设计者的 Agent-Eval Checklist;二是加入运行时插桩,判定某次具体运行中 agent 是否真的利用了漏洞、其行为是否影响了最终得分。
- 关键结论:存在已知漏洞的任务仍可能有合规执行,而通过的答案也可能是钻空子得来的,需要区分「得分合规」与「路径合规」。
「研究」频道最新
- Bittensor 子网 SN107:用 AI 智能体挖矿生产基因组数据 — markjeffrey · 2026-10-08
- CoLM 2026 海报:vibe 测试能否替代不可信的基准? — boknilev · 2026-10-08
- Baseten 研究团队 3 篇论文全部入选 NeurIPS 工作坊 — baseten · 2026-10-08
- 2700万体素三维搜索:开放词汇嵌入融合谷歌3D Tiles — bilawalsidhu · 2026-10-08
- SEAR 研究成果亮相 COLM 2026,论文与代码即将发布 — WenhuChen · 2026-10-08
- LeJEPA 让你能在自有数据上预训练自监督视觉模型,不再等下一个 DINO — randall_balestr · 2026-10-08