Parsewave 审计:AutomationBench 600 公开任务中 206 个验证器有严重问题
rohanpaul_ai · x · 2026-10-07
Parsewave 对广受关注的 agent 业务流 benchmark「AutomationBench」(登上 Gemini 4 Argon、Claude Opus 5.5、GPT-6 Astra、Claude Fable 5.1、GPT-6.1 Sol 等模型卡,由 Zapier 团队打造)进行了独立审计:仅能审计 600 个公开任务,先用 agent 辅助的对抗性提交(构造让 verifier 误判的现实提交)标记出 323 个可疑任务,再人工复核,剔除 117 个误报后确认 206 个存在严重问题,并已给出修复。作者公开了其中 100 项发现的详细推理供研究者自行判断;实验显示修复对开源前沿模型在该 benchmark 上的成绩有实际影响。结论:大规模真实业务流 benchmark 的自动验证器可靠性堪忧,榜单分数需谨慎解读。
「研究」频道最新
- 模型如何学出隐私信号:推理压力是更强的信息不对称 — kalomaze · 2026-10-07
- 数学家人手不足应对 AI 证明浪潮,人机半人马协作或成解法 — bradneuberg · 2026-10-07
- Judea Pearl 点赞《Crush Coarse》论文,称其值得读 — yudapearl · 2026-10-07
- Hermes Index 由四套基准构成,含全新自研 Hermes Bench — NousResearch · 2026-10-07
- ProofAtlas 发布 LLM 评估的 500 大数学开放问题排名 — RexDouglass · 2026-10-07
- COLM 2026 杰出论文奖揭晓,CMU 团队获奖致谢 — dan_fried · 2026-10-07