Parsewave 审计:AutomationBench 600 公开任务中 206 个验证器有严重问题

rohanpaul_ai · x · 2026-10-07

Parsewave 对广受关注的 agent 业务流 benchmark「AutomationBench」(登上 Gemini 4 Argon、Claude Opus 5.5、GPT-6 Astra、Claude Fable 5.1、GPT-6.1 Sol 等模型卡,由 Zapier 团队打造)进行了独立审计:仅能审计 600 个公开任务,先用 agent 辅助的对抗性提交(构造让 verifier 误判的现实提交)标记出 323 个可疑任务,再人工复核,剔除 117 个误报后确认 206 个存在严重问题,并已给出修复。作者公开了其中 100 项发现的详细推理供研究者自行判断;实验显示修复对开源前沿模型在该 benchmark 上的成绩有实际影响。结论:大规模真实业务流 benchmark 的自动验证器可靠性堪忧,榜单分数需谨慎解读。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →