Zapier AutomationBench 600 任务遭审计:206 个判分器有 bug
rohanpaul_ai · x · 2026-10-07
Parsewave 对前沿实验室模型卡引用的 Zapier AutomationBench 全部 600 个公开任务做了判分器(verifier)审计:先用 agent 生成有说服力的错误答案,再由人工确认哪些判分器失效。
- agent 标记 323 个可疑判分器,人工确认 206 个真实 bug,全部修复,修复版发布为 AutomationBench Verified
- 在 1235 次 Kimi K3 运行上重放新旧判分器,344 次(27.9%)判定结果改变
- 判分器过严的地方,通过率从 18.8% 升至 43.8%;过宽的地方从 60.2% 降至 49.7%
- 典型案例(任务 813):判分器只查 Salesforce 笔记却不看 DocuSign 模板,一份用错误模板发出四份合同的提交竟通过全部 13 项检查得 1.0 分,修复后仅 0.09 分
结论:agent benchmark 不仅需要审计任务本身,更需要审计判分器。
所属事件:Zapier AutomationBench 被审计:600 任务中 206 个判分器存在严重缺陷(2 条相关)→
「编程与Agent」频道最新
- 开发者失望:Linear 在 Agent 时代只交出了个聊天框 — devenbhooshan · 2026-10-07
- 4 天写 70 万行代码?开发者称与 Opus 完成一年工作量 — haydendevs · 2026-10-07
- 实测新模型:Opus 5.5 性能追平 Fable 5.1 而成本仅三分之二 — PawelHuryn · 2026-10-07
- 自建 Bug Hunt 基准测试出不同结论 — PawelHuryn · 2026-10-07
- DAEDALUS:无任务无验证器,靠自生成练习为 Agent 积累记忆 — illuin · 2026-10-07
- 反向操作:让 Claude Code 操作 Figma 做内页设计反而更香 — yihui_indie · 2026-10-07