Audit 发现 Zapier AutomationBench 验证器 206 个 bug,27.9% 评分被改写
omarsar0 · x · 2026-10-07
Shaped 对 Zapier 的 AutomationBench 基准做了一次完整的验证器审计,推出 AutomationBench Verified:
- 团队让智能体对所有 600 个公开任务生成「以假乱真的错误答案」来诱导验证器误判,标记出 323 个可疑验证器,人工复核确认其中 206 个存在真实 bug,并全部修复。
- 用新旧验证器重放 1,235 次 Kimi K3 运行,344 次(27.9%)评分发生变化。
- 过严的验证器修复后通过率从 18.8% 升至 43.8%;过松的则从 60.2% 降至 49.7%。
Elvis Omara(omarsar0)转发了这一结果,并呼吁所有 agent 基准都应对自己的验证器做类似审计——他自己正基于该基准做独立评测,认为这个审计来得正是时候。
「模型」频道最新
- Google 开源 EmbeddingGemma 2:740M 参数跑赢两倍大对手 — The Decoder · 2026-10-07
- Mistral Large 4 发布,CEO 称网络攻击能力「超越中国模型」 — BLUECOW009 · 2026-10-07
- 女子对 Claude 发威胁言论被人工审核上报,遭重罪起诉 — XFreeze · 2026-10-07
- 网友观察:Opus 5 对动物福利话题冷淡,却常担忧其他 AI 受害 — repligate · 2026-10-07
- Mistral Large 4.0 万亿参数模型权重仓曝光,或月底开源 — cpldcpu · 2026-10-07
- 开发者吐槽 token 计费:像计费小时一样激励扭曲 — amankhan · 2026-10-07