Zapier AutomationBench 600 任务遭审计:206 个判分器有 bug

rohanpaul_ai · x · 2026-10-07

Parsewave 对前沿实验室模型卡引用的 Zapier AutomationBench 全部 600 个公开任务做了判分器(verifier)审计:先用 agent 生成有说服力的错误答案,再由人工确认哪些判分器失效。

结论:agent benchmark 不仅需要审计任务本身,更需要审计判分器。

所属事件:Zapier AutomationBench 被审计:600 任务中 206 个判分器存在严重缺陷(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →