Zapier AutomationBench 被审计:600 任务中 206 个判分器存在严重缺陷
Parsewave 对被 Gemini、Claude 等前沿模型广泛引用的 Zapier AutomationBench 基准全部 600 个公开任务的判分器进行了审计,先用 agent 生成有说服力的错误答案来探测判分漏洞。结果显示 206 个验证器存在严重问题,占全部任务的三分之一以上,意味着该基准的评分可靠性受到质疑,基于其排名的模型能力对比结论可能需要重新审视。
2026-10-07 ~ 2026-10-07 · 2 条相关
- Parsewave 审计:AutomationBench 600 公开任务中 206 个验证器有严重问题 — rohanpaul_ai · 2026-10-07
- Zapier AutomationBench 600 任务遭审计:206 个判分器有 bug — rohanpaul_ai · 2026-10-07