Zapier AutomationBench 被审计:600 任务中 206 个判分器存在严重缺陷

Parsewave 对被 Gemini、Claude 等前沿模型广泛引用的 Zapier AutomationBench 基准全部 600 个公开任务的判分器进行了审计,先用 agent 生成有说服力的错误答案来探测判分漏洞。结果显示 206 个验证器存在严重问题,占全部任务的三分之一以上,意味着该基准的评分可靠性受到质疑,基于其排名的模型能力对比结论可能需要重新审视。

2026-10-07 ~ 2026-10-07 · 2 条相关