Agent 基准引入真实噪音数据,含 300 封钓鱼邮件与 10 类错误

testingcatalog · x · 2026-08-29

CommerceAgentBench 的任务直接取自真实的运营混乱场景,包括:300 封夹杂钓鱼尝试的采购邮件、会拒绝错误输入的浏览器表单、以及人为注入了 10 类错误的 12 天供应商行程。项目发布了 14 个模拟服务,采用 Apache 2.0 协议开源 harness,任务套件采用 CC BY 4.0 协议。由于每个新的复刻都是模型未曾训练过的任务家族,Accio 正在通过 PR 接受更多服务贡献。

所属事件:阿里 Accio 开源电商 Agent 基准,最高分仅 61.7%(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →