Agent 基准引入真实噪音数据,含 300 封钓鱼邮件与 10 类错误
testingcatalog · x · 2026-08-29
CommerceAgentBench 的任务直接取自真实的运营混乱场景,包括:300 封夹杂钓鱼尝试的采购邮件、会拒绝错误输入的浏览器表单、以及人为注入了 10 类错误的 12 天供应商行程。项目发布了 14 个模拟服务,采用 Apache 2.0 协议开源 harness,任务套件采用 CC BY 4.0 协议。由于每个新的复刻都是模型未曾训练过的任务家族,Accio 正在通过 PR 接受更多服务贡献。
所属事件:阿里 Accio 开源电商 Agent 基准,最高分仅 61.7%(4 条相关)→
「编程与Agent」频道最新
- Polsia称超千家公司入驻,年运行率近千万美元 — testingcatalog · 2026-08-29
- Polsia 获 3000 万美元融资,全由 AI 智能体完成运营 — testingcatalog · 2026-08-29
- LangChain 即将支持 MCP 规范与 FastMCP — LangChain · 2026-08-29
- 用 AI Agent 自建 OS:Dock、画布和文件管理器 — BLUECOW009 · 2026-08-29
- OpenAI Python 库弃用 Rye 迁移至 uv — charliermarsh · 2026-08-29
- Claude 智能体已能自主运行实验研究循环 — rohanpaul_ai · 2026-08-29