不看你说了什么:新基准按环境操作痕迹给 Agent 判分
alifcoder · x · 2026-08-26
CommerceAgentBench 的评分方式颇为独特:它不依据模型自述做了什么来打分,而是检查 agent 在环境中留下的真实操作痕迹——标签是否正确应用、草稿是否真正保存、日历事件是否创建,以及商品上架、订单、运单号和跨系统数据是否一致。此外基准还内置安全层,在正常采购邮件中混入 BEC(商业邮件欺诈)付款 redirection 风险,agent 需识别可疑付款变更且不把所有相似邮件都当欺诈,随后还要完成选供应商、打标签、存草稿、建日历等动作。
所属事件:电商Agent基准按真实操作痕迹评分,落地成本比价成难题(2 条相关)→
「安全」频道最新
- 伦敦 Robotaxi 推出受阻,监管指南尚未发布 — nordicinst · 2026-08-26
- 澳大利亚总理让步:AI 数据中心不再强制全用绿电供电 — nordicinst · 2026-08-26
- AI 协助论文是否算学术不端?学界激辩 — RichmanRonald · 2026-08-26
- 反驳「AGI 无所不能」:密码学签名或仍难以被攻破 — sjgadler · 2026-08-26
- OpenAI 报告:识别并阻断俄罗斯隐秘影响力行动 — sam_lowry_ · 2026-08-26
- AI 独立执行勒索攻击,JadePuffer 揭示智能体攻防战 — CurieuxExplorer · 2026-08-26