RealReplicaBench:电商Agent评测全军覆没,最高分仅56.1
APPSO · wechat · 2026-08-17
APPSO报道了阿里AccioWork团队推出的RealReplicaBench,一个针对电商场景的AI Agent评测基准。在107个真实商业任务中,所有参评模型均未及格,最高分Claude Opus 5仅56.1分。该基准强调任务完成度,要求结果可被下一环节直接使用,通过复刻真实环境并验证最终状态来评分。团队计划持续更新任务,用于模型评测与优化。
所属事件:大模型真实工作能力评测不及格,电商Agent全军覆没(2 条相关)→
「研究」频道最新
- Latent On-Policy Self-Distillation 提升智能体性能 — NationalUniversityofSingapore · 2026-08-17
- 实测发现插入不可见字符可移除 Claude 水印 — Available-Deer1723 · 2026-08-17
- 迈阿密大学推AI工具,可从零发明全套人造语言 — begusgasper · 2026-08-17
- 研究:细微架构选择严重阻碍模型长上下文能力 — rohanpaul_ai · 2026-08-17
- 苹果新基准揭露大模型数学能力假象:仅靠模式匹配 — anirbanbandyo · 2026-08-17
- 无创血压监测新突破:FMCW雷达结合动量自适应校准实现高精度测量 — maier_ak · 2026-08-17