大模型真实工作能力评测不及格,电商Agent全军覆没

最新评测显示,大模型在真实工作场景中的表现远不如代码任务。阿里国际站AccioWork团队推出RealReplicaBench基准,在107个真实商业任务上测试电商Agent,结果所有参评模型均未及格,最高分仅56.1,通过率惨淡。这一结果揭示当前大模型虽在代码等基准上表现亮眼,但距离胜任真实业务工作仍有明显差距。

2026-08-17 ~ 2026-08-17 · 2 条相关