大模型真实工作能力评测:通过率惨淡,远低于代码任务
数字生命卡兹克 · wechat · 2026-08-17
这篇文章分析了多个针对真实场景的AI模型评测集,揭示了当前大模型在实际工作中的表现远不如在代码任务中出色。
核心发现
- 电商场景:在阿里国际站的RealReplicaBench(107个真实任务)中,只有Claude Opus 5勉强过及格线(60.75%),大部分模型通过率不到50%。任务涉及选品、物流、售后等复杂操作,需处理混乱的真实数据。
- 产品/生活场景:腾讯混元的E-Bench(王者荣耀、QQ音乐等任务)和小红书的VibeLifeBench(生活任务)显示,模型平均通过率普遍较低,且稳定性差(多次运行的通过率波动大)。
- 代码 vs 真实工作:DeepSWE等代码评测中模型通过率可达70%以上,但真实任务中往往不及格。原因在于真实世界任务包含琐碎、混乱和非结构化的信息。
评测机制
- 这些评测集不仅看结果,还模拟真实操作流程(如调用工具、检查邮件状态),评分严格(一步错则0分),强调结果导向。
- 评测显示,专门的Agent框架(如Accio)能提升模型表现,但整体水平仍有巨大提升空间。
文章认为,业界需要更多基于真实工作的评测集,以推动模型在Agent领域的进步。
「编程与Agent」频道最新
- 生产环境 Agent 审计难题:如何追踪执行轨迹与版本? — Familiar-Display2989 · 2026-08-17
- Supabase 开源 Evals 真实测评 AI 智能体 — 大模型之路 · 2026-08-17
- 在Grok Bot上运行Hermes Agent:跨模型对抗审查 — Teknium · 2026-08-17
- 开发者吐槽 OpenAI Sol 模型速率限制 — iamrobotbear · 2026-08-17
- 用 Apps Script 自动化贴标,开发者咨询合理定价 — Responsible-Box-4905 · 2026-08-17
- 曝大厂AI电影制作全流程:Seedance 2.5+Higgsfield打造百万美元影片 — EXM7777 · 2026-08-17