编码 Agent 新基准:Claude Opus 5 仅过 23.9%,人类专家 82.2%
dair_ai · x · 2026-09-08
dair-ai 推荐了一篇编码 agent 基准论文:在模拟真实客户交付的任务中,Claude Opus 5 在 Claude Code 下仅通过 23.9% 的评测,人类专家参照为 82.2%。
任务设定:开发 agent 被投入一次真实客户交付,需要处理企业业务记录、持需求且可问答的客户、必须走的生产 API、遗留代码库,以及服务成本与模型选择的硬性限制,最终交付一个可用的客服 agent。评分方式是将构建的 agent 部署到留出的模拟用户上,共 4 个领域 53 个任务。
失败模式与工程实践高度吻合:浅层查询业务记录而非认真读取;几乎不与客户沟通需求;很少尝试调整 agent 架构。
「编程与Agent」频道最新
- Matt Shumer 公开 GPT-6 Astra 3D 构建完整工作流,相关内容已破 1500 万浏览 — mattshumer_ · 2026-09-08
- 一条 prompt 生成曼哈顿:GPT-6 Astra 造 3D 世界的五步 agent 循环全解 — mattshumer_ · 2026-09-08
- 医院多智能体系统被劝「让病人出院腾床位」,架构讨论数据该给 LLM 看多少 — ---starboy-- · 2026-09-08
- iPhone Markdown 笔记应用 Truffle 通过 MCP 与 ChatGPT 双向互通 — Truffle_Journal · 2026-09-08
- Karpathy 自称从未如此落后:编程职业正被 agent 重构 — IgorCarron · 2026-09-08
- Mediabunny 新版 50 毫秒截取 60 秒视频,剪裁近乎即时 — Vjeux · 2026-09-08