编码 Agent 新基准:Claude Opus 5 仅过 23.9%,人类专家 82.2%

dair_ai · x · 2026-09-08

dair-ai 推荐了一篇编码 agent 基准论文:在模拟真实客户交付的任务中,Claude Opus 5 在 Claude Code 下仅通过 23.9% 的评测,人类专家参照为 82.2%。

任务设定:开发 agent 被投入一次真实客户交付,需要处理企业业务记录、持需求且可问答的客户、必须走的生产 API、遗留代码库,以及服务成本与模型选择的硬性限制,最终交付一个可用的客服 agent。评分方式是将构建的 agent 部署到留出的模拟用户上,共 4 个领域 53 个任务。

失败模式与工程实践高度吻合:浅层查询业务记录而非认真读取;几乎不与客户沟通需求;很少尝试调整 agent 架构。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →