Claude Opus 5登顶ProgramBench,展现原创编码力但成本高昂
Claude Opus 5 (xhigh) 在 ProgramBench 基准测试中登顶第一名,展现了极强的从零重建完整程序的编码能力,但其高昂的使用成本也引发了关注。
已确认
- 要点 在要求从零重建 sqlite、ffmpeg 等完整程序的 ProgramBench 评测中,Claude Opus 5 (xhigh) 以解决 9 个任务(4.5%)的成绩成为第一名。
- 要点 该模型各项指标创历史新高,完全通过(100% 测试通过率)的数量从以往的 2 个翻倍至 4 个。
- 要点 开发者实测发现,Opus 5 完美重建了 9 个开源项目,经与真实上游仓库 diff 对比,证实其代码并非简单照搬,而是能提出新颖的解决方案。
- 要点 在无网络环境下测试 rnr 工具的 --to-ascii 功能时,Opus 5 展现出自主推理与探索能力,主动向工具发送查询以自行推导出字符映射表。
- 要点 该模型在编码任务中成本极高,单次复杂任务花费达 50.53 美元,期间经历 257 轮对话交互,输出超 35.7 万个 token,远超同系列以往模型。
- 要点 ProgramBench 基准测试由 Meta 超级智能实验室、斯坦福和哈佛联合推出,已放出完整排行榜、单任务成本及运行轨迹数据。
为什么重要
- 要点 这一测试结果证明了 AI 在复杂、原创性软件工程任务上的能力边界正在大幅拓宽,不仅能解决表层代码问题,还能进行底层逻辑的自主构建。
- 要点 尽管能力惊人,但单次任务超 50 美元的成本意味着这种极致的编码能力在现阶段商业化普及仍面临高昂的经济门槛。
2026-08-13 ~ 2026-08-13 · 6 条相关
一手来源
- Claude Opus 5 登顶 ProgramBench,大幅超越 GPT-5.6 — jyangballin ·
- 实测 Claude Opus 5:完美重建 9 个开源项目,代码极具原创性 — jyangballin ·
- ProgramBench评测:Claude 3 Opus单次任务成本高达 50 美元 — jyangballin ·
- 【源头】Claude Opus 5 登顶 ProgramBench,大幅超越 GPT-5.6 — jyangballin · 2026-08-13
- Claude Opus 5 登顶 ProgramBench,完全通过测试数翻倍 — jyangballin · 2026-08-13
- 【源头】实测 Claude Opus 5:完美重建 9 个开源项目,代码极具原创性 — jyangballin · 2026-08-13
- 无网环境下手敲百万字符:Claude Opus 5 展现惊人自主探索能力 — jyangballin · 2026-08-13
- Claude Opus 5 编码成本创新高:单次任务花费超 50 美元 — jyangballin · 2026-08-13
- 【源头】ProgramBench评测:Claude 3 Opus单次任务成本高达 50 美元 — jyangballin · 2026-08-13