Claude Opus 5 上线,编程实测强但基准分数仍有争议
Latent Space · rss · 2026-07-25
Anthropic 发布 Claude Opus 5 后,社区对它的基准成绩和真实体验给出了一个“分数偏保守、实战很强”的混合判断。
- Epoch 给出的 ECI 是 159,略低于 Fable 5 的 161;但在软件工程指标上,SWE-ECI 达到 161,与 Fable 5 持平。
- 早期用户普遍认为它在真实工作流里比公开分数更强,尤其是编程和浏览器/工具使用。
- 有评测者指出一个异常现象:在 FrontierCode 上,中等 effort 反而比高 effort 更好,说明更多推理计算并不总能带来更高分。
- 其他反馈集中在 best-of-n 编码结果、浏览器自动化和更强的 agent 行为,但这些多为个体实测,尚未形成统一结论。
「模型」频道最新
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11