Claude Opus 5 上线,编程实测强但基准分数仍有争议
Latent Space · rss · 2026-07-25
Anthropic 发布 Claude Opus 5 后,社区对它的基准成绩和真实体验给出了一个“分数偏保守、实战很强”的混合判断。
- Epoch 给出的 ECI 是 159,略低于 Fable 5 的 161;但在软件工程指标上,SWE-ECI 达到 161,与 Fable 5 持平。
- 早期用户普遍认为它在真实工作流里比公开分数更强,尤其是编程和浏览器/工具使用。
- 有评测者指出一个异常现象:在 FrontierCode 上,中等 effort 反而比高 effort 更好,说明更多推理计算并不总能带来更高分。
- 其他反馈集中在 best-of-n 编码结果、浏览器自动化和更强的 agent 行为,但这些多为个体实测,尚未形成统一结论。
「模型」频道最新
- Google 发布 1 小时智能体工程课程,讲记忆与 MCP — ifioknkem · 2026-07-25
- 图表显示 Kimi K3 领跑可用网络安全模型 — zainhas · 2026-07-25
- Opus 5 被称在三项表格智能体基准上跃升 — surmenok · 2026-07-25
- Claude Opus 5 在 ARC-AGI-3 上被指领先第二名 3 倍 — zainhas · 2026-07-25
- Anthropic 砍掉 80% 系统提示,上下文工程全面转向做减法 — 机器之心 · 2026-07-25
- xAI 将 SuperGrok Heavy 降至每月 99 美元,三个月打 67 折 — ns123abc · 2026-07-25