Opus 5 体感更像同一天,只是失败更少了
mattpocockuk · x · 2026-07-25
如果你的评测 harness 和环境设计得足够好、也没有过度针对某个特定模型优化,今天的体验大概不会有太大变化,只是失败率会更低一点。
这是一条对 Opus 5 的简短体感判断,核心意思不是“能力发生了翻天覆地的变化”,而是模型稳定性与出错率有了小幅提升。
「模型」频道最新
- 初测称 Claude Opus 表现糟糕,Grok 4.5 更占上风 — JOBhakdi · 2026-07-25
- Anthropic 梗图称,Opus 3 没被砍是因为新版更糟 — repligate · 2026-07-25
- Opus 5 网络安全请求被曝回退至 Opus 4.8 处理 — rez0__ · 2026-07-25
- GPT-5.6 Sol 在 DeepSWE 以 72.7% 领先 Opus 5 — rohanpaul_ai · 2026-07-25
- xAI 梗图调侃:Grok 4.6 两周后、4.7 四周后 — Daniel_Farinax · 2026-07-25
- Claude Opus 5 登陆 Google Cloud Agent Platform,订阅用户可获每月 100 美元额度 — rseroter · 2026-07-25