Opus 5 评测:研究数学和长上下文 agent 排名第二,价格减半
echen · x · 2026-07-30
Surge AI 发布 Opus 5 评测结果:在 Riemann-bench(研究数学)得分 68.0%(vs Opus 4.8 的 47.2%),Chartography(图表理解)27.3%(vs 15.9%),HANDBOOK.md(长上下文 agent)32.3%(vs 21.9%)。Anthropic 将其定位为接近 fable 智能但价格减半。整体排名未进前三,但在特定领域表现突出。
所属事件:疑似Anthropic Opus 5跑分泄露(2 条相关)→
「模型」频道最新
- 研究者发现 Claude Opus 5 基础模型模式存在异常叙事倾向 — repligate · 2026-07-30
- 输入特定提示词,Claude Opus 5 疑现异常补全行为 — matthen2 · 2026-07-30
- MLA与GRPO等新技术正推动AI开源走向真正去中心化 — zephyr_z9 · 2026-07-30
- 吐槽 Claude Opus 说教味重,难当个人助理 — sidjustice_ · 2026-07-30
- 网友惋惜:Opus 5 还没发力就被截胡了 — chrisfirst · 2026-07-30
- Claude 遭遇重大服务宕机,全量业务受到中断影响 — Polymarket · 2026-07-30