Opus 5 评测:研究数学和长上下文 agent 排名第二,价格减半

echen · x · 2026-07-30

Surge AI 发布 Opus 5 评测结果:在 Riemann-bench(研究数学)得分 68.0%(vs Opus 4.8 的 47.2%),Chartography(图表理解)27.3%(vs 15.9%),HANDBOOK.md(长上下文 agent)32.3%(vs 21.9%)。Anthropic 将其定位为接近 fable 智能但价格减半。整体排名未进前三,但在特定领域表现突出。

所属事件:疑似Anthropic Opus 5跑分泄露(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →