曝 Opus 5 跑分泄露:研究数学与长文本能力大幅跃升

echen · x · 2026-07-30

疑似 Anthropic 未发布的 Opus 5 模型在多项基准测试中曝光。相比 Opus 4.8,新版本在研究数学(Riemann-bench,68.0% vs 47.2%)、图表理解(Chartography,27.3% vs 15.9%)和长上下文智能体(HANDBOOK.md,32.3% vs 21.9%)方面实现了大幅提升。而在企业复杂指令、文档推理及创意写作等维度上,则表现为小幅改进或持平。

所属事件:疑似Anthropic Opus 5跑分泄露(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →