曝 Opus 5 跑分泄露:研究数学与长文本能力大幅跃升
echen · x · 2026-07-30
疑似 Anthropic 未发布的 Opus 5 模型在多项基准测试中曝光。相比 Opus 4.8,新版本在研究数学(Riemann-bench,68.0% vs 47.2%)、图表理解(Chartography,27.3% vs 15.9%)和长上下文智能体(HANDBOOK.md,32.3% vs 21.9%)方面实现了大幅提升。而在企业复杂指令、文档推理及创意写作等维度上,则表现为小幅改进或持平。
所属事件:疑似Anthropic Opus 5跑分泄露(2 条相关)→
「模型」频道最新
- 开发者实测 Kimi K3:推理过程全透明成显著优势 — doodlestein · 2026-07-30
- 开发者利用 Grok 搭建验证群,低成本实现并行 Agent — rudrank · 2026-07-30
- 实测异常:特定提示词致 Claude Opus 泄露思维链并伪造请求 — matthen2 · 2026-07-30
- 研究者发现 Claude Opus 5 基础模型模式存在异常叙事倾向 — repligate · 2026-07-30
- 输入特定提示词,Claude Opus 5 疑现异常补全行为 — matthen2 · 2026-07-30
- MLA与GRPO等新技术正推动AI开源走向真正去中心化 — zephyr_z9 · 2026-07-30