Opus 5 max thinking 在两三成基准上反而不如 xhigh
keunwoochoi · x · 2026-07-25
这条在讨论 Opus 5 的一个反常现象:在某些基准上,开更多思考并没有带来更好结果,反而出现性能下降。
引用中的核心观察是:从系统卡粗看,大约 20–30% 的报告基准里,Opus 5 max thinking 的表现比 xhigh 更差。按常识,更多思考和更多 test-time compute 通常应该带来更高性能,但这里却出现了反直觉的回退。
作者补充说 Opus 4.8 没有这个问题,因此他猜测这可能意味着这次发布节奏比较赶,或者问题出在后训练阶段,而不一定只是模型规模本身的自然结果。
所属事件:Opus 5 测试现反直觉现象:中等推理性能最佳(10 条相关)→
「模型」频道最新
- Grok 4.5 在 Augment 里录得最大周增幅 — Daniel_Farinax · 2026-07-25
- 有人能让 AI 以 24fps 看完整段视频吗 — mattshumer_ · 2026-07-25
- Kimi 权重若公开,争论会转向硬件经济学对 V4 — teortaxesTex · 2026-07-25
- Anthropic 详解 Fable 5 编排、advisor 模式与缓存成本 — brada · 2026-07-25
- PaddlePaddle 的 HPD-Parsing 在 Hugging Face 走热,主打文档解析 — PaddlePaddle · 2026-07-25
- Claude Opus 5 在高推理档位达到最佳性价比 — thesaraharminta · 2026-07-25