Opus 5 max thinking 在两三成基准上反而不如 xhigh

keunwoochoi · x · 2026-07-25

这条在讨论 Opus 5 的一个反常现象:在某些基准上,开更多思考并没有带来更好结果,反而出现性能下降。

引用中的核心观察是:从系统卡粗看,大约 20–30% 的报告基准里,Opus 5 max thinking 的表现比 xhigh 更差。按常识,更多思考和更多 test-time compute 通常应该带来更高性能,但这里却出现了反直觉的回退。

作者补充说 Opus 4.8 没有这个问题,因此他猜测这可能意味着这次发布节奏比较赶,或者问题出在后训练阶段,而不一定只是模型规模本身的自然结果。

所属事件:Opus 5 测试现反直觉现象:中等推理性能最佳(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →