Claude Opus 5 在 FrontierCode 上中等推理反而更强

zainhas · x · 2026-07-25

有人在问 Claude Opus 5 是否有“想太多”的问题。贴出的基准结果显示,在 FrontierCode 主集和扩展集上,Opus 5 采用 medium reasoning effort 的表现,反而优于 high / xhigh / max。

这意味着,把推理强度继续拉高,未必总能带来更好分数;在某些基准上,反而可能出现“越想越亏”的情况。

所属事件:Opus 5 编码测试反转:推理越强分数反而下滑(13 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →