模型评测越来越难:该奖最小修复还是最佳重构

hichaelmart · x · 2026-07-25

模型修 bug 时,少改一点真的更好吗?

这条帖子的重点,是在讨论代码类模型评测标准正在变得越来越难。作者提出一个很现实的问题:我们到底该更认可“用最少修改修好问题”的程序员,还是“顺手把周边代码也重构掉”的程序员?连人类都很难用二元标准裁决,模型评测者就更难了。

引用里的例子提到,Claude Opus 5 在不同 effort 设置下表现不同:

这说明代码模型的好坏,不只是“对不对”,还包括改动范围、代码风格和可维护性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →