模型评测越来越难:该奖最小修复还是最佳重构
hichaelmart · x · 2026-07-25
模型修 bug 时,少改一点真的更好吗?
这条帖子的重点,是在讨论代码类模型评测标准正在变得越来越难。作者提出一个很现实的问题:我们到底该更认可“用最少修改修好问题”的程序员,还是“顺手把周边代码也重构掉”的程序员?连人类都很难用二元标准裁决,模型评测者就更难了。
引用里的例子提到,Claude Opus 5 在不同 effort 设置下表现不同:
- low effort 时,只改了一个字符
- high effort 时,则把相关代码一起重构了
- 但两次最终都达成了相同的修复结果
这说明代码模型的好坏,不只是“对不对”,还包括改动范围、代码风格和可维护性。
「模型」频道最新
- 一则长线程称,回形针末日论属于前 LLM 时代想象 — repligate · 2026-07-25
- Anthropic 评测图显示 Claude Opus 5 约 163.5 分 — scaling01 · 2026-07-25
- Grok 4.5 下调缓存读价格,单任务成本降 25% — Baconbrix · 2026-07-25
- Reddit 称 Claude Opus 5 在 3D 破坏测试中胜过 Fable 5 — Successful-Earth678 · 2026-07-25
- Claude 可能不再显示总结版思考轨迹 — emollick · 2026-07-25
- 第二张截图再次显示 Claude Opus 5 推理不稳定 — scaling01 · 2026-07-25