GPT-5.6 日常使用评测:过度谨慎但仍会犯错

WolframRvnwlf · x · 2026-07-17

作者把 **GPT-5.6 Sol xhigh** 当作日常主力用了整整一周后,开始对它过度保守的行为感到烦躁。 ### 主要问题 - 经常写的测试数量比改动的代码行数还多。 - 会花很多时间做校验,比如对复制出来的文件做 SHA256 哈希验证,耗时甚至超过实际复制过程。 - 一次本来 1–2 小时能完成的更新,因为大量测试、验证和“可能没必要的修复”,拖到了 **30 小时**,而且作者已经用了 fast mode。 ### 结论 - 最大的问题不只是慢,而是“过度自我保护”并没有换来足够高的正确率。 - 它仍然会犯一些低级错误,让作者觉得自己付出的额外时间和 token 没有得到足够回报。 - 作者承认可以降低 effort 或换更弱的模型,但如果顶级模型都不够聪明,就不愿再冒更差模型带来的风险。

所属事件:GPT-5.6基准跑分亮眼,但日常编程体验下滑引抱怨(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →