GPT-5.6 日常使用评测:过度谨慎但仍会犯错
WolframRvnwlf · x · 2026-07-17
作者把 GPT-5.6 Sol xhigh 当作日常主力用了整整一周后,开始对它过度保守的行为感到烦躁。
主要问题
- 经常写的测试数量比改动的代码行数还多。
- 会花很多时间做校验,比如对复制出来的文件做 SHA256 哈希验证,耗时甚至超过实际复制过程。
- 一次本来 1–2 小时能完成的更新,因为大量测试、验证和“可能没必要的修复”,拖到了 30 小时,而且作者已经用了 fast mode。
结论
- 最大的问题不只是慢,而是“过度自我保护”并没有换来足够高的正确率。
- 它仍然会犯一些低级错误,让作者觉得自己付出的额外时间和 token 没有得到足够回报。
- 作者承认可以降低 effort 或换更弱的模型,但如果顶级模型都不够聪明,就不愿再冒更差模型带来的风险。
所属事件:GPT-5.6基准跑分亮眼,但日常编程体验下滑引抱怨(3 条相关)→
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11