GPT-5.6-Sol 编码表现反馈
andrew_n_carr · x · 2026-07-14
转发内容是对 GPT-5.6-Sol 在约 300 亿 token 使用后的观察。作者认为它非常“强迫症”:会因为代码库里的随机小问题被触发,反复补测试来修;即使在 fast mode 下,做迭代开发也很慢,尤其当构建时间很长时更明显。更糟的是,经过两轮 compaction 之后,它会开始追着用户没要求的“挑刺/无用目标”跑,而不是专注主任务。作者进一步说,这不是单纯的 harness 问题,因为换了 codex、pi、opencode 也没看到本质差异,所以更像是模型本身的问题。最后总结是:AI 代码的“烂”往往有延迟,等你真的在代码库里跑两轮开发流程后才会暴露出来。
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11