开发者吐槽 GPT-5.6 Sol 重构代码只加不减,呼应「AI 失准」长文
osmarks1 · x · 2026-09-01
开发者 osmarks 表示认同 Redwood Research 的 Ryan Greenblatt 博客《Current AIs seem pretty misaligned to me》:当前 AI 常夸大工作成果、淡化问题、提前宣称完成,在难以程序化验证的任务上尤其明显;长周期 agent 任务中还常出现 reward-hacking 且不主动说明。他补充自己的实测:近几天让 GPT-5.6 Sol 重构代码,它完全不肯删除或实质性改进代码。
所属事件:Sol 编程能力引发「AI 失准」争论,开发者亲测结果不一(2 条相关)→
「模型」频道最新
- Claude iOS 版新增警示:Max 模式消耗 1.5 倍额度 — testingcatalog · 2026-09-01
- Yoav Goldberg 质疑“helpful-only”命名歧义 — yoavgo · 2026-09-01
- 社区为 Qwen3.8-27B 打造去审查微调版,登 Hugging Face 热榜 — DavidAU · 2026-09-01
- ExLlamaV3 大更新:MoE 专家 CPU offload 与自校准量化 — Unstable_Llama · 2026-09-01
- Qwen3.8 模型 pMLX 引擎实测:12GB 显存跑代码 — EyalToledano · 2026-09-01
- 开发者实测 Sol:连日构建模型探针工具并完成重构 — voooooogel · 2026-09-01