开发者质疑:为降推理成本做的优化正在毁掉模型多步可靠性
karmay007 · x · 2026-09-26
一位开发者指出,GPT-5.5 等新模型在多步生产工作上的可靠性明显下降:被明确要求的事没实现,被追问时模型只说「你没说清楚」,或在能用简单 CLI 命令时去调 computer use。
- 作者怀疑厂商在暗中超力度优化服务成本:更小模型/更少激活参数/过度 RL,以及可能的量化(Blackwell 支持 NVFP4,Vera Rubin 进一步加速)——虽然他承认不知道厂商实际用什么精度。
- 核心批评:模型在 one-shot 上很强,但多步分叉思考仍是线性的,/goal mode 在模型卡住时不求助开发者反而硬撑;「finish the implementation」式 goal 是灾难。
- 建议:前端可以 vibecode,后端别 vibecode——新功能会不断破坏已有代码,回归测试只能靠自己。
「编程与Agent」频道最新
- 先聊后建:Lovable Chat Mode 免费功能帮你省额度 — damienghader · 2026-09-26
- Skill 供应链风险升温,开源 skill-audit 提供离线预装审计 — masiha97 · 2026-09-26
- SimonW:编码 Agent 让软件工程反而更难了 — blaizedsouza · 2026-09-26
- Gemma 4 开发者 agent 比赛限定 31B 模型,代码图谱或成胜负手 — politefella0 · 2026-09-26
- 开发者建议:借 LLM 入门 Lean 形式化验证,能揪出隐蔽 bug — remilouf · 2026-09-26
- Salesforce 研究:任务到来时再提取记忆,Agent 成功率提升超 16 点 — dair_ai · 2026-09-26