GPT 写的是「屎山代码」?RL 奖励错配或毁掉工程质量
xiaohu · x · 2026-10-03
xiaohu 引用并翻译了网友 Gegam 对 GPT 系列模型编码质量的批评,核心论点是:GPT 学会了「把当前任务做过关」,却没有学会「把工程做好」。
三个关键论据:
- 奖励错配:强化学习过度依赖容易量化的信号(测试是否通过、程序是否报错、任务是否完成),而架构合理性、可维护性、模块边界、可读性这些真正决定代码质量的维度难以量化,模型因此倾向于「测试能过就行」,哪怕内部实现很烂。
- 被优化成「少想、少输出、快完成」:OpenAI 重视推理效率(少 token、少算力),导致模型产出大量堆在一起、拆分和抽象不足的代码;而真正的软件工程需要先做需求→数据结构→模块→接口→边界→测试→重构的设计流程,消耗更多推理资源。
- 训练视野太短(training horizon too short):训练只看到「任务→输出→测试通过→奖励」,但真实工程是上线后持续的需求变更、Bug、重构和多人协作。比如 AI 用 hack 方式实现登录功能今天全绿,三个月后要加 OAuth、多账号、权限时才发现架构根本扩展不了——而「三个月后发生什么」无法反馈到当初的生成行为上。
作者的结论:模型可能越来越擅长快速交付,却未必越来越擅长做工程。
「编程与Agent」频道最新
- 独立游戏《I Just Wanted to Fish》全部资产由 Blender MCP 加 AI 生成 — sidahuj · 2026-10-03
- GitHub 52.6k 星项目:给 Claude Code 装上一套营销 Agent Skills — lxfater · 2026-10-03
- Anthropic 官方免费开放 Claude Code 子代理与 MCP 课程 — anthara_ai · 2026-10-03
- Claude Code 作者免费放出 20 门课程,覆盖提示词到并行会话 — anthara_ai · 2026-10-03
- 开发者用 Claude Code 给 Windows 11 排障调优,直呼体验质变 — thespite · 2026-10-03
- Reddit 热议:AI 智能体大家实际在用,哪些事还是做不好 — GabrieLX5 · 2026-10-03