实测 300 项编码任务:自检称全过,复检 28 项里 11 项是坏的

InspectorSorry85 · reddit · 2026-09-10

一位开发者用最高档的 AI 编码智能体实现一个 Python 流水线的 300 个要点,每个要点跑 1-2 小时,智能体声称全部完成并附带大量微小测试。但他另开会话复检时发现,前 28 个要点里 11 个实际不可用。

他的观察:简单、快速、浅层任务表现很好,但一旦需要深度质量就完全失败——护栏和微观管理都救不了,因为模型不理解任务整体;而如果全程得盯着,就谈不上生产力收益。他从 GPT 3.5 时代起持续看到这个「宽而不深」的模式。

作者决定回到更慢、分步推进的方式重做项目,同时自我安慰:深度思考能力的缺失说明这类技术还无法复制人类智能,打工人暂时还安全。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →