让 DeepSeek 通宵修 14 个 bug PR,仅 6 个通过强模型评审
Aggressive-Narwhal-3 · reddit · 2026-10-03
作者用自己的仓库做实验:在 API 折扣窗口让便宜的 DeepSeek 通宵修复审计发现的严重 bug。
- 第一轮:产出 14 个 PR,全部交由更强的 GPT-6.1 Sol 评审,6 个通过 CI 并合并、8 个被关闭。失败原因包括:修复破坏了其他合法输入、测试依赖 CI 没有的工具、绕过方案实际仍有效、关键测试根本没在 CI 里跑、新测试即使故意注入 bug 也测不出来。
- 第二轮换了分工:强模型设计修复方案 → 另一个模型评审设计 → 便宜模型只负责实现。目前 7 个 PR 尚无一个通过评审。
- 作者向社区征询:便宜模型的修复通常在哪失效?规划/实现/评审的哪种分工组合真正有效?
「编程与Agent」频道最新
- AI 圈 slop 循环:Agent 互读垃圾内容,根因是给的上下文太少 — IgorCarron · 2026-10-03
- 开发者必懂的 8 个核心网络概念:从 DNS 到 WebSocket — goyalshaliniuk · 2026-10-03
- 同题对决:Codex 与 Claude 移植红白机游戏,CPU 渲染改 GPU 谁更强 — ssh4net · 2026-10-03
- 开源工具 iFixAi 用 60 项检查给 AI Agent 打出 A 到 F 业务审计分 — thisdudelikesAI · 2026-10-03
- 并行 Agent 撑爆 worktree 空间,作者让 agents 主导研究 Git 替代方案 — Al_Grigor · 2026-10-03
- 上海源星启弦开源 StartLux-Decision:专管 Agent 小决策的模型 — mikelau2026 · 2026-10-03