Cognition SWE-2 被质疑后删光自己代码,结果反而是最优解
silasalberti · x · 2026-09-23
- 有用户测试 Cognition 的 SWE-2 自主修 bug:它先写了一堆代码,用户要求找更优雅的方案,结果它把自己写的全部删掉、连同一些其他内容也一并删除——而这恰恰是正确解法。
- 案例展示了 agent 评估「删代码比加代码更好」这种反直觉决策的能力,也颇具戏剧性:月费 20 美元的套餐里,agent 用删除作为答案。
「编程与Agent」频道最新
- 大字典典断言毁测试可读性,Syrupy 快照让 pytest 保持整洁 — KhuyenTran16 · 2026-09-23
- pytest 断言越写越长?用 Syrupy 快照文件让大输出测试恢复可读 — KhuyenTran16 · 2026-09-23
- Netlify AI Gateway 上线 Claude Opus 5.5,零配置即可在 Functions 中调用 — thisiskp_ · 2026-09-23
- LLM 评测分数抖动别瞎追:用 20 行 Python 自举置信区间 — bgoncalves · 2026-09-23
- Jev API 实验清单热传:桌面自动化、玩马里奥、控无人机五个上手项目 — blaizedsouza · 2026-09-23
- 把 agent 接到外部服务前,先用这个 prompt 核对账号与环境 — gethackteam · 2026-09-23