SWE-Touch 证明人类改代码时编程智能体会明显退化
CASIA · hf · 2026-08-04
- SWE-Touch 把 coding agent 放进更接近真实开发的场景:用户可以在任务进行中查看并修改同一份代码。
- 论文提出 Counter-Edits:对任务相关代码做出看似合理、但会和任务目标冲突的用户修改。
- 其做法是从修复轨迹中挖出关键代码区域,再用独立的 user patch generator 生成补丁,并在 agent 走到相关位置时注入这些编辑和上下文消息。
- 在 SWE-bench Verified 上,这种设置让平均 resolve rate 下降了 7.7 个百分点;在 SWE-Bench Pro 和 DeepSWE 上也有类似退化。
- 结论是:单看 автономous(自主)能力不够,coding agent 还需要更强的工作区感知、冲突协调和测试验证能力。
「编程与Agent」频道最新
- SkillHone 通过保留决策历史,把 GAIA 分数提升 15.8 — jiqizhixin · 2026-08-04
- OpenComputer 发布 serverless agents 运行时早期预览版 — zeeg · 2026-08-04
- Fable 接入 GitHub Stacked PR,直接拉起 27 个 PR 流程 — dbreunig · 2026-08-04
- 一张梗图说,agent 工作流里的 orchestrator 变成人类了 — vikvang1 · 2026-08-04
- 有人在找能提速的 MiniMax 工作流 — PersonalMango2562 · 2026-08-04
- 你们生产环境用哪家推理服务,最烦什么 — itsfabioroma · 2026-08-04