微软论文:Coding Agent 卡在理解代码,而非编辑行数
rohanpaul_ai · x · 2026-10-10
微软研究员提出 CABRA,通过调用图变换从零生成合成编码任务,沿函数遍历、搜索、运行时解析、指令遵循四个轴独立加难度,对 8 个 LLM 和 6 个 Agent 跑了 6,840 个任务,并将每次工具调用标注为阅读、分析、搜索、编辑或测试。
关键发现:
- 纯 LLM 准确率随任务规模增长而下降,Agent 通过把工作卸载给 grep 等工具保持近乎全对;
- 任务越大,阅读与分析类工具调用越多;在 SWE-bench Verified 上,阅读/分析调用次数比编辑行数更能预测 Agent 失败(相关系数 -0.200 vs -0.159);
- 在一个跨类分析分歧逻辑的高强度理解任务上,Agent 准确率终于下降,印证瓶颈在「理解代码」而非「编辑量」。
作者主张用 CABRA 这类可控合成评测,与 SWE-bench 式任务互补,暴露被工具掩盖的模型弱点。
所属事件:微软论文称代码理解而非编辑量是 Agent 真瓶颈(2 条相关)→
「编程与Agent」频道最新
- 多智能体框架 Swarms 发布官方 Docker 镜像,一条命令即可部署 — KyeGomezB · 2026-10-10
- 给 Grok Bot 加两层记忆:聊天记忆 + 常驻虚拟机上的 Hermes agent — alexcovo_eth · 2026-10-10
- Aiden Bai:模型评测工具链拉胯,每家公司 posttrain 前先补好 eval — aidenybai · 2026-10-10
- 开源 Cloudroom 一个 prompt 派生 110 个云子 agent,57 秒完成 — ramagetime · 2026-10-10
- 独立开发者用 ThreeJS 造浏览器版 GT 赛车模拟,悬架按 IMSA 规则调校 — AIandDesign · 2026-10-10
- 多智能体系统 105 小时自动调优,Qwen3.5 推理提速 175 倍超 SGLang — bariskasikci · 2026-10-10