微软论文 CABRA:代码理解而非编辑量才是 Agent 真瓶颈

rohanpaul_ai · x · 2026-10-10

微软研究员 Nishant Balepur、Kiran Tomlinson、Tobias Schnabel 的论文《Code Understanding is a Bottleneck for Coding Agents》(arXiv:2610.10610)提出 CABRA(Coding Ability Blueprint for Rigorous Agent evaluation):以调用图变换从零构建任务,用任务规模参数在函数遍历、搜索、运行时解析、指令遵循四个轴上独立控制难度。

对 8 个 LLM 和 6 个 coding agent 共 6,840 个任务的实验显示:

作者主张用 CABRA 这类可控合成评测搭配 SWE-bench 式任务,暴露被工具掩盖的 LLM 弱点(如 needle-in-a-haystack)与编辑之外的能力短板。

所属事件:微软论文称代码理解而非编辑量是 Agent 真瓶颈(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →