微软论文:Coding Agent 卡在理解代码,而非编辑行数

rohanpaul_ai · x · 2026-10-10

微软研究员提出 CABRA,通过调用图变换从零生成合成编码任务,沿函数遍历、搜索、运行时解析、指令遵循四个轴独立加难度,对 8 个 LLM 和 6 个 Agent 跑了 6,840 个任务,并将每次工具调用标注为阅读、分析、搜索、编辑或测试。

关键发现:

作者主张用 CABRA 这类可控合成评测,与 SWE-bench 式任务互补,暴露被工具掩盖的模型弱点。

所属事件:微软论文称代码理解而非编辑量是 Agent 真瓶颈(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →