NVIDIA 论文:六个基座模型跑 SWE-bench,五个零分

dair_ai · x · 2026-10-09

NVIDIA 发布一篇关于「如何为编码 agent 挑选基座模型」的论文,指出基座模型在 agentic 编码任务上极难评估:他们让六个基座模型跑 SWE-bench Verified,其中五个一个任务都没解出来。

于是论文换了个思路,只盯编码过程中真正修好任务的那一步:取一个强 post-trained agent 已经解出的任务,把它的一步步代码编辑回放,每步后跑测试,第一个让测试通过的编辑就是「决定性编辑」。然后把该编辑之前的所有上下文交给基座模型,看它能否写出这个修复。

评分从三个维度进行:基座模型写出该修复的概率、能否挑出正确修复等。作者认为这是一种巧妙的、能预测基座 checkpoint 经 post-training 后成为编码 agent 表现如何的排序方法。

所属事件:NVIDIA 论文:基座模型跑 SWE-bench,六个中五个零分(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →