NVIDIA 论文:六个基座模型跑 SWE-bench,五个零分
dair_ai · x · 2026-10-09
NVIDIA 发布一篇关于「如何为编码 agent 挑选基座模型」的论文,指出基座模型在 agentic 编码任务上极难评估:他们让六个基座模型跑 SWE-bench Verified,其中五个一个任务都没解出来。
于是论文换了个思路,只盯编码过程中真正修好任务的那一步:取一个强 post-trained agent 已经解出的任务,把它的一步步代码编辑回放,每步后跑测试,第一个让测试通过的编辑就是「决定性编辑」。然后把该编辑之前的所有上下文交给基座模型,看它能否写出这个修复。
评分从三个维度进行:基座模型写出该修复的概率、能否挑出正确修复等。作者认为这是一种巧妙的、能预测基座 checkpoint 经 post-training 后成为编码 agent 表现如何的排序方法。
所属事件:NVIDIA 论文:基座模型跑 SWE-bench,六个中五个零分(2 条相关)→
「编程与Agent」频道最新
- 设计师用 Claude 一天造出定制设计软件,替代受限的 Figma — oykun · 2026-10-10
- Coinbase CEO:用自家 AI 开发工具上线 Advanced 键盘快捷键功能 — kleffew94 · 2026-10-10
- 开源复现 Google 740M 多模态嵌入模型 EmbeddingGemma 2 — KyeGomezB · 2026-10-10
- 开源项目 LLM Wiki 获 2 万星:用持久知识库替代传统 RAG — tom_doerr · 2026-10-10
- 开源个人 agent Comma 发布:无会话限制、云端电脑上 24/7 干活 — HeyToha · 2026-10-10
- AI 提速后周产出翻月:媒体公司问「一周发 100 个应用怎么办」 — danshipper · 2026-10-10