NVIDIA 论文:基座模型跑 SWE-bench,六个中五个零分
NVIDIA 等团队在 arXiv 发布论文《Before They Can Solve: Predicting Post-Training Coding-Agent Performance》,探讨如何为编码 Agent 挑选基座模型。研究发现基座模型在 agentic 编码任务上极难评估:让六个基座模型跑 SWE-bench Verified,其中五个得了零分,凸显后训练前预测 Agent 表现的难度与重要性。
2026-10-09 ~ 2026-10-09 · 2 条相关
- NVIDIA 团队新论文:从基座模型预测后训练后编程 Agent 表现 — heghbalz · 2026-10-09
- NVIDIA 论文:六个基座模型跑 SWE-bench,五个零分 — dair_ai · 2026-10-09