NVIDIA 团队新论文:从基座模型预测后训练后编程 Agent 表现
heghbalz · x · 2026-10-09
NVIDIA 等团队在 arXiv 发布论文《Before They Can Solve: Predicting Post-Training Coding-Agent Performance from Base Models》,研究如何在昂贵的 agentic 后训练之前判断哪个基座 checkpoint 值得投入。
核心问题与思路:
- 端到端 pass@K 不适合评测 agentic coding:许多基座模型连格式正确的工具调用都难以产出,多步交互又会掩盖真实能力。
- 作者将后训练成功轨迹当作基座模型潜力的前瞻信号:重放每条轨迹,在每次改代码步骤后重跑测试,定位「决定性步骤」——即累积 patch 首次让仓库从失败转为通过的那一步,以此证明记录的动作在给定上下文下确实解决了任务。
- 基于 agentic 轨迹的覆盖原理,从基座模型行为预测其经后训练成为编程 agent 后的表现。
作者阵容包括 Ashish Vaswani、Bryan Catanzaro 等多位 NVIDIA 研究者。rosinality 评价这是有趣的方向:值得探究超越「堆更多 agentic 轨迹」的规律。
「编程与Agent」频道最新
- TinyJoin v0.6 性能反超 SQLite 与 PGlite,20 项基准全面更快 — Vjeux · 2026-10-09
- 开发者将Muse Gadget SDK移植到.NET,还让Edge跑上Arduino — unixterminal · 2026-10-09
- Eazo 让个人 Agent 变成可复用的 App,而非聊天窗口 — alifcoder · 2026-10-09
- Qoni 发布个人 Agent 基础设施:身份、执行与记忆三件套开箱即用 — alifcoder · 2026-10-09
- 用 Codex 剩余额度过夜创业:24 小时自动签下 10 家客户 — CtrlAltDwayne · 2026-10-09
- 20 秒起 250 台 VM 跑 Agent 沙箱,成本仅 10 美分 — RexDouglass · 2026-10-09