Nvidia 论文:训练与改技能文件交替进行,Agent 提分最显著
rohanpaul_ai · x · 2026-10-09
Nvidia 新论文 VERA 研究长链多步 agent 任务的改进方法,核心结论是交替进行模型训练与技能文件(skill files)编辑,并用来自真实证据的分步分数决定每轮改哪边——只训练模型或只改 harness 都会浪费约一半的提升空间。
方法要点:
- 大多数评测环境只看最终结果,无法定位哪一步出错。VERA 构建了 9000 多个可重启的沙箱,对长工作流的每一步依据真实文件与日志打 checklist 分。
- 分步得分决定下一个修复进入模型还是技能文件。
- 在医学研究基准上,9B 的 agent 双管齐下得分 69.1,仅改技能文件 56.1,仅训练模型 43.3。
这对做 agent eval 与优化的工程实践有直接参考价值:给每一步打分,再让分数决定修复方向。
所属事件:NVIDIA 发布 VERA:让 Agent 模型与框架协同自进化(4 条相关)→
「编程与Agent」频道最新
- 多智能体框架 CORAL 登 COLM,GitHub 星数破 1100 — pliang279 · 2026-10-09
- 开发者实测:把任务交给快速 agent,重获心流体验 — Dimillian · 2026-10-09
- TritonRL:8B 模型 RL 训练写 Triton 核,性能匹敌 100B+ 前沿模型 — allenainie · 2026-10-09
- openclaw 在 Windows 上的安装部署将变得非常简单 — steipete · 2026-10-09
- 逆向工程 ChatGPT Intelligent UI:agent 不写代码,改用 DIL 语言 — teropa · 2026-10-09
- OpenAI Decisions API 接入 LangChain:让模型返回结构化决策与置信度 — LangChain · 2026-10-09