Nvidia 论文:训练与改技能文件交替进行,Agent 提分最显著

rohanpaul_ai · x · 2026-10-09

Nvidia 新论文 VERA 研究长链多步 agent 任务的改进方法,核心结论是交替进行模型训练与技能文件(skill files)编辑,并用来自真实证据的分步分数决定每轮改哪边——只训练模型或只改 harness 都会浪费约一半的提升空间。

方法要点:

这对做 agent eval 与优化的工程实践有直接参考价值:给每一步打分,再让分数决定修复方向。

所属事件:NVIDIA 发布 VERA:让 Agent 模型与框架协同自进化(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →