NVIDIA 论文:终端 agent 先验证再执行,TerminalBench Pass@1 从 50% 升到 68%
dair_ai · x · 2026-10-04
NVIDIA 发表关于终端 agent test-time compute 的论文,核心发现:应采样多条候选 shell 命令并在执行前验证,且把算力更多花在验证器而非额外采样上。
关键结果:
- 用 GPT-5.6 Sol 验证器在 8 个采样动作中选择,TerminalBench-Lite Pass@1 从 50.0% 升至 68.0%;
- 验证器太弱时,增加采样几乎无收益。
Mid-Harness 保持生成器与 harness 不变、在两者之间插入验证层。小模型 TMAX-9B 自验证时成对比较效果最佳,把强验证器蒸馏进小模型还能进一步提升。动作采样与轨迹采样结合,比只采样完整轨迹以更低 token 成本达到更高成功率。
「编程与Agent」频道最新
- 开发者为 OpenAI Agents API 做托管聊天 UI,征集反馈 — DarasStayHome · 2026-10-04
- Alloyqa 云端编码 Agent 内测:丢任务上去,回来收 PR — AdventurousAge8767 · 2026-10-04
- OpenAI 发布 34 页 AI Agents 白皮书,披露内部构建方法 — mdancho84 · 2026-10-04
- Meta 工程师:AI 每天自动修最热 JS 错误并通知负责人 — Vjeux · 2026-10-04
- 19 岁开发者自建 Telegram AI 智能体:模型 wrapper 就这么简单 — PowerOk7047 · 2026-10-04
- 监工 Claude/Codex 让人刷手机上瘾,开发者自曝多巴胺透支 — ethanCaballero · 2026-10-04