NVIDIA Mid-Harness 论文:模型与 Harness 之间加验证层,终端 Agent 成功率升至 68%
rohanpaul_ai · x · 2026-10-02
NVIDIA 团队发布论文《Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents》,研究在模型与 harness 边界分配测试时算力能否提升动作可靠性。
- 核心思路:终端 Agent 的模型能生成好命令,不等于会被可靠执行;一条坏命令(如装错包)会破坏环境、拖垮后续步骤
- Mid-Harness 在执行前对候选动作进行采样与验证,生成器和 harness 均不改
- 在 TerminalBench-Lite 上,TMAX-9B 生成器搭配 GPT-5.6 Sol 验证器、每步采样 8 个动作时,Pass@1 从 50.00% 提升到 68.03%
- 验证器弱时增加采样几乎无收益;用同款 TMAX-9B 自验证时,成对(pairwise)验证效果最好
- 将强验证器的响应蒸馏回 TMAX-9B 还能进一步提升 Pass@1,动作生成器保持不变
所属事件:NVIDIA 论文:给终端 Agent 加验证器,成功率升至 68%(3 条相关)→
「编程与Agent」频道最新
- 微软论文:编码 Agent 分析日志优化提示词,4 项基准胜 3 项仅花 $1.60 — rohanpaul_ai · 2026-10-02
- 别急着上最大模型:GPT-6.1 Sol 主代理 + Luna 子代理省钱实测 — chiliraupe · 2026-10-02
- Dot 不是更强的 Codex:一款对标 OpenClaw/Hermes 的差异化编码产品 — gabrielchua · 2026-10-02
- Engineering.com 母公司 Arrowfly 推出 AI for Engineers 常设计划 — burhop · 2026-10-02
- exe.dev 倡议少跑 Agent:用快模型接管人机沟通,减少并发压力 — sull · 2026-10-02
- 给 AI agent 1000 美元让它自己跑对冲基金,全程直播中 — kleffew94 · 2026-10-02