NVIDIA Mid-Harness:执行前采样验证动作,TerminalBench Pass@1 升至 68%
nvidia · hf · 2026-10-01
NVIDIA 提出 Mid-Harness:在模型与 harness 边界分配测试时算力,执行前采样并验证候选动作,提升终端 agent 动作可靠性。以 TMAX-9B 为生成器,弱验证下多采样收益甚微,强验证则能挖掘同一生成器的更优动作;在 TerminalBench-Lite 上,GPT-5.6 Sol 验证器在 8 次采样下把 Pass@1 从 50.00% 提到 68.03%。TMAX-9B 自验证时成对验证最优,把强验证器响应蒸馏回 TMAX-9B 还能进一步提升。动作扩展+轨迹扩展的组合比单纯生成更多轨迹以更低 token 成本取得更高成功率,且跨模型、基准与 harness 均有效。
「编程与Agent」频道最新
- 开发者晒多 agent 日常:OpenClaw 稳定性大增,10 美元 VPS 即可跑 — steipete · 2026-10-01
- 用户吐槽 GPT-6 Sol 编码更慢更笨,Codex 体验倒退 — burkov · 2026-10-01
- 没有评估就是盲建:上下文嵌入模型需对消歧上下文块也高排序 — antoine_chaffin · 2026-10-01
- 黑客松项目 Jev Sentinel 开源:Agent 每步操作先审后跑,拦截率 98.3% — schwentker · 2026-10-01
- Priors 欲做 AI Agent 的链上信用机构 — econoar · 2026-10-01
- Reddit网友跑DeepSeek无人值守循环:2.37亿token仅花3.48美元 — dogfoodarchitect · 2026-10-01