腾讯混元 RSR 框架:27B 模型 Terminal-Bench 2 pass@3 从 57% 提至 74%
Tencent-Hunyuan · hf · 2026-10-05
腾讯混元团队提出 Recursive Self-Rewrite(RSR)框架,用一个基础模型(Qwen-3.8-27B)在多样化 harness 下探索复杂任务的成功解法,再将其重构为通用 harness 下的训练轨迹。
方法:planner 将执行过程提炼为 runbook,critic 筛查验证器与解法泄漏并引导递归修订,executor 在全新沙箱中执行合格的 runbook。
结果:
- 约 3000 个自策展终端任务中,三个 harness 联合解决 759 个,比单最强 harness 多 34.3%
- 将 2001 条成功源轨迹扩展为 11094 条重写轨迹用于 SFT
- 对比基座模型,pass@3:Terminal-Bench 2 从 57.0% 升至 74.2%,Terminal-Bench 4 从 1.5% 升至 9.1%,自策展 Hard 从 39.0% 升至 63.0%,Software Terminal-Bench 从 3.0% 升至 6.0%
- Long-Horizon Terminal-Bench 过程奖励从 0.21 升至 0.29
证明多样化 harness 辅助经验可重构为通用 harness 下可复用的能力。
「编程与Agent」频道最新
- 智能体主动发消息翻车:Dots 子代理拒收用户明确批准 — xeophon · 2026-10-05
- 黑客松评审百个个人Agent项目:基础设施已就绪将迎爆发 — jamdac · 2026-10-05
- 浏览器 Agent 最大痛点不是幻觉,而是「假成功」 — Comfortable_Oven6576 · 2026-10-05
- 重度用户实测 ChatGPT Dots:200 美元套餐仍撞上滥用防护限速 — invertednz · 2026-10-05
- dots 开发者征集用户访谈:找个人助手重度用户聊改进方向 — pvncher · 2026-10-05
- FDE 方法论:Agent 应嵌入客户现有系统而非迁移到 AI 原生栈 — vasuman · 2026-10-05