腾讯混元 RSR 框架:27B 模型 Terminal-Bench 2 pass@3 从 57% 提至 74%

Tencent-Hunyuan · hf · 2026-10-05

腾讯混元团队提出 Recursive Self-Rewrite(RSR)框架,用一个基础模型(Qwen-3.8-27B)在多样化 harness 下探索复杂任务的成功解法,再将其重构为通用 harness 下的训练轨迹。

方法:planner 将执行过程提炼为 runbook,critic 筛查验证器与解法泄漏并引导递归修订,executor 在全新沙箱中执行合格的 runbook。

结果:

证明多样化 harness 辅助经验可重构为通用 harness 下可复用的能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →