腾讯混元 RSR 框架提升复杂任务训练轨迹质量

腾讯混元团队提出 Recursive Self-Rewrite(RSR)框架,用于为复杂任务生成高质量训练轨迹。该方法让基础模型(Qwen-3.8-27B)在多样化 harness 脚手架下探索复杂任务的成功解法,再递归重写为统一形式。实验显示,27B 模型在 Terminal-Bench 2 上 pass@3 从 57% 提升至 74%。

2026-10-05 ~ 2026-10-05 · 2 条相关