腾讯混元 RSR 框架提升复杂任务训练轨迹质量
腾讯混元团队提出 Recursive Self-Rewrite(RSR)框架,用于为复杂任务生成高质量训练轨迹。该方法让基础模型(Qwen-3.8-27B)在多样化 harness 脚手架下探索复杂任务的成功解法,再递归重写为统一形式。实验显示,27B 模型在 Terminal-Bench 2 上 pass@3 从 57% 提升至 74%。
2026-10-05 ~ 2026-10-05 · 2 条相关
- 腾讯混元 RSR 框架:27B 模型 Terminal-Bench 2 pass@3 从 57% 提至 74% — Tencent-Hunyuan · 2026-10-05
- 腾讯混元提出 RSR:递归自重写生成复杂任务训练轨迹 — _akhaliq · 2026-10-05