腾讯混元提出 RSR:递归自重写生成复杂任务训练轨迹
_akhaliq · x · 2026-10-05
腾讯混元团队的论文提出 Recursive Self-Rewrite(RSR)框架,用于为复杂任务生成高质量训练轨迹。核心问题是:专业化 harness(脚手架)能产出成功轨迹,但这些干预在部署时往往不可用。
- 用单一基座模型 Qwen-3.8-27B 在多样化 harness 下探索成功解法,再在通用 harness 下重构为训练轨迹
- 三个角色协作:Planner 将解题过程提炼为 runbook;Critic 审查验证器泄漏与解法泄漏,指导递归修订;Executor 执行 runbook
- 论文位列当日 HF 热门论文第 3
所属事件:腾讯混元 RSR 框架提升复杂任务训练轨迹质量(2 条相关)→
「研究」频道最新
- COLM 2025 附会:共谋行为审计研究将登 AdvML-Frontiers 工坊 — nandofioretto · 2026-10-05
- 350M 小模型微调做 PII 脱敏,识别率 89.7% 提到 99.7% — JosephJacks_ · 2026-10-05
- Wondersearch 称在 SciFact 上击败所有密集 embedding 模型 — NirantK · 2026-10-05
- Muse Spark 与数学家合作解决 6 个公开数学难题 — YiMaTweets · 2026-10-05
- Triton GPU 编程系统课:从 H100 架构讲到 FlashAttention — kalyan_kpl · 2026-10-05
- MICCAI 2026 收录 1167 篇论文,埃尔朗根团队独中 11 篇 — maier_ak · 2026-10-05