Recursive Synthesis for Long-Horizon Terminal Tasks
Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang
cs.AI, cs.LG
2026-08-06
腾讯混元的 RST 从 639 条种子出发递归扩写 15 轮,造出 37,484 条可验证终端任务,每条约 0.05 美元;用这些数据做 SFT 和 PPO,Qwen3.5-27B 在三个终端基准上相对涨 20% 到 41%。
训练一个能在命令行里连续操作几十步的终端 agent,卡在数据上。一条高质量的长程任务要把指令、环境、参考解答、验证器四样东西保持互洽,人造一条动辄几百到几千美元;直接让大模型生成,又常常把这四样的依赖关系搞断。腾讯混元前沿团队要解决的,是怎么低成本、可验证地批量造出越来越难的长程终端任务。
RST 是「递归可验证合成」。每轮从上一轮已验证的任务里挑种子,核心是先扩写参考解答,往 solve.sh 里加新步骤和更严的断言,再回头对齐验证器和公开指令去匹配新流程,最后放进全新沙盒跑一遍。参考解答必须能通过私有验证器(oracle validity),且验证器查的每条要求都得在公开指令或工作区里找得到(contract validity)。通过的就成了下一轮的种子,也直接进强化学习的任务池;在任务上跑出的成功轨迹留作 SFT 数据。团队定义了 40 个改写算子,分五族(配置与控制态、数据与清单、文件系统绑定、构建与缓存、运行时与诊断),并对父系、类别、改写族、批次设上限,防少数模式吃掉整个池子。
15 轮从 639 条种子造出 37,484 条任务,每条约 0.05 美元(每千条约 50 美元)。难度是真涨上去了:
| 指标 | R1 | R15 |
| 中位解答行数 | 67 | 374(5.6 倍) |
| 中位命令数 | 40 | 244(6.1 倍) |
| DeepSeek-V4-Pro pass@4 | 90% | 2.5% |
| 中位部分得分 | 0.97 | 0.17 |
指令长度只从 85 涨到 122 词(1.4 倍),涨的是可执行工作量,不是提示词长度。下游训练也见效:用 Qwen3.5 自采轨迹做 SFT,Qwen3.5-27B 在 Terminal-Bench 2 从 41.2% 升到 47.9%,在 Terminal-Bench Hard 从 22.7% 升到 28.3%;再上 agentic PPO,Qwen3.5-27B-RL 在三个基准分别到 49.44%、32.00%、22.07%,相对基础模型涨 20.0%、41.2%、21.9%。最大相对涨幅出现在独立构造的 Terminal-Bench Hard 上,说明迁移有效。
它给「合成训练数据会不会越合越废、模式坍缩」这个普遍担心交了一份还不错的答卷。15 轮下来,通过率和验证率没掉,领域分布、改写族熵、算子覆盖都稳住,没被少数父系或算子吃掉。对做 agent 训练的人,这是一条可复用的造数据流水线:种子任务可换成任意领域,生成模型也可换。它还顺带证明了一个反直觉的点,任务难度可以靠加可执行工作来提升,而不是靠把指令写长,这对自动评估更友好。
合成靠 DeepSeek-V4-Pro 当生成器,任务难度上限受它能力制约。论文里 pass@4 到 R15 跌到 2.5%,但没说再往后会不会撞墙,作者称「没观测到上限」,可这只是 15 轮的观测。后期任务的最近邻相似度中位数从 0.22 升到 0.46,高相似尾巴(p95 达 0.70)在变厚,作者自己承认需要去重。训练收益仍追不上 DeepSeek-V4-Pro,后者在三个基准上是 51.68/36.00/30.00,说明天花板还远。