单任务成本仅 5 美分,递归合成破解智能体训练数据瓶颈
burny_tech · x · 2026-08-14
论文《Recursive Synthesis for Long-Horizon Terminal Tasks》提出了一种名为 RST 的递归验证合成框架,旨在解决终端智能体高质量长周期训练数据成本高昂的问题。
- 核心机制:从少量经验证的种子任务出发,通过扩展参考解决方案、重新对齐验证器与指令、在全新沙箱中验证结果,并将通过的任务作为下一轮的种子,从而实现任务的递归生成。
- 数据规模与成本:经过 15 轮递归,从 639 个种子任务生成了 37,484 个任务,平均成本仅约 $0.05/个。任务难度随轮次显著增加(参考方案代码行数中位数从 67 增至 374 行)。
- 训练效果:使用这些合成任务对 Qwen3.5 进行微调,在 Terminal-Bench 2 等多个基准上性能提升高达 10 个百分点;结合 agentic PPO 训练后,相对基础模型增益达 20%41%。
- 潜力:15 轮后递归未见天花板,合成产率与验证率持续稳定。
「编程与Agent」频道最新
- 超 800 个虚假 AI 技能传播恶意软件 — HaktanSuren · 2026-08-14
- 别等了!本地大模型玩家陷入「等下一代」死循环 — ForsookComparison · 2026-08-14
- 从被动响应到常驻待命:环境感知智能体设计指南 — blaizedsouza · 2026-08-14
- 开源Kubernetes仪表盘Kite:内置AI助手与多集群管理 — tom_doerr · 2026-08-14
- AI开发者:不快速构建优质eval,你将永远追不上 — marktenenholtz · 2026-08-14
- Povio Worklog MCP:用自然语言自动生成工作日志 — modelcontextprotocol · 2026-08-14