清华+Qwen团队:重建代码环境训练Agent,Terminal-Bench提升至58.1%
rohanpaul_ai · x · 2026-09-10
清华与 Qwen 团队新论文提出不同于传统轨迹模仿的 Agent 数据构建方法。
- 核心思路:轨迹只是单个 Agent 修一个 bug 的“录像”,只能复制其做法;论文改为从录像重建真实代码工作区,可在同一环境中注入新 bug、新功能或更强 Agent,批量生成新的可验证训练任务。
- 结论:可复用的执行环境远优于可模仿的轨迹。
- 效果:用该数据训练 Qwen3.5-27B,Terminal-Bench 2.1 从 46.2% 升至 58.1%,EvoCode-Bench v2 MT@4 从 6.3 升至 20.1(Terminus2 设置)。
所属事件:清华与 Qwen 团队用轨迹重建环境训练 Agent(2 条相关)→
「编程与Agent」频道最新
- Instinct 推出「Instinct 间通信」协议:多个 agent 协调线下安排 — mon__lim · 2026-09-10
- Meta Muse 购物 Agent 被过度解读:四步链路仅打通前两步 — KamilKad · 2026-09-10
- opc-skills 开源:给 Claude Code/Cursor 装上 SEO、域名、需求挖掘等一人公司技能 — tom_doerr · 2026-09-10
- 开源 tcut:用 TypeScript 编排终端会话并渲染可复现视频 — samgoodwin89 · 2026-09-10
- 开发者用 GPT-6 与自研工具一条 prompt 生成巴赫风格赋格 — HankYeomans · 2026-09-10
- 开源工作流框架 alchemy 发布重设计的 CLI 与 profiles — samgoodwin89 · 2026-09-10