清华与 Qwen 团队用轨迹重建环境训练 Agent
清华大学与 Qwen 团队发布论文《Terminal-Universe》,提出一种不同于传统轨迹模仿的 Agent 数据构建方法:把已有的 agent 轨迹转化为可复用、可执行的代码环境来训练模型,而不是简单复制原 agent 修 bug 的做法。实验显示该方法效果反超直接模仿原轨迹,在 Terminal-Bench 上将成绩提升至 58.1%。
2026-09-10 ~ 2026-09-10 · 2 条相关
- 清华+Qwen团队:重建代码环境训练Agent,Terminal-Bench提升至58.1% — rohanpaul_ai · 2026-09-10
- 清华与 Qwen 团队新法:旧 agent 轨迹重建环境,胜过模仿学习 — rohanpaul_ai · 2026-09-10