T1 强化学习训练终端 Agent:Terminal-Bench 2.1 通过率 43.8% 升至 64.0%
heghbalz · x · 2026-09-11
研究者发布 T1,一个 122B 总参数、10B 激活的 MoE 模型,通过强化学习训练它在云端沙箱里操作真实终端,单任务可持续 300+ 轮工具调用。
核心结果
- Terminal-Bench 2.1:base 43.8% → SFT 49.4% → RL 后 T1 64.0%,后训练相对提升 46.1%
- Long-Horizon Terminal-Bench 达 27.9%,超过 GLM-5.1 等模型
训练配方要点
- 用 PPO 在 15K 条经审计的任务上训练,采用逐断言验证的密集过程奖励,让「失败任务中的部分进展」也能获得信用
- 热启动 critic 稳定 actor-critic 训练;TITO 构造与 rollout routing replay 在训练时保留采样的 token 与专家路由,把训练-推理 log 概率差从 0.021 降到 0.013
- 训练语料与 Terminal-Bench 2.1 完全不相交,证明提升来自真实能力迁移而非过拟合
论文、项目页与数据集已在 Hugging Face 开放。作者指出这与 DeepSeek-V4.1 的观察一致:更好的数据与环境管线能在既有 RL 方法上释放大幅收益。
所属事件:腾讯混元发布 T1:RL 训练终端 Agent(2 条相关)→
「编程与Agent」频道最新
- CopilotKit 开源 OpenBot 获 4.7k 星,主打可完全自有的 AI 同事 — Roger_M_Taylor · 2026-09-11
- 开发者借 OpenAI Astra 做出 Three.js 图形 demo:渲染数学门槛正被 AI 拆掉 — algo_diver · 2026-09-11
- 38.3k 星开源项目:为 Claude Code 打造 39 种编辑级图表设计技能 — adnan_hashmi · 2026-09-11
- 省 Claude 用量的 14 个技巧:更少 token 干更多活 — aitrendz_xyz · 2026-09-11
- 用 Codex 经 MCP 驱动 DaVinci 剪片:修剪、音频、字幕全交给 AI — _AustinCalvert_ · 2026-09-11
- 同一句话测四款 spec 工具:从想法到可开工差距达 6 倍 — SSShken · 2026-09-11