T1 强化学习训练终端 Agent:Terminal-Bench 2.1 通过率 43.8% 升至 64.0%

heghbalz · x · 2026-09-11

研究者发布 T1,一个 122B 总参数、10B 激活的 MoE 模型,通过强化学习训练它在云端沙箱里操作真实终端,单任务可持续 300+ 轮工具调用。

核心结果

训练配方要点

论文、项目页与数据集已在 Hugging Face 开放。作者指出这与 DeepSeek-V4.1 的观察一致:更好的数据与环境管线能在既有 RL 方法上释放大幅收益。

所属事件:腾讯混元发布 T1:RL 训练终端 Agent(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →