腾讯混元发布 T1:RL 训练终端 Agent
腾讯混元团队在 Hugging Face 发布 T1,一个总参数 122B、激活 10B 的 MoE 模型,通过强化学习在云端沙箱中操作真实终端执行长时程任务,单任务可持续 300+ 轮工具调用。在 Terminal-Bench 2.1 基准上,通过率从 43.8% 提升至 64.0%,显示 RL 训练可显著增强 Agent 的长程终端操作能力。
2026-09-11 ~ 2026-09-11 · 2 条相关
- 腾讯混元发布 T1:122B MoE 模型专攻长时程终端任务 — Tencent-Hunyuan · 2026-09-11
- T1 强化学习训练终端 Agent:Terminal-Bench 2.1 通过率 43.8% 升至 64.0% — heghbalz · 2026-09-11