腾讯混元发布 T1:122B MoE 模型专攻长时程终端任务

Tencent-Hunyuan · hf · 2026-09-11

腾讯混元团队在 Hugging Face 发布 T1(T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks),一个 122B 参数的 MoE 模型,通过强化学习训练,在云端沙箱中执行长时程(long-horizon)终端任务。

官方称其依靠稳定的 actor-critic 优化与分布外(OOD)训练,在相关基准上取得 SOTA 成绩。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →