腾讯混元发布 T1:122B MoE 模型专攻长时程终端任务
Tencent-Hunyuan · hf · 2026-09-11
腾讯混元团队在 Hugging Face 发布 T1(T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks),一个 122B 参数的 MoE 模型,通过强化学习训练,在云端沙箱中执行长时程(long-horizon)终端任务。
官方称其依靠稳定的 actor-critic 优化与分布外(OOD)训练,在相关基准上取得 SOTA 成绩。
「编程与Agent」频道最新
- Reddit 发帖征询:客服 Agent 该用什么会话存储与可观测性工具 — Srinidhi_Murali · 2026-09-11
- 开源企业级世界模型 Utopia 走红 GitHub,已获 6.8k Star — adnan_hashmi · 2026-09-11
- OpenAI 员工自建 75 万数据源反馈应用,几乎每天用于产品决策 — simpsoka · 2026-09-11
- 40 条 prompt 用 ChatGPT Astra + Blender MCP 造出浏览器 RTS 游戏 — TheMoonMidas · 2026-09-11
- AI Agent 搭 800 页嵌套代理只为止册 PyPI,还差点烧掉 IP — voooooogel · 2026-09-11
- BAML:一套 API 通吃六语言全模态 LLM 调用的纯开源库 — dosco · 2026-09-11