腾讯混元发布长链路Agent基准
Tencent-Hunyuan · hf · 2026-07-13
腾讯混元发布 Long-Horizon-Terminal-Bench,用于测试 agent 在长链路终端任务上的能力。
这个 benchmark 的设计
- 共 46 个长时任务,覆盖 9 类场景
- 包括:实验复现、软件工程、多模态分析、互动游戏、科学计算等
- 采用 Terminal-Bench 风格,但把任务拆成更细的子步骤,提供密集中间奖励和部分得分
为什么重要
- 任务通常需要数百轮 episode,执行时间从几十分钟到数小时
- 更考验长期规划、长上下文管理、迭代调试,而不是一次性答题
- 平均每个任务消耗 990 万 token、约 231 个 episode、85.3 分钟
结果
- 最强测试模型在部分奖励阈值 0.95 下仅 15.2% pass@1
- 在完全奖励阈值 1.0 下为 10.9%
- 所有模型平均通过率分别只有 4.3% 和 1.7%
作者同时分析了失败模式,并开放了该 benchmark 供后续研究。
所属事件:腾讯混元发布长程终端基准,前沿模型表现不佳(6 条相关)→
「编程与Agent」频道最新
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11