Long-Horizon Terminal-Bench 更新长时程终端代码评测榜
Muennighoff · x · 2026-07-24
一张截图展示了一个新的 Long-Horizon Terminal-Bench 长时程终端评测榜单,当前共有 21 个条目,按 pass rate 排名。
要点包括:
- 榜单顶部的 agent 栈显示为 Terminus-2。
- 当前前几名依次是 Grok 4.5、Claude Fable 5、Claude Opus 4.8、Claude Sonnet 5 和 GPT-5.6-sol。
- 页面筛选条件为 Solved ≥ 0.95,说明这是在看高完成度、长时间运行的终端任务表现。
帖子正文很短,但结合配图来看,这是一个新的代码/终端型智能体评测,重点在衡量模型处理长链路任务的能力。
「编程与Agent」频道最新
- ICAE-Bench 把 coding agent 放进模糊需求做项目场景 — Zhongyuan Peng · 2026-07-24
- Predictive Divergence Masks 让 LLM RL 更新更贴近 trust region — Xiangxin Zhou · 2026-07-24
- 腾讯 WorkBuddy Bench 覆盖代码网页办公与安全评测 coding agent — tencent · 2026-07-24
- NVIDIA 把 LLM agent 直接做成 Python 对象 — nvidia · 2026-07-24
- Claude Code 用户做出 mcp-guard,拦住 MCP 泄露 .env — TastePrestigious4419 · 2026-07-24
- 开发者用 Claude 搭建 3D 城市生成与天气引擎 — repligate · 2026-07-24