Long-Horizon Terminal-Bench 更新长时程终端代码评测榜
Muennighoff · x · 2026-07-24
一张截图展示了一个新的 Long-Horizon Terminal-Bench 长时程终端评测榜单,当前共有 21 个条目,按 pass rate 排名。
要点包括:
- 榜单顶部的 agent 栈显示为 Terminus-2。
- 当前前几名依次是 Grok 4.5、Claude Fable 5、Claude Opus 4.8、Claude Sonnet 5 和 GPT-5.6-sol。
- 页面筛选条件为 Solved ≥ 0.95,说明这是在看高完成度、长时间运行的终端任务表现。
帖子正文很短,但结合配图来看,这是一个新的代码/终端型智能体评测,重点在衡量模型处理长链路任务的能力。
「编程与Agent」频道最新
- 用 Agent 造小分类器:19 万文档标注成本仅 0.7 美元 — vanstriendaniel · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11