长程终端基准 LHTB 发布:Kimi、Minimax 与 GLM 包揽前三
pcuenq · x · 2026-08-19
Hugging Face 上发布了一个新的长程终端基准测试 Long-Horizon Terminal-Bench (LHTB)。该基准旨在评估 LLM Agent 能否在终端中完成 300+ 步操作而不迷失方向,包含 46 个任务,具备抗污染能力,并使用隐藏验证器检查真实状态而非依赖“感觉”。当前排行榜前三名为:冠军 Minimax M3,亚军 Kimi k2.7 Code,季军 GLM 5.2。
「研究」频道最新
- 研究用伊辛模型解释万级 LLM 智能体的观点演化 — SuryaGanguli · 2026-08-20
- SciTaRC 入选 COLM 2026:科学发现瓶颈在执行而非规划 — DanielKhashabi · 2026-08-20
- 学者探讨奖励黑客与过拟合概念区别 — Dr_Atoosa · 2026-08-20
- WARP:利用人体演示数据直接训练机器人移动操作 — danfei_xu · 2026-08-20
- PlanBench-XL 基准:327 任务与 1665 工具的长程评测思考 — Shahules786 · 2026-08-20
- 斯坦福推出 PTXBench:用架构特定 PTX 优化 GPU 内核 — StanfordUniversity · 2026-08-20