Terminal-Bench 被指比多数编程基准覆盖更全面
zainhas · x · 2026-07-24
这条帖子在讨论:把常见 coding benchmark 的任务拆开看,会发现很多其实都很单一;相较之下,Terminal-Bench 的任务覆盖最丰富。
- 许多 benchmark 被描述成 “one-dimensional”,也就是任务类型过于集中。
- Terminal-Bench 覆盖的工作更广:修 bug、做功能、审计、算法实现、性能优化、重构 等都在里面。
- 配图进一步对比了多个 benchmark 的任务类别分布,显示有些基准的任务高度集中,而 Terminal-Bench 2.1 更像真实工程场景。
所属事件:主流AI编程基准被指任务类型过度集中(3 条相关)→
「编程与Agent」频道最新
- Google 和 Gemini Notebook 的 DAG 工作流,主要在提可靠性和延迟 — tokumin · 2026-07-24
- 开发能帮企业赚钱的 Agent API,是当下的致富密码 — eptwts · 2026-07-24
- Grok Build 增加工作流,可并行调度数百个 agent — elonmusk · 2026-07-24
- Blaxel 推出 Agent Drive,为 AI agent 提供共享文件系统 — Scobleizer · 2026-07-24
- Slashskills 迁移新域名并支持 Codex、Cursor — tushaarmehtaa · 2026-07-24
- Browser Use 让 LLM 直接驱动浏览器,专攻登录与 JS 页面 — eyishazyer · 2026-07-24