TermGrade 开源发布:1004 个终端环境、3.6 万条带评分 Agent 轨迹
huggingface · x · 2026-10-09
ai& Research 在 Hugging Face 发布 TermGrade:面向 RL 训练与测试的 1004 个终端环境,每个都是带 pytest 自动验证的真实 Linux 任务,并保留全部 36,144 次尝试轨迹(含 14,234 次失败),由 Kimi-K3、DeepSeek-V4-Pro、GLM-5.2、Qwen3.6-27B、gemma-4-31b-it 六个模型逐任务打分,给出实测通过率而非人为难度标签。
- 关键发现:难度因模型而异——某模型 50% 通过率的任务,对另一模型大多是不同集合,因此要针对目标模型打分
- 用「半通过任务」训练 gemma-4-31b-it,Terminal-Bench 2.1 提升 3.1 分,同配方 5 次重复训练均胜基座
- 训练数据按实测选择,全部环境、轨迹、训练切分与 checkpoint 开源;背后 2 万小时算力、45 亿 token rollout
- 环境、博客与模型已在 Hugging Face 开放
所属事件:TermGrade 开源发布:千余个终端 Agent RL 训练环境(2 条相关)→
「编程与Agent」频道最新
- 把 3D 航海游戏直接塞进 X 帖子,Claude Opus 一把造出 — prasenx · 2026-10-09
- edith-1 专抓 agent 失败与 reward hacking,准确率超 Sonnet-5.5 成本仅 1/274 — xennygrimmato_ · 2026-10-09
- edith-1 架构补充:概率过滤器初筛,失败轨迹交由昂贵 judge 深查 — xennygrimmato_ · 2026-10-09
- Agent 基础设施初创 Solari 发布:浏览器 8ms 启动,比 Browserbase 快 10 倍 — Scobleizer · 2026-10-09
- Splash 1.3.0 上线:SSD 卸载让本地 agent 首 token 从 19 秒降到 1 秒 — BeidiChen · 2026-10-09
- OpenAI 编码 Agent steering 改为即时响应,并放出 ultrafast 新版 — Dimillian · 2026-10-09