ai& 开源 TermGrade:千个终端 RL 环境,助 Terminal-Bench 提升 3.1 分
DavidBennett__ · x · 2026-10-09
日本 AI 公司 ai& 发布 TermGrade,一套面向终端 Agent 的强化学习资源:包含 1,004 个可执行的 Linux 终端环境(容器 + 指令 + pytest 验证),并用 Kimi-K3、DeepSeek-V4-Pro、GLM-5.2、Qwen3.6-27B、gemma-4-31B-it(含开关推理两种配置)共 6 种模型配置完成 36,144 次试跑(约 45 亿 token、2 万小时算力),连约 1.4 万次失败记录也全部公开。
核心发现与方法:
- 每个任务标注的不是人工难度标签,而是各模型实测成功率;不同模型「约 50% 成功率」的任务集合差异巨大,RL 训练任务筛选必须用目标模型实测,不能借用其他模型的结果。
- 模型最易从约 50% 成功率的任务中学习,因为这类任务能同时提供正反两类对比信号。
- 基于 gemma-4-31B-it 实测筛选出的任务做 RL,在 Terminal-Bench 2.1 上提升 3.1 分,同一配置重复 5 次训练平均 +2.1 分且全部超过基线。
项目开源了任务集、全部试跑记录、训练任务清单与 checkpoint,评估—筛选流水线设计为低成本可重跑,以便随模型版本迭代重新选题。
所属事件:TermGrade 开源:千余个终端 Agent RL 环境与训练配方(3 条相关)→
「编程与Agent」频道最新
- TermGrade 开源 1004 个可执行 RL 环境,训练 Gemma 提升 Terminal-Bench 3.1 分 — DavidBennett__ · 2026-10-09
- Rust 单二进制蜂窝网关开源:给 AI agent 真实手机号收发短信语音 — TheZachMueller · 2026-10-09
- work-humanizer:去 AI 味但不改承诺的职场写作 Skill,附实测证据 — PawelHuryn · 2026-10-09
- 实测人味改写工具全翻车:55K 星 humanizer 会凭空承诺退款 — PawelHuryn · 2026-10-09
- 7 段 Grok 提示词,把 AI 味文本改成真人手笔 — JafarNajafov · 2026-10-09
- AI agent 十分钟从需求到上线,开发者感叹一年前还需开会规划 — threepointone · 2026-10-09