TMax用学生模型筛训练样本
Shahules786 · x · 2026-07-14
作者说明,TMax 是一个面向 terminal agents 的 generator/student pipeline。 ### 核心机制 - 任务先由生成器产出 - 只有当更小的 student 模型至少在 `pass@16` 下做对一次,任务才会被保留 - 没有学习信号的样本会被丢弃 - 最终留下的数据会被整理成适合 GRPO 训练的形式 作者把它视作一种“先生成、再验证、再训练”的数据筛选管线。
所属事件:TMax通过学生模型筛选机制优化终端智能体(2 条相关)→
「编程与Agent」频道最新
- Claude Code 提示词优化器在执行前注入上下文 — tom_doerr · 2026-07-21
- DavidAU 协作版据称提升了 Qwen 3.6 27B 的长上下文 Agent 表现 — My_Unbiased_Opinion · 2026-07-21
- 开发者问:20 美元预算下,Claude、Cursor 还是 GPT 最适合做网站 — Upset-Farm-7380 · 2026-07-21
- Claude 长任务报错后通常还能救回已完成进度 — doodlestein · 2026-07-21
- Unity 推出终端原生 CLI,继续免费支持 MCP — jasonkneen · 2026-07-21
- 模型外层 harness 可能决定一半体感 — max_paperclips · 2026-07-21