TMax用学生模型筛训练样本

Shahules786 · x · 2026-07-14

作者说明,TMax 是一个面向 terminal agents 的 generator/student pipeline。 ### 核心机制 - 任务先由生成器产出 - 只有当更小的 student 模型至少在 `pass@16` 下做对一次,任务才会被保留 - 没有学习信号的样本会被丢弃 - 最终留下的数据会被整理成适合 GRPO 训练的形式 作者把它视作一种“先生成、再验证、再训练”的数据筛选管线。

所属事件:TMax通过学生模型筛选机制优化终端智能体(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →