Agent 训练数据:工具越多越难
Shahules786 · x · 2026-07-14
这条线程讨论了如何生成能真正提升 agent 能力的后训练数据。核心观点是:在企业级多轮长任务里,工具数量会膨胀到非常夸张,单个领域就可能有 100+ 个工具,三个领域合起来轻松超过 300 个,光是把工具列表塞进上下文就会影响任务表现。
线程重点提到三篇论文:
- PlanBench-XL:构造更接近真实场景的工具环境,模拟 agent 在“看不见完整工具集”的情况下工作;
- TMax:面向更难任务进行合成与训练;
- Autodata:用多模型协作来判断任务是否可做、是否可训练。
作者还说,这些论文已经在影响他们内部做法:会从工具图里合成任务,并结合不同能力层级的多个模型来判断任务的可训练性,最终目标是把这些方法整合成一个可定制的自动化数据流水线。
所属事件:PlanBench-XL 探索大规模工具环境下的 Agent 训练(3 条相关)→
「编程与Agent」频道最新
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11
- 浏览器主线程很贵:动画卡顿的真正成本与前端优化实践 — jh3yy · 2026-09-11
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11