TimeEvo 让时序 Agent 自进化:按失败聚类自动造工具,全任务提分
Jie Yang · hf · 2026-09-29
时序 Agent 通过调用外部工具回答分析问题,但工具库通常由人事先给定。作者发现这套设置的两个失败模式:
- 人机工具错配:21 个专家策划的工具在一些任务上有帮助,在另一些任务上反而有害,在所有 backbone 下都降低了异常检测准确率;
- 静默伤害:一轮通用自修订改动了 147 个答案、其中 56 个被改坏,而最终分数变化不足 1 分。
根因在于:工具是否有用要在运行时逐题判断,而工具却是事前提供、靠单一平均值评估的。
TimeEvo 的方案:把 Agent 诊断出的失败聚类成能力缺口,为每个缺口规划度量、合成仅含证据的工具,并通过成对准入门槛决定是否纳入候选工具库。
实验:在 10 个时序 QA 任务、3 个 backbone 上,从空工具库出发,TimeEvo 在每个任务、每个 backbone 上都提升了准确率;而且用便宜模型长出的工具库装进更强模型后仍然有效。代码已开源。
「编程与Agent」频道最新
- 审计数千次 Agent 回放:80% 在推理中幻想不存在的评分器 — jonas__m · 2026-09-29
- YC 黑客松冠军项目 QM Motion:给编码 Agent 加上时间感知抓 UI 动效 Bug — garrytan · 2026-09-29
- 月活百万的 AIHOT 站开源,开发者晒全套 AI 协同重写流程 — dotey · 2026-09-29
- Sonnet 5.5 起草、Opus 5.5 攻坚:工程师的混用省钱工作流 — every · 2026-09-29
- 用 Claude + 虚幻引擎复原著名 UFO 事件,虚拟制作新玩法 — playertariat · 2026-09-29
- Claude 严格遵守限流规范:跑个测试要等 35 小时 — julianharris · 2026-09-29