新框架 PILOT 让 Agent 实现运行时自我修正

rohanpaul_ai · x · 2026-08-31

传统 Agent 的自我改进往往在任务结束后才发生,而新论文提出的 PILOT 框架将学习过程移至运行时内部。它采用“工作-监督”分离架构:工作者负责执行任务,监督者实时监控轨迹并能介入、中止,将成功的程序或失败模式写入持久技能库。

实验显示,在 Terminal-Bench 2.0 的 20 次自我改进迭代中,使用 GLM-5.1 和 Kimi-K2.6 的最佳通过率分别提升了 14.6 和 12.4 个百分点,且输出 token 数显著减少。这种机制改变了长周期 Agent 的改进循环,允许在当前尝试中即时测试并应用新经验。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →