新方法 Latent On-Policy Self-Distillation 让 Agent 自我进化

burkov · x · 2026-08-20

来自北邮、新国大、上交大的研究者提出“Latent On-Policy Self-Distillation”方法,旨在让 AI 智能体将成功的尝试转化为持久的改进。

核心机制:

效果: 在工具使用和编码测试中,该方法在三个相对较小的语言模型上超越了现有方法。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →