新方法 Latent On-Policy Self-Distillation 让 Agent 自我进化
burkov · x · 2026-08-20
来自北邮、新国大、上交大的研究者提出“Latent On-Policy Self-Distillation”方法,旨在让 AI 智能体将成功的尝试转化为持久的改进。
核心机制:
- 学生模型尝试任务,另一个相同的模型副本作为教师。
- 教师接收过去相关尝试的压缩向量(latent tokens),并指导学生的每一步预测。
- 引入约束确保教师比学生提供更多信息,防止向量退化。
- 部署时仅需学生模型,无需存储经验。
效果: 在工具使用和编码测试中,该方法在三个相对较小的语言模型上超越了现有方法。
「编程与Agent」频道最新
- 微软 Build 演讲:构建能构建代码的工具 — steipete · 2026-08-20
- Chad IDE 集成社交媒体,填补代码生成空档 — brianryhuang · 2026-08-20
- OpenAI 销售团队采用 Agent 工作流后效能大增 — maggie_hott · 2026-08-20
- SwarmOS 可修改 AOSP 实现系统级 Agent — bingxu_ · 2026-08-20
- Outworked 把 Claude 变成 Mac 团队,写代码跑任务 — tom_doerr · 2026-08-20
- 将 Agent 元数据嵌入 PNG 实现卡片分享 — morqon · 2026-08-20