Applied Compute 分享企业级 Agent 持续学习:在线提示修复格式与效率

AI Engineer · youtube · 2026-08-13

Applied Compute 的 Samuel Denton 在演讲中分享了如何将持续学习引入企业级 Agent。他们致力于将 SWE bench 上的提交时机从 80 轮压缩至 40 轮,并成功将工具调用率从 22% 提升至 60%。

蒸馏框架的四象限

Denton 提出了一个分析网格:一轴是轨迹的“在线程度”(从静态的生产数据转储到训练服务一体化);另一轴是“提示来源”(静态先验或基于模型当前动作的动态构建)。他们主要攻克其中两个角落:离线提示+离线轨迹无需可重放环境,第一天即可从数据转储中改进 Agent;在线提示+在线轨迹则拥有更高的性能上限。

动态提示的胜利

在一个需要特殊超链接格式的客户案例中,直接奖励正确格式或对其进行微调都会损害模型的编码能力。而通过针对每次 rollout 编写的动态提示,将格式正确率从 15% 跃升至 80%。

实践机制

为了让动态提示真正生效,他们采用两个核心机制:一是让评估器选择提示插入 rollout 的位置,且仅蒸馏接下来的几步,因为学习信号会随距离衰减;二是对学习的 token 进行掩码处理,剔除教师模型对连词等无关词汇的强烈偏好。整个过程完全不需要标准答案进行蒸馏。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →