Perplexity 用提示引导自蒸馏后训练,工具调用错误降 21%

inductionheads · x · 2026-09-23

Perplexity 发布新研究,介绍其多阶段后训练流程:SFT、RL、RFT,以及最后阶段的在策略自蒸馏(OPSD)。动机是 RL 环境虽真实,但仍缺乏生产环境中真实用例的多样性与复杂度,sim2real 存在差距。

OPSD 的核心是从「有问题轨迹」中学习:

团队用该方法对 Computer 模型做了后训练(论文中以 GLM-5.2 为例),线上 A/B 测试显示后训练的 checkpoint 相比早期版本工具调用失败率相对降低 21.2%。

所属事件:Perplexity 公开 Computer 模型提示引导自蒸馏训练法(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →