Perplexity 用提示引导自蒸馏后训练,工具调用错误降 21%
inductionheads · x · 2026-09-23
Perplexity 发布新研究,介绍其多阶段后训练流程:SFT、RL、RFT,以及最后阶段的在策略自蒸馏(OPSD)。动机是 RL 环境虽真实,但仍缺乏生产环境中真实用例的多样性与复杂度,sim2real 存在差距。
OPSD 的核心是从「有问题轨迹」中学习:
- 从用户后续对话中的负反馈、以及工具调用报错中构造提示(hints);
- 用自蒸馏方式修正这些错误轨迹;
- 训练方法上组合 RFT(forward KL/CE)与 OPSD(reverse KL),同时学习成功与失败轨迹。
团队用该方法对 Computer 模型做了后训练(论文中以 GLM-5.2 为例),线上 A/B 测试显示后训练的 checkpoint 相比早期版本工具调用失败率相对降低 21.2%。
所属事件:Perplexity 公开 Computer 模型提示引导自蒸馏训练法(5 条相关)→
「编程与Agent」频道最新
- Framer 推出 Skills:让 AI Agent 学会并复用你的设计系统与工作流 — soleio · 2026-09-23
- AI 测试初创 TesterArmy 融 120 万美元种子前轮,瞄准编码 Agent 时代测试缺口 — fernandorojo · 2026-09-23
- Anthropic 发布 Claude Opus 5.5:多数任务对标 Fable 5.1,成本降 40% — jyangballin · 2026-09-23
- Shopify 弃 React Native 回原生,RedMonk:Agent 让大规模重写变可行 — rseroter · 2026-09-23
- Hamel Husain 系统讲解 AI 产品评测体系:超越虚荣分数的实战指南 — HamelHusain · 2026-09-23
- 两个私人 AI 约咖啡对不上号:Agent 互操作缺一个通用协议 — signulll · 2026-09-23