Perplexity 公开 Computer 模型提示引导自蒸馏训练法
9 月 23 日,Perplexity 官方发布其 Computer agent(模型)的后训练研究,核心方法是「提示引导自蒸馏」(hint-guided self-distillation),在线 A/B 测试显示工具调用失败率降低 21.2%,失败率降至 1.77%。训练数据管线排除了含个人身份信息(PII)的会话以及用户选择退出训练的会话,数据治理细节同步公开,值得关注。
已确认
- 官方披露的多阶段后训练流程为 SFT、RL、RFT,以及最后阶段的在策略自蒸馏(OPSD,on-policy self-distillation)。@inductionheads 的转发指出,动机是 RL 环境虽真实,但仍缺乏生产环境中真实用例的多样性与复杂度,存在 sim2real 差距,因此先用合成环境做强化学习,再用真实用户会话训练,以暴露设计场景之外的失败案例。
- 方法动机:@perplexityai 说明 rejection sampling fine-tuning(RFT)只模仿成功会话,会强化侥幸恢复的错误并丢弃失败会话中的证据。新方法结合 RFT 与提示引导,从真实用户会话中学习,模仿好的操作轨迹,并显式纠正可避免的错误(如错误的工具调用)——即使整体轨迹最终成功,也对其中的错误做纠正,让模型从自身错误中学习。
- 在线 A/B 测试结果:较晚训练的 checkpoint 工具调用失败率降低 21.2%,失败率降至 1.77%。
- 数据管线:明确排除包含 PII 的会话及用户选择退出训练的会话。
为什么重要
- 该方法给出了从生产环境真实会话中持续改进 agent 的可复用范式,弥补合成 RL 环境与真实用例之间的差距。
- 显式纠正成功轨迹中的隐藏错误,突破了「只学成功案例」这一 RFT 常见局限,对其他 agent 团队有直接参考价值。
- 同步公开的数据排除规则(PII、用户 opt-out)展示了 agent 训练中数据治理的一种实践。
2026-09-23 ~ 2026-09-23 · 5 条相关
一手来源
- Perplexity 用提示引导自蒸馏训练 Computer 模型,工具调用失败率降 21.2% — perplexity_ai ·
- Perplexity 用提示引导自蒸馏训练 agent,失败率降至 1.77% — perplexity_ai ·
- Perplexity 披露训练数据管线:排除含 PII 及用户拒绝训练的会话 — perplexity_ai ·
- 【源头】Perplexity 用提示引导自蒸馏训练 Computer 模型,工具调用失败率降 21.2% — perplexity_ai · 2026-09-23
- 【源头】Perplexity 披露训练数据管线:排除含 PII 及用户拒绝训练的会话 — perplexity_ai · 2026-09-23
- 【源头】Perplexity 用提示引导自蒸馏训练 agent,失败率降至 1.77% — perplexity_ai · 2026-09-23
- Perplexity 公开 agent 后训练法:模仿轨迹+纠错,工具调用失败率降 21% — beffjezos · 2026-09-23
- Perplexity 用提示引导自蒸馏后训练,工具调用错误降 21% — inductionheads · 2026-09-23