Perplexity 用提示引导自蒸馏训练 agent,失败率降至 1.77%
perplexity_ai · x · 2026-09-23
Perplexity 官方公开其 agent 训练方法,解决 rejection sampling fine-tuning 只模仿成功会话、会强化侥幸恢复的错误并丢弃失败会话证据的问题。
- 方法:用 rejection sampling fine-tuning 模仿成功会话中的有效步骤,再用 hint-guided self-distillation 修正错误;GLM 5.2 对同一轮记录用相同权重打分两次——一次带纠错提示、一次不带,训练使无提示下的 next-token 预测对齐带提示的结果。
- 去后见之明偏差:标注管线把反馈追溯到具体决策,并检查每条纠错提示只使用犯错前已可得的信息。
- 数据:加提示后,同一模型避免原始失败的比例从 75.1% 提升到 93.7%;另一项线上测试中,工具调用失败率在两个训练版本间从 2.24% 降到 1.77%,且推理时无需提示。
- 训练先在合成环境做强化学习,再用真实会话补充设计场景之外的失败;采样管线排除含 PII 的会话及用户选择退出训练的数据。
所属事件:Perplexity 公开 agent 训练法,失败率降至 1.77%(3 条相关)→
「编程与Agent」频道最新
- OpenAI 上线 Prompt 缓存仪表盘:可查缓存命中率与失效原因 — OpenAIDevs · 2026-09-23
- Firecrawl 用 Agent 群给互联网编目,Alexandria 获 7500 万美元 B 轮 — devdigest · 2026-09-23
- 让听者决定何时打断:新研究重新定义智能体通信效率 — lileics · 2026-09-23
- 让听众学会打断:CMU×Meta 方法砍掉多智能体 32.2% 通信成本 — lileics · 2026-09-23
- 编码 Agent 用 as any 修 TS 报错?可能在悄悄消灭编译反馈 — gethackteam · 2026-09-23
- 别再审计划了:让模型一次交 3 个端到端方案 — alex_frantic · 2026-09-23