Perplexity 公开 agent 后训练法:模仿轨迹+纠错,工具调用失败率降 21%
beffjezos · x · 2026-09-23
- Perplexity 分享其 Computer agent 的后训练研究方法:从真实用户会话中学习,模仿好的操作轨迹,并显式纠正可避免的错误(如错误的工具调用),即使整体轨迹是成功的也做纠正。
- 技术上结合拒绝采样微调(RFT)与提示引导的自蒸馏(hint-guided self-distillation)。
- 线上 A/B 测试显示工具调用失败率降低约 21%。
- 超级智能拥护者 beffjezos 转发并评论:定制模型的后训练(post-training custom models)蕴含巨大红利,但讨论的人还不够多。
所属事件:Perplexity 公开 Computer 模型提示引导自蒸馏训练法(5 条相关)→
「编程与Agent」频道最新
- Matt Shumer 感谢社区贡献,将用 Opus 5.5 升级 NYC Open World — mattshumer_ · 2026-09-23
- Jeffrey Emanuel 发布 Bend2 移植 Claude Skill:Rust 项目自动转译 — doodlestein · 2026-09-23
- 用 Claude Opus 5.5 造出可玩 Game Boy Color,还能跑超级马里奥 — chrisfirst · 2026-09-23
- 开源 Agent 框架 Unreal Agent 发布:成本比 Codex 低 39% — Hesamation · 2026-09-23
- 别直接用 Claude Code,用其 tokens 或 Agent SDK 自己控制环境 — repligate · 2026-09-23
- Sergey Karayev:别再当 AI 智能体的「人肉中转」,让 agent 直接 @ 同事 — sergeykarayev · 2026-09-23