MAPD 用结构化协议蒸馏 agentic search
Junlin Liu · hf · 2026-07-28
- 这篇工作聚焦agentic search 的蒸馏训练:仅靠结果型 RL 监督太稀疏,而直接模仿轨迹又容易学到“文风”而不是推理能力。
- 作者提出 MAPD(Multi-Agent Protocol Distillation):先用离线多智能体系统拆解问题、检索证据、修复失败搜索,再把探索轨迹整理成结构化的 JSON 协议。
- 训练时,这个协议只喂给学生策略的一个特权分支,从而在稀疏 RL 目标之外提供更密集的蒸馏信号。
- 在 7 个 QA 基准上,MAPD 在 Qwen3-1.7B 上平均成功率达到 39.4%,在 Qwen3-4B 上达到 44.4%,同时缓解了风格漂移和啰嗦退化问题。
「编程与Agent」频道最新
- Claude Opus 5 让浏览器赛车游戏同时跑 4300 个仿真 — AaronMatthews25 · 2026-07-28
- JarvisHub 把画布变成多模态创意代理共享记忆 — Yunlong Lin · 2026-07-28
- Codex 和 Claude Code 浏览器正变成 agent 工具层 — RileyRalmuto · 2026-07-28
- 多智能体实战经验:先控制到一两只,再交给长任务跑 — edgarpavlovsky · 2026-07-28
- 63 家 API 公司里只有一家同时具备三类 agent 接口 — ExtensionPea834 · 2026-07-28
- Reddit 质疑:1.367 亿笔 x402 交易真能证明 agent 采用吗 — heiba_wk · 2026-07-28