SMRC-SD:解决多轮智能体蒸馏的状态失配问题
Junzhuo Liu · hf · 2026-08-10
多轮智能体在利用成功轨迹进行策略蒸馏时,常面临学生模型当前执行状态与参考轨迹不匹配的困境。为此,研究者提出了 SMRC-SD(状态匹配路由与上下文自蒸馏)方法。
该方法的核心机制:
- 状态匹配路由:在每一轮交互中,验证学生模型的当前状态是否与参考轨迹中的支持状态相匹配,仅在匹配时应用蒸馏,过滤掉缺乏局部指导的步骤。
- 上下文自蒸馏:为匹配的状态构建基于状态的教师上下文,将监督信号扎根于实际达到的状态。
在 ALFWorld 和 WebShop 环境中,该方法显著提升了任务成功率。例如,使用 Qwen3-1.7B 模型时,ALFWorld 成功率从 0.746 提升至 0.865,WebShop 从 0.574 提升至 0.693。
「编程与Agent」频道最新
- 无CUDA经验靠编程智能体拿下GPU优化赛第五 — tokenbender · 2026-08-10
- 非程序员 vibe coding 半年复盘:最大陷阱是 AI 伪装修复 — Tired40s · 2026-08-10
- 单个智能体搞定一切:ReASearch 统一提示词与 ML 工作流优化 — _reachsumit · 2026-08-10
- Sakana AI 总结「AI Scientist」进展:端到端科研自动化 — SakanaAILabs · 2026-08-10
- Codex拒绝修复自身bug,开发者称软件面临风险 — switchplonge · 2026-08-10
- Radar:内置 MCP 服务器的开源 Kubernetes 可视化管理工具 — tom_doerr · 2026-08-10