SMRC-SD:解决多轮智能体蒸馏的状态失配问题

Junzhuo Liu · hf · 2026-08-10

多轮智能体在利用成功轨迹进行策略蒸馏时,常面临学生模型当前执行状态与参考轨迹不匹配的困境。为此,研究者提出了 SMRC-SD(状态匹配路由与上下文自蒸馏)方法。

该方法的核心机制:

在 ALFWorld 和 WebShop 环境中,该方法显著提升了任务成功率。例如,使用 Qwen3-1.7B 模型时,ALFWorld 成功率从 0.746 提升至 0.865,WebShop 从 0.574 提升至 0.693。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →