Harness-Aware Distillation:让小模型学会用 Agent 框架信息的新蒸馏法

omarsar0 · x · 2026-10-07

一篇关于小语言模型 agent 的 harness-aware 蒸馏框架引发关注。核心做法:让大模型(teacher)在带与不带 harness 信息两种条件下分别执行任务,只在二者动作不一致的样本上训练小模型,并过滤掉偏好动作与 harness 记录矛盾的样本对;全程不需要任务奖励或成功标签。

关键结果:

对做小模型 agent 部署的团队,这是一个无需奖励信号、可针对性补足 harness 利用的蒸馏思路。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →