Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory
Taeil Kim, Kangsan Kim, Sung Ju Hwang
cs.AI, cs.LG
2026-08-07
KAIST 的 AMD 把大模型 agent 的成功轨迹提炼成任务/子任务/函数三层记忆,无需训练注入 4B 至 8B 学员,Qwen3-4B 在 AppWorld 上逼近老师 GPT-5-mini、涨 34.5 个点。
记忆机制让 agent 复用过去成功的行为模式、绕开已知的坑,在 GPT-4 这类大模型上已被验证有效。但小模型(4B 至 8B)用记忆有一个先天的死结:它自己任务成功率低,跑出来的轨迹大半是失败的,记忆库里充斥着错误经验,真正能借鉴的成功样本少得可怜。
更隐蔽的问题是,即便直接把大模型(老师)的成功记忆塞给小模型(学员),效果也接近没塞。作者把这种现象叫 capability gap(能力鸿沟):老师可能记着「先登录再播音乐」这种高层策略,可学员连登录这一步本身都不会执行;小模型的 in-context learning 与指令遵循又弱,即便把老师的经验原样摆在眼前,也消化不了。这跟经典知识蒸馏里「老师太强、学生跟不上」是同一个病,只是搬到了 agent 记忆的场景。
AMD 不改学员参数,只在推理时给它三档不同粒度的记忆,全部从老师的成功轨迹里提炼:
一个关键设计是「表征要配粒度」:高层的 Workflow 用自然语言最好,底层的 Subtask 与 Function 用代码最好(把代码换成纯文本描述,AppWorld 掉到 26.19%)。检索数 k=1 就是最优,加大反而掉点,因为小模型扛不住更多干扰上下文。Function 记忆只在出错时触发,正常执行时不增加上下文负担。
四个学员模型(Qwen3-4B/8B、Gemma4-E4B、Llama3.1-8B),老师统一是 GPT-5-mini,AMD 全面超过零基线和三个记忆基线(ReasoningBank、MemP、SASM),后者经常比零基线还差:
| 学员 | AppWorld 零基线→AMD | BFCL V3 | ToolSandbox |
| Qwen3-4B | 14.88% → 49.40% (+34.52) | 15.50% → 38.50% | 16.28% → 20.16% |
| Gemma4-E4B | 24.40% → 54.17% | 37.25% → 46.00% | 18.22% → 21.71% |
| Qwen3-8B | 25.60% → 51.79% | 38.00% → 45.50% | 20.16% → 25.58% |
三个基准上平均涨 27.2、11.2、3.4 个百分点。更关键的是 Gemma4-E4B 和 Qwen3-8B 在 AppWorld 上反超了老师 GPT-5-mini(54.17%、51.79% 对 50.00%),说明学员据为己用的是可迁移的决策模式,而非死记老师的轨迹。消融显示三层记忆里 Subtask 贡献最大(单独加在 Workflow 上,Qwen3-4B 再涨 25 个点),用学员自己产生的记忆几乎等于没用。收益在 4B 处最高,模型够强能用得上、又还有大量提升空间;到 8B/14B 收益递减。AMD 还把交互轮次压到接近老师水平(Qwen3-4B 在 AppWorld 从 23.8 轮降到 14.9 轮,老师是 10.1 轮)。
对想给小模型加 agent 能力又不想训练的人,AMD 给了一条可复用的路子:记忆库离线建好、推理时只读,四个开源模型即插即用,代码与项目页都公开。它把「大模型的经验」做成了小模型能直接消费的结构化资产,而不是一段看不懂的高层描述,顺便把师生兼容性这个老问题摆到了台面上。
作者自己承认三点:只测了 Python API 与结构化函数调用这类文本工具任务,多模态环境和开放式写代码的场景没验证;记忆是离线建好、推理时冻结的,没法吸收学员自己在线遇到的成败,也应对不了分布漂移;老师不是越强越好,Qwen3-4B 配 GPT-5-mini 反而比配更强的 GPT-5.5 表现好,师生兼容性是个没解决的问题。补一条:三层检索都靠 embedding 相似度加固定阈值,论文补了 cross-split 与 self-excluded 两种隔离实验来证明增益不是来自「用自己的记忆答自己」,但都还在同分布里切,跨域泛化没怎么压测。