新论文称独立扩展长期记忆更省参数,17项任务胜过12B模型

burny_tech · x · 2026-08-04

预训练长期记忆模块比继续放大主干更省参数

这篇论文 《Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory》 提出把长期记忆从解码器主干中拆出来独立扩展:先离线训练一个参数化记忆模块去拟合 kNN 检索分布,再通过 next-token 概率插值接到冻结的 decoder 上。

关键结果包括:

整体结论是:独立扩展预训练记忆,可能比单纯放大主干模型更具参数效率。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →