新论文称独立扩展长期记忆更省参数,17项任务胜过12B模型
burny_tech · x · 2026-08-04
预训练长期记忆模块比继续放大主干更省参数
这篇论文 《Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory》 提出把长期记忆从解码器主干中拆出来独立扩展:先离线训练一个参数化记忆模块去拟合 kNN 检索分布,再通过 next-token 概率插值接到冻结的 decoder 上。
关键结果包括:
- Pythia-410M + 6.9B 记忆模块 在 17 个任务 上的平均分超过 Pythia-12B,但总参数量少 39%。
- 在 Qwen3 Base 的不同规模上,1.7B 领域记忆 在生物、法律、金融三个领域的平均分都能提升 9 分以上。
- 作者还针对大规模检索的成本瓶颈,做了分布式 Faiss 建库与稀疏批量加载 kNN 分布的工程处理。
整体结论是:独立扩展预训练记忆,可能比单纯放大主干模型更具参数效率。
「研究」频道最新
- Gemini Robotics ER 2 开始自动标注 6.9 万条机器人视频 — DynamicWebPaige · 2026-08-04
- MerchantBench 用 365 天电商仿真测试 LLM agent — dair_ai · 2026-08-04
- 83 Sciences 称靠未发表和失败实验数据两个月找到新材料 — ycombinator · 2026-08-04
- 神经算子通过偏离物理约束提前预警临界点 — AnimaAnandkumar · 2026-08-04
- SALT 用 trie 管聊天记忆,但主题检索仍会取回太多内容 — No_Sky9786 · 2026-08-04
- 为什么“有趣”很难只靠示例学出来 — dioscuri · 2026-08-04