实验:学到的记忆表可跨模型尺寸迁移,加适配器后达 71.7%
sn2006gy · reddit · 2026-09-27
作者测试了一种叫 Engram 的外部模型记忆——一张可查询的关联表,而非存于主权重中的事实。将三个小模型在合成 key-to-symbol 任务上学到的记忆表导出,接到同家族两个不同尺寸的模型上。结果喜忧参半:表在两个模型间逐字节一致;直接使用(不做接收端训练)与无记忆基线无异,准确率仅 3.125%;为每个接收端训练小型适配器后,一组留出措辞上平均准确率达 71.7%,但另一组措辞上仍停留在 3.125%,6 个适配器运行中有 1 个未达预设 50% 阈值。这初步证明学得的记忆表可跨尺寸迁移并在本地微调后变得有用,但距通用、可靠的知识迁移还很远——任务合成、同家族模型、性能高度依赖措辞。若在更现实任务上成立,未来或可不重训整个模型就能复用/更新记忆组件。代码与协议已开源。
「研究」频道最新
- 多智能体共谋审计论文 Colosseum 获 NeurIPS 2026 伦理与安全track录用 — niloofar_mire · 2026-09-27
- MIT 演讲:不讲 Transformer,从第一性原理看 LLM 为何有效 — vishalmisra · 2026-09-27
- 微软发布 ProgramDistill:网页应用蒸馏为可验证 SWE 训练任务 — _akhaliq · 2026-09-27
- MIT 研究者发布伪随机码综述:AI 内容水印的核心密码学原语 — matthew_d_green · 2026-09-27
- 实测开源模型「决策打分」:比生成概率快 7 至 54 倍 — vykthur · 2026-09-27
- Judea Pearl 90 岁研讨会:科学哲学家共论因果与反事实 — yudapearl · 2026-09-27