个人实验意外发现:结构化知识可直接编译进稀疏外部记忆
sn2006gy · reddit · 2026-09-26
作者在开发小型开源研究工具 tiny-sparse-lab(用于在小模型上做 N-gram/Engram 式条件记忆实验)时意外发现了一条不同于原计划的路线:不通过 LM 训练让模型学出 Engram 表,而是直接从结构化事实「编译」出冻结的稀疏外部记忆,再训练小模型去消费它。
初步受控试点结果(合成实验):
- 正确记忆:1.000
- 不完整记忆:0.5625
- 随机/禁用记忆:0.125
- 冲突记忆:0.000
更大规模的可移植性 harness 跑了 120 组受控 smoke 测试(覆盖 token/字节寻址记忆、语义记忆、两种接收端宽度、多 seed、禁用/随机/损坏/冻结/adapter 等对照组),工件身份校验、接收端隔离、A→B→A 回放等机制全部正常——但这些只是两步更新的冒烟测试,行为准确率全线为 0,证明的是实验机械可行而非记忆可移植。
由此作者提出两个待分离的研究问题:
- 学到的 Engram 可移植性:把与源模型 A 联合训练的记忆表冻结后移植到不同尺寸的模型 B/C,仅训练小型 adapter,看记忆是否独立于主干存在。
- 编译式记忆委派(作者认为更有意思):与其让模型用 SGD 从数万亿 token 里重新发现静态知识,能否直接把 Wikidata/WordNet/公式等结构化知识编译为外部稀疏记忆,让小模型只学语言、路由、组合与推理——即静态世界结构到底有多少必须学进神经网络权重里。
作者明确不宣称推理等于查表,也不声称普遍性结论,并已为两个方向设计了完整对照组实验方案。
「研究」频道最新
- 教授做「词向量高尔夫」游戏,玩着学余弦相似度 — prof_g · 2026-09-26
- 用昇腾做评测基准?开发者:不想让模型爬这种山 — xeophon · 2026-09-26
- 加拿大皇家银行揭秘 ATOM 大型交易模型,用 agentic 工作流接入 LLM — VectorInst · 2026-09-26
- Vector 研究员 Kelsey Allen 用 3DSPA 让生成视频更像物理世界 — VectorInst · 2026-09-26
- OpenAI 2026 AGI 经济会议:学者呼吁补齐经济任务评测短板 — soumitrashukla9 · 2026-09-26
- 研究:AI 编码隐性组织知识,美国或可收获近一个 GDP 的增益 — soumitrashukla9 · 2026-09-26