用可写 n-gram 表给小模型做持久记忆,8GB 显卡的民间实验
Mrinohk · reddit · 2026-09-19
一位开发者受新模型把知识卸载到 n-gram 表的机制启发,尝试用 n-gram 表加运行时回传来实现 LLM 持久记忆——这是模型记忆问题的潜在解法。
目前的实验发现与问题:
- 信息以「问答对」形式存储比直接存事实召回更好
- 记忆写到模型不同层效果不同,但还没找到规律
- 核心问题:记忆块向 residual stream 注入的向量过强时,会让无关输出变得混乱
- 假设是记忆只需在思维链中浮现一次即可,因此可以降低写入强度,让注意力机制完成后续推理
测试用真实数据而非合成数据:用 Qwen3 0.6B 在 8GB 显存的 RX 6600XT 上跑,数据是作者 agent 几个月积累的约 500 组个人 RAG 问答对,目前正在进行记忆增多后旧记忆召回退化的 sweep。作者坦言底层机制由 Opus 5 辅助完成。
「研究」频道最新
- 5 分钟从零训练 9M 参数 LLM,GuppyLM 开源项目火了 — tom_doerr · 2026-09-19
- 3D 生成的「苦涩教训」失效?作者:程序化描述才是关键 — keenanisalive · 2026-09-19
- 现实不是模拟器:为什么自主AI在物理世界难落地 — AlexTensor · 2026-09-19
- Timothy Lee 长文:世界不是棋局,别怕超级智能接管世界 — binarybits · 2026-09-19
- Jev 其实就是只输出一个 token 的 LLM:一篇原理拆解 — saurabhtwq · 2026-09-19
- 机器人 RL 有多难:一次实操复盘列出 KL 项、sim2real、NaN 十余个坑 — Scobleizer · 2026-09-19