改 llama.cpp 内存表,实现 Qwen 知识热插拔注入
ortegaalfredo · reddit · 2026-09-03
- 开发者 ortegaalfredo 研究新一代 Qwen 架构时,把 Ngram PLE(预测查找表)当作长期知识库来用:通过修改 llama.cpp 在内存中实时补丁该表,每次 prompt 时更新,无需重新加载模型即可"热插拔"部分知识。
- 效果与限制:由于 embedding 在较浅层注入,输出难以精确控制,但通过一些技巧可以影响模型输出。
- 开源了两个仓库:llama.cpp 修改版 llama.cpp-NLTM 和生成表补丁的 ngram-knowledge-injector。
- 已知约束:PLE 表需内存映射(默认即如此),目前仅在 q8 量化下测试过,需要较大内存。作者认为这可能是低成本训练的新思路,可用来给模型加即时可换的长期记忆。
「编程与Agent」频道最新
- 点云解谜游戏走红:vibecoding 从零复刻很难,品味仍不可替代 — teortaxesTex · 2026-09-03
- 开源 TrueForge 对比 Claude 管理代理:同模型同准确率省 63% token — Background-Job-862 · 2026-09-03
- Magnitude 开源推理服务器:本地模型直接接入你现有的编码 Agent — magnitudedev · 2026-09-03
- 2.9 千星开源工具:用 LLM 从非结构化文本生成交互式知识图谱 — tom_doerr · 2026-09-03
- 开源 Open Notebook:3 万星本地版 NotebookLM,支持 4 人播客 — JafarNajafov · 2026-09-03
- AFK Pilot Cloud 上线:5 美元月租跑你的 AI 编程智能体 — PawelHuryn · 2026-09-03