EngramEdit 论文:借 DeepSeek Engram 条件记忆实现 LLM 知识解耦编辑
pmttyji · reddit · 2026-10-09
新论文提出 EngramEdit,利用 DeepSeek Engram 类条件记忆架构(用输入 n-gram 查表学习到的 embedding)实现大模型事实知识的解耦更新,保持 Transformer 主干冻结:
- 难点:同一事实的不同表述会激活不同 n-gram embedding,而共享 embedding 的更新可能波及其他事实
- 方法:先计算让模型在多个表述下都预测出新事实的目标记忆表示,再联合更新共享 n-gram embedding,对高频复用的 embedding 施加更强惩罚以保护无关知识
- 结果:编辑成功率接近完美;更新后的知识可泛化到未见表述和多跳推理,CoT 提示下准确率约为最强基线的 3 倍;随事实更新累积,无关知识与通用能力基本保持
结论:条件记忆可从单纯的扩容手段扩展为可编辑的知识接口。论文、代码与模型均已开源(arXiv 2610.10533,GitHub/HF/项目页齐全)。
所属事件:EngramEdit 论文:条件记忆架构实现 LLM 知识解耦编辑(4 条相关)→
「研究」频道最新
- NYU 与亚马逊论文:蒸馏 6 条精选技能可抵 11 倍大的技能库 — rohanpaul_ai · 2026-10-10
- Apple ML 招博士实习生,攻关高效多模态与视频理解 — CSProfKGD · 2026-10-10
- PostTrain Agent 全自动后训练拿 PostTrainBench 榜首,距人类专家仅差 4.5 分 — jiqizhixin · 2026-10-10
- kissing number 下界刷新:D19-31 多维新纪录开源可验证 — felpix_ · 2026-10-10
- 数学家担忧「问题被解决」定义进步,AI 时代这一隐忧成真 — _onionesque · 2026-10-10
- UIUC×谷歌推出BudgetPix:单模型按图像复杂度自适应算力,token可降至10% — CSProfKGD · 2026-10-10