MemoryAthena:让模型学会何时用"生成记忆"修正直接检索
OLAResearchX · hf · 2026-09-24
OLAResearchX 发布论文 MemoryAthena,研究"记忆"能否被生成而非仅被检索。方法设三条通路:直接检索 Engram(E)、由检索线索生成(GE)、不查记忆表直接由因果骨干状态生成(GH)。生成记忆并非总有益——某个语境下能补充 E,另一个语境下反而干扰。
因此 MemoryAthena 以 E 为锚点,在骨干、记忆表、生成器与读取器全部冻结的条件下,仅用约 201M 参数的轻量因果路由头,基于反事实未来 token 似然优势训练"何时介入、介入多强";推理时候选通过有界插值修改 E 残差,被拒则精确退回直接通路。问答任务五项平均分从 37.65 提升至 39.28,通用 NLP 六项平均从 76.73 升至 79.13。分析显示三条通路各有互补优势,核心挑战在于路由决策。
「研究」频道最新
- Claude「发现新酶」遭 CRISPR 研究者打脸:950 个 Agent、2.1 亿 token 被指夸大 — basedjensen · 2026-09-24
- Whisper 编码器剪枝 6 层,无标注蒸馏恢复 WER 至 20.1% — Rasmus Aagaard · 2026-09-24
- MaD-RL 作者补充:只最大化奖励无法指定目标输出混合比例 — nagpalchirag · 2026-09-24
- arXiv 论文附 Astra 生成的配套草稿,量子编码研究现 AI 共著现象 — IgorCarron · 2026-09-24
- ICLR 审稿人感叹:投标清单上一半摘要疑似 AI 生成 — miniapeur · 2026-09-24
- 训练不起前沿模型,开源 AI 能否靠「小模型组合」追赶? — WebAssemblyMan · 2026-09-24