数值记忆法跨三架构验证:DeepSeek-V2-Lite 仅 2.58 MiB 答对 69/72
Nearby_Indication474 · reddit · 2026-10-11
作者将自研的 AKBASCORE MAM(source-free 数值记忆:读一次原文、写入数值记忆、巩固后无需回喂原文即可答题)应用到第三个 Transformer 家族 DeepSeek-V2-Lite-Chat,并对比了此前在 Mistral 和 Qwen 上的实现。
- 核心原则:append-only 巩固 + source-free 数值记忆,全程冻结模型权重
- 三组结果:Mistral-7B(93 个记忆 token,11.62 MiB,72/72);Qwen2.5-7B(82 个,4.48 MiB,72/72);DeepSeek-V2-Lite(87 个,2.58 MiB,69/72)
- 最大架构差异是 DeepSeek 的 MLA:压缩的 512 维 cKV 加 64 维旋转 key,替代常规 K/V cache,因此热图形态不同(共享 28-token 指令前缀内的深蓝竖带只是低数值范数,非记忆损坏)
- 3 个失败案例已在 TEST597 中记录并复现,尚无修复方案;2.58 MiB 主要反映 MLA 压缩架构而非 MAM 带来的压缩收益
- 结论:MAM 机制可在三种不同 Transformer 实现下工作,但不构成普适兼容性证明
- 代码、执行日志与 DOI 均已公开
「研究」频道最新
- ETH 与 Google 发布 DiskChunGS:磁盘分块调度实现公里级 3DGS SLAM — rsasaki0109 · 2026-10-11
- Niels Rogge 整理 GPT-6 Astra 机器人研究合集:论文、博客与评测 — NielsRogge · 2026-10-11
- 112 个 bug:LLM 过得了概念验证,却过不了开发者自己的测试 — lulzxdxdxd · 2026-10-11
- 实验室自动化困局:长尾实验跑不动,扼杀创新 — anshulkundaje · 2026-10-11
- AI 论文洪水冲垮 arXiv:2026 年 10 月起每人每月限投 2 篇 — The Decoder · 2026-10-11
- 研究警示:engram/n-gram 方法在数据重复下或显著加剧过拟合 — SonglinYang4 · 2026-10-11