冻结模型外部存数值记忆:Qwen 到 Mistral 复现,Top-1 命中 99.2%
Nearby_Indication474 · reddit · 2026-10-07
作者在 Qwen2.5-7B-Instruct 上完成 AKBASCORE MAM 后,又在 Mistral-7B-Instruct-v0.3 上独立定位并复现了同一记忆机制:128 条记忆中 Top-1 命中 127 条(99.22%),反事实检索 125/128(97.66%),指针偏移对照组 0/128。全程不改权重、不微调、不加 LoRA、无学习路由器,检索时不给任何金标记忆 ID。
核心思路:
- 模型原生数值记忆:源文本过一遍冻结的 transformer,把其注意力计算产生的 K/V 状态提取为数值记忆结构,而非存储人类可读文本再让模型重读。
- 记忆可外置:该数值结构可存于 RAM、序列化落盘,实现持久化,而模型权重保持冻结。
- 内源注意力指针:新问题到来时,把活跃的数值 A 记忆装入 transformer cache,冻结模型自身的注意力通道(Mistral 上为 L28H00,作者命名为 ÇAĞRIİZ)产生对 A 记忆位置的分布——不是外部路由器,也不是训练出的分类器,就是模型原生的 Q·K 计算。
- K 与 V 分工:K 回答「该看哪里」,V 用于构造 1024 维(8 个 KV 头 × 128 维,L00-V 未中心化)的问题条件化检索地址,再与全部 128 条 B 记忆做最大余弦相似度竞争匹配,全程无文件名或记忆 ID 提示。
作者认为比 99.22% 更有趣的问题是「模型到底在读什么」——这条路径探索的是存储模型自身的机器原生数值状态,而非传统的文本/嵌入检索。
「模型」频道最新
- Perplexity 27B 决策模型 pplx-decider-v1 登上 Hugging Face 趋势榜 — perplexity-ai · 2026-10-07
- 温度设 0 也非确定输出:batch 形状与 kernel 归约顺序都影响 logits — JFPuget · 2026-10-07
- 付费用户炮轰 OpenAI:少搞重置,多回应客户、把模型做好 — AirportEither2456 · 2026-10-07
- 实测:GPT-6-luna 用 API 每 effort 档能多给推理 token — LysandreJik · 2026-10-07
- Bug Hunt 实测:GPT-6.1 Sol 能翻盘修复, Muse 系仍是最便宜主力 — PawelHuryn · 2026-10-07
- 博主自烧订阅算出倍率:SuperGrok 80x、Muse Power 137x 用量杠杆 — PawelHuryn · 2026-10-07