冻结 12B 通过验证记忆复用答案,零 token 运行
Corbenci · hf · 2026-07-28
这份报告提出了一条和传统“继续训练更大模型”不同的路线:模型保持冻结,旁边增长的是持久化的已验证记忆。
- 一旦某个问题族通过了独立验证并被存入记忆,之后同类新题就可以在 0 个生成 token 的情况下、以确定性且 bit-exact 的方式直接返回答案。
- 在 9 个问题族、180 个新样例上,4 个来自不同厂商的模型都达到了 180/180。
- 负对照实验显示能力确实来自记忆本身:把存储清空后,系统就无法解题。
- 作者还把这个“先验证、再存储”的机制扩展到开放式推理,给出了 88/88 的一致性门控接收、机器可检形式化证明,以及 77/80 的推理方法迁移结果。
- 系统层面上,记忆检索只要 1.4 微秒,完整复用耗时 6–23 ms,能耗约 36 mWh。
- 报告还强调了一个工程点:单张 46 GB GPU 上实现了 600 万 token 的可移动上下文窗口,而 vLLM 和 SGLang 的实际可用长度都明显更小。
- 作者提供了一个可免费、限流访问的公开测试台。
「Infra」频道最新
- Qwen3.6-27B 量化版先测权重组再压缩 — enginetown · 2026-07-28
- OpenAI 预计 7500 亿美元算力投入,Anthropic 租算力策略承压 — remybigot · 2026-07-28
- AMD、SGLang 和 Moonshot 联动交付,芯片战转向基础设施 — AnushElangovan · 2026-07-28
- 用户称 GPT-5.4、Opus 4.6 和 Kimi k3 已够用 — haider1 · 2026-07-28
- Fast-plate-ocr 用 Keras 3 和 ONNX 做轻量车牌识别 — tom_doerr · 2026-07-28
- ai& 联合 Rebellions 举办主权 AI 与推理研讨会 — DavidBennett__ · 2026-07-28